强化学习算法工程师
均普智能
岗位职责
1.参与RL算法在工业任务中的应用:抓取泛化、装配策略、多机协作;
2.设计高效数据采集流程(仿真+真机),构建课程学习训练框架;
3.优化模型部署:模型压缩、推理加速,支持在边缘设备实时推理;
4.与仿真/运控团队紧密协作,建立“训练-仿真-真机验证”闭环。
任职要求
1.硕士及以上学历,人工智能、计算机、自动化等相关专业;
2.深入理解DQN、PPO、SAC等主流RL算法,能复现经典论文;
3.熟练使用PyTorch,有Lerobot/RLlib/Stable Baselines3等框架实践经验;
4.具备扎实的数学基础(概率论、优化理论)与代码工程能力。