具身后训练/强化学习算法工程师
均普智能
岗位职责
1.负责具身策略模型的后训练方法研究与工程实现,覆盖 SFT、模仿学习、行为克隆、DAgger、离线强化学习、在线强化学习、RLFT、偏好优化和奖励建模等方向。
2.面向机器人操作任务设计策略优化方案,包括抓取、放置、推拉、插拔、开关门/抽屉、上下料、多步骤操作和长程任务等场景。
3.研究基础策略模型到具体任务技能的适配路径,探索如何通过任务数据、失败样本、奖励信号、评测反馈和在线交互提升模型表现。
4.负责机器人策略学习中的数据使用策略,包括轨迹筛选、成功/失败样本分析、正负样本构造、hard case mining、数据重加权、数据混合和课程学习。
5.设计奖励函数与奖励建模机制,包括任务完成奖励、过程奖励、安全约束、接触质量、动作平滑性、轨迹效率、碰撞惩罚和人为偏好反馈等。
6.研究离线到在线的策略迭代方法,探索如何在离线数据预训练基础上,通过仿真交互、真机小规模试验或评测反馈进行安全有效的策略提升。
7.负责策略评测体系设计,定义任务成功率、稳定性、泛化能力、动作质量、安全性、恢复能力、长程任务完成率等指标,并建立回归评测流程。
8.分析机器人任务失败原因,区分数据问题、模型问题、动作空间问题、感知问题、控制问题、场景分布问题和评测定义问题,并提出改进方案。
9.与数据、仿真、机器人软件、部署和评测团队协作,打通策略训练、仿真验证、真机测试、失败样本回流和模型迭代流程。
10.跟踪具身智能后训练、机器人强化学习、offline-to-online RL、VLA/RDT/策略模型微调、World Model/Action Model、偏好优化和自动评测等前沿方法,并评估其落地可行性。
11.输出实验设计、训练配置、模型对比、失败分析、消融实验和方法总结,沉淀可复用的策略迭代方法和实验规范。
12.推动有效算法方法工程化,包括训练脚本、数据接口、奖励接口、评测接口、实验追踪、模型版本管理和复现实验环境建设。
任职要求
1.硕士及以上学历,强化学习、机器学习、机器人、人工智能、自动化、计算机等相关方向;优秀本科候选人如具备扎实项目经验也可考虑。
2. 2 年以上强化学习、模仿学习、机器人学习、策略优化、多模态模型后训练或相关方向研发经验;有真实机器人或仿真机器人任务经验者优先。
3.熟悉机器人策略学习基本范式,包括行为克隆、SFT、DAgger、离线 RL、在线 RL、RLFT、奖励建模、偏好优化、轨迹优化等方法。
4.熟悉 PPO、SAC、TD3、IQL、CQL、DPO、GRPO、RLOO、RECAP、RLT、DAgger 等方法中的至少部分,能够根据任务特点判断方法适用边界,而不是只会套用算法。
5.熟悉 PyTorch 及深度学习训练工程,具备独立实现训练流程、调试模型、分析 loss/metric、管理实验和复现实验结果的能力。
6.理解机器人数据特点,包括多模态观测、动作序列、时序对齐、状态反馈、末端位姿、关节控制、夹爪状态、接触信息、任务结果和 episode 级数据组织。
7.理解机器人动作空间和控制约束,能够分析连续动作、离散动作、末端控制、关节控制、轨迹生成、动作平滑、安全边界和控制频率对策略学习的影响。
8.具备系统实验能力,能够围绕一个任务设计训练方案、评测指标、对照实验、消融实验和失败归因,而不是只关注单次训练结果。
9.具备较强问题诊断能力,能够判断任务失败来自数据分布不足、奖励设计不合理、模型容量不足、观测缺失、动作空间不匹配、sim-to-real gap 或部署链路问题。
10.有具身基础模型、VLA、RDT、Diffusion Policy、ACT、World Model、Action Model、多模态策略模型或机器人大模型相关经验者优先。
11.有 Isaac Lab、MuJoCo、ManiSkill、LIBERO、RLBench、Gymnasium、Robosuite、LeRobot、RLlib、verl、OpenRLHF、RLinf 等工具或框架经验者优先。
12.有仿真到真机迁移、真实机器人在线学习、安全探索、失败样本回流、自动评测或策略部署经验者优先。
13.具备良好的论文跟踪和方法复现能力,能够判断前沿方法是否适合当前任务,并将研究方法转化为可验证的工程实验。
14.具备良好的沟通协作能力,能够与数据、仿真、机器人软件、推理部署和评测团队共同推进策略迭代闭环。