面向工业界Agent的强化学习后训练研究
京东
岗位职责
1、 开展复杂Agent场景下的强化学习算法研究,攻坚多轮工具调用与长链路决策核心痛点,涵盖稀疏奖励建模、信用分配(Credit Assignment)及策略优化稳定性等;
2、 探索并落地适用于Agentic场景的新型RL(强化学习)算法,推动前沿技术在工业界的真实业务中落地;
3、 深度挖掘京东海量用户行为日志(涵盖购买、加购、点击等),设计面向转化目标的多粒度Reward信号体系,将真实用户反馈转化为模型优化信号;
4、 构建与完善面向工业界Agent的系统性评测体系,以多维度的评测数据驱动底层算法能力的持续迭代与升级。
任职要求
1、 获得本科及以上学历,计算机、人工智能等相关专业;
2、 具备扎实的强化学习理论基础,熟练掌握PPO、GRPO、DPO等主流对齐与强化学习算法;
3、 具备大语言模型(LLM)后训练实践经验,熟悉SFT、RLHF或RLAIF等核心技术流程;
4、 具备Agent训练、工具调用(Tool-use)或多步推理相关的实战经验,或在相关AI顶级会议有高质量论文发表记录;
5、 熟练使用PyTorch深度学习框架,具备大规模分布式训练的实际工程经验。