强化学习专家

均普智能

岗位职责

算法创新与智能决策 设计面向复杂工业环境的强化学习算法,解决样本效率低、探索-利用权衡、稀疏奖励、多目标优化等关键问题; 探索基于模型(Model-based RL)、分层强化学习(HRL)、元强化学习(Meta-RL)、逆强化学习(JRL)等前沿方向的技术融合与改进。 结合大规模技术,研究语言驱动器化学习(Language-guided RL)、世界模型(World Models)等跨模态决策框架。 大规模强化学习系统构建 构建分布式强化学习训练框架,优化并行采样、离线强化学习(Offline RL)与在线学习的混合训练机制。 开发高效仿真环境与智能体交互接口,支持高保真物理模拟、多智能体协同训练及超长序列决策任务。 设计自适应奖励函数与课程学习(Curriculum Learning)策略,加速智能体在复杂场景中的能力进化。 前沿探索与跨领域研究 研究多智能体强化学习(MML)中的合作与竞争机制,解决非静态环境、信用分配、通信效率等领域。 探索强化学习与神经符号系统(Neuro-symbolic AI)、因果模型的结合,提升决策的可解释性与鲁棒性。 构建强化学习安全与伦理保障体系,设计对抗攻击防御、风险敏感策略与公平性约束机制。

任职要求

计算机科学、控制理论、运筹学或相关领域博士学历。技术能力:精通强化学习经典算法(DQN、PPO、SAC、TD3)及最新进展(如Decision、 Transformer、DreamerV3)、逐步OpenAI、 Gym、MuJoco、Isaac Sim等工具链。具有大规模分布式训练经验(Ray、RLLib等框架),熟悉离线强化学习、模仿学习与sim2real技术。在算法层有深度实践:稀疏奖励优化、多智能体协同、元学习与快速适应 职位定位: 人工智能与人形机器人研究院强化学习方向负责人,负责突破复杂决策场景下的算法瓶颈,推动强化学习(RL)在工业领域的技术落地,构建具备自我进化能力的智能系统,赋能全链条业务场景。
岗位信息来源于公开招聘渠道,仅作信息聚合展示。发布于 2026/7/20岗位编号 ksh_688306_ksh688306_social-d1c6c266-1da0-4c48-b96b-6bffc6d0