后训练(数据/算法)研究员

DeepSeek

岗位职责

】 1.持续迭代与优化强化学习算法,在预训练模型与数据既定的条件下,最大限度地释放模型潜力。 2.跨部门团队紧密协作,构建高质量、高多样性的后训练数据集;设计并落地自动化数据清洗、评测及合成管线,系统性提升模型在写作、问答、Agent 等核心场景的表现。 3.建立科学、敏捷、多维度的模型能力评测体系,覆盖通用能力与 Agent 场景,精准定位模型短板并驱动针对性优化。 【

任职要求

】1.对大模型后训练有深入理解,熟悉 RLHF / RLVR / PPO / GRPO 等主流强化学习框架与范式,具备从算法设计到工程落地的完整经验。2.具备扎实的数据直觉与工程能力,能够从复杂、多源的数据中提炼信号,并将数据清洗、筛选与合成流程系统化、自动化。3.对模型评测有方法论层面的思考,不满足于"刷benchmark",而是能设计出真正反映模型能力边界与短板的评测方案。 【团队使命】 通过高质量后训练数据与前沿算法,最大化释放Base模型潜能,打造兼具强大智能与深度意图理解力的AI模型。使得模型既能解决最难的问题,也能读懂每一个意图,更能作为自主Agent在复杂真实世界中可靠地行动。 【岗位类别】:实习/全职 【工作职责】 1.持续迭代与优化强化学习算法,在预训练模型与数据既定的条件下,最大限度地释放模型潜力。 2.跨部门团队紧密协作,构建高质量、高多样性的后训练数据集;设计并落地自动化数据清洗、评测及合成管线,系统性提升模型在写作、问答、Agent 等核心场景的表现。 3.建立科学、敏捷、多维度的模型能力评测体系,覆盖通用能力与 Agent 场景,精准定位模型短板并驱动针对性优化。 【
岗位信息来源于公开招聘渠道,仅作信息聚合展示。收录于 2026/7/23岗位编号 deepseek_campus-5d75f4cd-f626-4f73-80c1-e53b2073de76