后训练(数据/算法)研究员
DeepSeek
岗位职责
】
1.持续迭代与优化强化学习算法,在预训练模型与数据既定的条件下,最大限度地释放模型潜力。
2.跨部门团队紧密协作,构建高质量、高多样性的后训练数据集;设计并落地自动化数据清洗、评测及合成管线,系统性提升模型在写作、问答、Agent 等核心场景的表现。
3.建立科学、敏捷、多维度的模型能力评测体系,覆盖通用能力与 Agent 场景,精准定位模型短板并驱动针对性优化。
【
任职要求
】1.对大模型后训练有深入理解,熟悉 RLHF / RLVR / PPO / GRPO 等主流强化学习框架与范式,具备从算法设计到工程落地的完整经验。2.具备扎实的数据直觉与工程能力,能够从复杂、多源的数据中提炼信号,并将数据清洗、筛选与合成流程系统化、自动化。3.对模型评测有方法论层面的思考,不满足于"刷benchmark",而是能设计出真正反映模型能力边界与短板的评测方案。
【团队使命】
通过高质量后训练数据与前沿算法,最大化释放Base模型潜能,打造兼具强大智能与深度意图理解力的AI模型。使得模型既能解决最难的问题,也能读懂每一个意图,更能作为自主Agent在复杂真实世界中可靠地行动。
【岗位类别】:实习/全职
【工作职责】
1.持续迭代与优化强化学习算法,在预训练模型与数据既定的条件下,最大限度地释放模型潜力。
2.跨部门团队紧密协作,构建高质量、高多样性的后训练数据集;设计并落地自动化数据清洗、评测及合成管线,系统性提升模型在写作、问答、Agent 等核心场景的表现。
3.建立科学、敏捷、多维度的模型能力评测体系,覆盖通用能力与 Agent 场景,精准定位模型短板并驱动针对性优化。
【