多模态理解(数据/算法)研究员

DeepSeek

岗位职责

】1.负责多模态基座模型的迭代。探索视觉编码器和 VLM 的结构、训练策略和评测方式,针对多模态场景持续验证和迭代预训练与后训练(SFT / RL / OPD)算法。2.负责多模态理解数据体系构建。定义图文/视频数据集的采集方式、质量标准和筛选方法,多部门协作建设大规模自动化清洗、质量筛选与数据合成管线,从数据侧提高模型表现。3.针对通用问答、文档/图表解析、多模态推理等基础多模态场景,进行针对性的数据收集、模型训练和精细化调优。4.推动 GUI、白领办公、多模态搜索等场景的多模态 Agent 核心能力建设与落地。5.搭建面向“用户真实体验”的多维度多模态评测体系。从定义评测维度、收集真实数据、数据标注到模型反馈,定位模型短板,指引模型迭代。【核心要求】(满足其一即可):1.深入理解主流视觉编码器(如 CLIP, SigLIP 等)的模型结构,熟悉其训练与评测方法。2.熟悉主流多模态模型的架构,具备大规模多模态预训练或后训练(SFT/RL/OPD)实战经验。3.具备极强的数据直觉,有大规模图文/视频数据清洗、质量标注及数据合成的实战经验。具备一定的工程代码能力。4.主导和交付过多模态某个垂直领域(包括但不限于 OCR、Image Caption、空间理解、通用 QA、用户意图理解或 Agent 场景)的模型训练与数据迭代。5.深入研究过多模态模型评测体系建设,不满足于依赖公开榜单,有独立设计人工评测或自动评测流程的经历。6.即使没有上述特定经验,只要基础特别扎实、代码能力极强、对多模态有极致渴望,我们也欢迎。【加分项】1.有行业影响力的高引论文或知名项目贡献。2.对模型自身真实能力的提升有极致追求,反感且不愿意通过“刷榜”来换取指标的虚假繁荣。3.对多模态模型的技术发展趋势和应用场景有深刻洞察。 【团队使命】 AGI 绝不会止步于文本,迈向 AGI 的关键一环,在于让模型拥有理解物理世界的能力。我们的使命,是为 AI 注入“看懂并理解世界”的多模态灵魂,让模型在面对复杂的真实世界时,依然能展现出精准的感知与推理能力。在这里,你将会挑战多模态领域的本质难题:处理海量且充满噪声的多模态数据,设计底层的高效原生模型架构,探索大规模训练策略,建立反映真实需求的评测基准。跨越数据、架构、训练与评测的全链路,让多模态成为解决现实挑战的核心生产力。 【岗位类别】:实习/全职 【工作方向】 覆盖多模态理解基座模型全链路,包含:视觉编码器优化 / 多模态预训练 / 多模态后训练 / 评测体系建设(候选人可选其中1个或多个方向)。 【

任职要求

意图理解或 Agent 场景)的模型训练与数据迭代。5.深入研究过多模态模型评测体系建设,不满足于依赖公开榜单,有独立设计人工评测或自动评测流程的经历。6.即使没有上述特定经验,只要基础特别扎实、代码能力极强、对多模态有极致渴望,我们也欢迎。【加分项】1.有行业影响力的高引论文或知名项目贡献。2.对模型自身真实能力的提升有极致追求,反感且不愿意通过“刷榜”来换取指标的虚假繁荣。3.对多模态模型的技术发展趋势和应用场景有深刻洞察。 【团队使命】 AGI 绝不会止步于文本,迈向 AGI 的关键一环,在于让模型拥有理解物理世界的能力。我们的使命,是为 AI 注入“看懂并理解世界”的多模态灵魂,让模型在面对复杂的真实世界时,依然能展现出精准的感知与推理能力。在这里,你将会挑战多模态领域的本质难题:处理海量且充满噪声的多模态数据,设计底层的高效原生模型架构,探索大规模训练策略,建立反映真实需求的评测基准。跨越数据、架构、训练与评测的全链路,让多模态成为解决现实挑战的核心生产力。 【岗位类别】:实习/全职 【工作方向】 覆盖多模态理解基座模型全链路,包含:视觉编码器优化 / 多模态预训练 / 多模态后训练 / 评测体系建设(候选人可选其中1个或多个方向)。 【
岗位信息来源于公开招聘渠道,仅作信息聚合展示。收录于 2026/7/23岗位编号 deepseek_campus-7dcd6fde-84f1-4deb-890c-f1f275df0efc