预训练数据工程师

DeepSeek

岗位职责

】 1.全网数据选取策略设计开发 (1)根据数据清洗反馈信号设计全网数据选取、调度系统,包括链接质量预估、属性聚合、站点抓取配额、数据优先级等,保证数据多样性,最大化数据覆盖,为模型训练提供丰富的世界知识。 (2)面向 RAG 等时效场景,负责时效性种子挖掘、调度与有效性验证,保障关键信息的新鲜度。 2.全网数据采集环路 (1)负责全网数据采集环路的设计与开发,包括但不限于下载、任务调度、流式数据处理、DNS、连通性等核心组件,构建高吞吐、可容错的分布式采集系统。 3.链接规模控制 (1)通过识别低质站群、重复镜像站点、清洗 URL 冗余参数、规范化链接等手段,控制链接规模、去除重复与噪声,提升链接库的有效性与数据纯净度。 【

任职要求

】1.计算机相关专业。2.扎实 Rust/C++/Python 编程能力。3.扎实的工程能力与系统功底,深刻理解计算机组成、操作系统与计算机网络。4.深入理解分析型数据处理引擎的计算和数据存储格式。5.能灵活运用文献和开源项目中数据库系统的常见范式和经验。【加分项】1.有大规模存储、分布式 KV、数据库或数据湖、分布式数据处理框架的设计/研发/运维等经验。2.在高水平系统会议论文上发表过论文。 【团队使命】 预训练数据开采自人类世界全部已有知识所沉积的富矿,是驱动模型强大能力的核心燃料。 预训练数据团队围绕大模型预训练,构建了从数据采集、清洗处理到底层基础设施的完整数据体系,持续为模型训练输送高质量、规模化、多模态的数据燃料,不断拓展模型的世界知识边界。 如何寻找蒙尘的富矿,并淘洗炼制成可用的智能燃料,是一门极难的硬功夫。我们以亿万数据筑就模型智能的坚实底座,更要用普惠的方式,把这份属于全人类的财富,重新还给全人类。 招聘方向【实习/全职】:数据采集 pipeline 方向、语言数据处理方向、多模态数据方向、数据基建方向。 数据采集 pipeline 方向 【
岗位信息来源于公开招聘渠道,仅作信息聚合展示。收录于 2026/7/23岗位编号 deepseek_social-8a4c2868-599d-40db-be4d-ab58eec5d7e1