大模型训练工程专家-稳定性方向

MiniMax

北京 / 上海全职MiniMax社会招聘社招

岗位职责

一、一句话定位 为大模型「预训练 + 后训练」的基础设施稳定性与效率负总责的资深工程师——横向拉通 GPU 算力、RDMA 网络、通信库、高性能存储、集群调度、训练任务生命周期等多个技术域,确保大规模训练不中断 / 少中断,并持续把有效训练算力(MFU / ETTR)做上去。 二、为什么这个岗位重要 大模型训练是公司最核心、最烧算力的战役。训练稳定性直接决定旗舰模型能否按期炼成。 这是一个端到端 Owner 岗,不是分工到某个组件的螺丝钉——你对"训练能不能稳、跑得快不快"这个结果负责,向上直面算法 / 训练团队的真实诉求。 你将有从 0 到 1 搭建训练稳定性体系的空间:可观测、故障自愈、预案、效率工程,都还有大片可建设的地带。 三、你将负责什么(职责) 1. 训练全栈基础设施保障(横向拉通,核心) GPU 算力:GPU 机器交付与健康管理、坏卡 / 掉卡 / 降频的检测与自愈、节点池管理与快速置换。 RDMA / 高性能网络:IB / RoCE 网络的稳定性与拓扑感知;网络抖动 / 丢包 / 降速的定位与消除。 网络通信库:NCCL(及同类)通信的调优与故障定位——hang、慢 all-reduce、拓扑不亲和等问题的根因排查。 高性能存储:训练数据与 checkpoint 的高吞吐存储链路(并行文件系统 / 对象存储 / 缓存加速),保障读写不成为训练瓶颈。 集群调度:大规模训练作业调度(gang scheduling、拓扑感知、抢占与配额)、故障容错与弹性伸缩。 训练任务生命周期:任务启动、断点续训(checkpoint / restart)、故障后的快速恢复与自动拉起。 2. 训练稳定性工程(把"不中断 / 少中断"做成体系) 建设训练专属可观测:训练指标 + 硬件健康 + 慢节点 / 掉队者(straggler)检测,做到问题可发现、可定位。 建立故障自动发现 → 定位 → 自愈 / 快速恢复的闭环,压低 MTTR;沉淀事故复盘与标准预案。 以 ETTR / 有效训练时长 / 中断次数等为北极星指标,量化并持续改善训练稳定性。 3. 训练效率工程(把 MFU / 吞吐做上去) 定位并消除训练瓶颈(通信 / IO / 计算 / 调度),与算法 / 框架团队协同提升 MFU、扩展效率与吞吐。 4. 深入训练框架层(能跟算法 / 训练团队讲同一种语言) 理解 Megatron-LM / DeepSpeed 等分布式训练框架的并行策略(数据 / 张量 / 流水 / 序列并行)、通信模式、checkpoint 机制;能把框架层暴露的问题接住、翻译成基础设施侧的改进。

任职要求

我们期望你具备(任职要求) 1. 5 年以上相关经验,且有**大规模 GPU 集群(千卡级及以上)**训练稳定性 / AI Infra 的一线实战。 2. 在以下方向中至少 2–3 个有真深度(能讲清原理、权衡、踩过的坑):RDMA / 高性能网络、NCCL 等通信库、并行 / 高性能存储、大规模作业调度、GPU 集群运维与故障处理。 3. 懂分布式训练原理与框架(Megatron / DeepSpeed 至少其一),理解并行训练中常见的 hang / 慢 / OOM / 掉队 的成因与定位手段。 4. 扎实的编程与工程化能力(Python / Go / C++ 至少一门过硬)——SRE 是"用代码和自动化消灭重复劳动、造平台 / 工具"的角色,不是纯 oncall 运维。 5. 成熟的稳定性方法论:SLO / 可观测 / 根因分析 / 先止损再定位,有体系而非靠蛮力重启。 6. 强 Owner 意识与跨团队协同:能端到端扛事、兑现承诺,能和算法 / 训练 / 网络 / 存储多方拉通,并把"我做的事值多少"讲清楚。 加分 NCCL / 通信库源码级理解,或 GPU kernel / 性能 profiling 经验。 故障预测、弹性 / 容错训练、超大规模(万卡级)训练稳定性经验。 训练框架二次开发 / 相关开源社区贡献。 对 AI / 大模型有强烈兴趣与持续学习倾向(AI Native)。
岗位信息来源于公开招聘渠道,仅作信息聚合展示。收录于 2026/7/23岗位编号 minimax_social-7657839836636743977