AI算力集群性能与可靠性工程师
DeepSeek
岗位职责
AI算力集群性能与可靠性工程师
运维
运维
|
浙江·杭州市
浙江·杭州市
【团队使命】AGI 时代的竞争,本质上也是大规模算力系统性能与可靠性的竞争。这里不是简单地维护机器,而是在参与建设 AGI 时代的核心基础设施。团队的价值,是让巨大而复杂的 AI 超算集群成为稳定可靠的生产力,让模型的每一次训练和推理都建立在坚实可靠的算力底座之上。【岗位类别】:实习/全职【我们在找什么样的人】如果你对实现AGI这件事有强烈的兴趣和好奇心——不是因为风口热,而是你真的觉得"造出通用人工智能"是这个时代最值得投入的事情——那我们想认识你。我们不太在意你过去有没有运维经验,也不太在意你是不是科班出身。我们在意的是: 当一个复杂问题摆在面前,边界模糊、文档缺失、没人知道答案的时候,你是退缩等别人解决,还是兴奋地冲上去拆解它、搞定它?如果你现在不会GPU调度、不懂Kubernetes、没写过监控脚本——没关系。AGI本身就是人类从未走过的新路,没有人"有经验"。我们愿意和有热情、有潜力的人一起,从零到一建设AGI时代的基础设施。【你将要面对的挑战】这不是一个"按手册操作"的岗位。你会面对很多前人从未走过、文档也没写过的事情:1.守护"吞金兽"——让十万卡集群像一台电脑一样稳定:AI超算集群里满是最前沿的加速卡、服务器和超节点,它们是大规模模型训练的命脉。你负责这些基础设施的全生命周期管理——从日常巡检、硬件维修,到故障定位与硬件置换。(1)大模型训练动辄数周,十万张卡中的任何一张掉线、任何一个节点宕机,都可能让海量算力白白蒸发。而在十万卡的规模下,硬件故障不是"万一"会发生的事,而是"每时每刻"都在发生的事——你面对的不是"是否会坏",而是"坏了之后怎么办"。(2)你的核心目标只有两个:持续缩短MTTR(平均故障恢复时间),以及每次故障都交出根因分析,而不是一句"重启就好了"。(3)我们不在意你现在能不能背出某型号GPU的故障代码表,但我们要求你:面对一张"卡掉了"的模糊现象,知道从哪里开始查、怎么一步步逼近真相。 在十万卡规模下,这种能力不是锦上添花,是生死线。2.让新算力"开箱即巅峰"——高质量交付每一批资源:新一代计算资源到货不是插上电就能用的。你需要独立完成新节点的基线检查、性能调优与生产验证,确保每一台新上线的机器都以最佳状态投入战斗。在十万卡集群中,新节点交付是持续进行的,每一批的质量都直接影响整体算力输出。(1)你要回答的问题是:"这批新卡的理论峰值是多少?我们实际跑到了多少?差距来自硬件、驱动、网络还是配置?"(2)我们不考你"会用什么工具做benchmark",而是在意你能不能设计一套验证流程,让"性能是否达标"这件事有数据可依、有标准可判。3.把"黑盒"变透明——让集群健康实时可见:十万卡级的大模型训练是一个巨大的黑盒,规模越大,透明度越重要。你负责建设和优化面向AI超算集群的监控、告警与可观测性体系,让这个黑盒被彻底打开。(1)每一帧GPU利用率的波动、每一次NCCL通信的延迟抖动、每一次checkpoint保存的耗时变化,都必须在你的视野之内——而在十万卡规模下,这些信号的数量级是前所未有的,你需要懂得降噪,知道哪些告警值得看、哪些可以忽略。(2)我们要的不是"把Prometheus装起来就行"。我们要的是:当集群即将出问题的时候,告警先于业务投诉到达;当问题发生后,你能快速回答"为什么"。(3)我们不问你用过哪些监控工具,而是问:如果只给你3个核心指标来判断集群整体健康度,你选哪三个?为什么选它们?4.用自动化替代人工——让集群自己救自己:十万卡集群的运维不能靠堆人。当故障发生的频率远超人工响应的速度,唯一的出路是让机器自己修复自己。你需要构建自动化运维工具链,把常见故障的诊断和修复固化成代码,让集群具备故障自愈能力。(1)目标很朴素:让值班工程师不再被半夜的报警电话吵醒。 在十万卡规模下,如果每张卡每年发生一次故障,平均每天就有近三百个故障需要处理——没有任何团队能靠人工扛住这个量级。(2)我们不问"你用Ansible还是SaltStack",我们关心的是:你设计的自动化方案,能把人工干预减少多少?它能覆盖哪些故障场景?它的边界在哪里?当自动化判断错误时,代价是什么?【我们提供的机会】这不是一个"螺丝钉"岗位。你入职的第一天,就会被放在最重要的业务场景上,承担最复杂的任务。不会让你从修机器、装系统、写日报开始。你会直接面对大模型训练与推理中最棘手的稳定性与性能问题——十万卡集群的故障定位、新算力性能调优、可观测性体系从0到1的建设。这些问题直接影响AGI的研发进度,而我们希望你从一开始就成为解决它们的人。我们相信:把最重要的事情交给新人,新人才能快速成长为核心。 这不是风险,这是我们选择的管理方式。【我们期待的素质(而非"经验要求")】1.对AGI的真实热情:不是为了高薪或风口而来,而是真的觉得"造出AGI"这件事值得你投入数年的时间。2.拆解问题的逻辑能力:遇到模糊的故障("训练变慢了""有张卡掉了""新节点性能不达预期"),你能把它拆成可验证的假设,一步步缩小范围,而不是靠直觉乱试。3.系统性的技术视野:脑子里有从"加速卡→NVLink→网卡→存储→调度→上层框架"的完整地图,知道数据怎么流动、瓶颈可能在哪。性能调优不是拍脑袋,是逐层排查。4.清晰的表达能力:能把复杂的技术问题,用简单清晰的语言讲清楚——包括写故障报告、画架构图、和跨团队沟通。5.动手的冲动:看到一个新工具/新框架,第一反应是"拉下来跑一跑",而不是"先看看文档再说"。我们想听你踩过的坑,不想听你背诵的文档。6.对生产环境的敬畏:每次变更前本能地想好"怎么回滚",每次事故后都能沉淀一份根因分析——不是应付流程,是真的想让自己和团队不再犯第二次。【以下内容供参考(不是硬性门槛)】如果你恰好有一些技术基础,可能会让你的初期探索更顺畅一些——但我们不会因为你不具备某一条而拒绝你,也不会因为你全部具备而录取你。素质优先。1.熟悉Linux操作系统,理解进程、内存、文件系统、网络的基本原理。2.接触过容器化技术(Docker/Kubernetes),理解Pod、调度、资源配额等概念。3.了解PyTorch/TensorFlow的基本工作方式,能看懂常见的报错信息。4.会用Python或Shell写脚本解决重复性劳动。5.对RDMA/InfiniBand/GPU架构或性能调优有了解(加分,但不是必须)。【我们能提供什么】1.最重要的岗位:你不会从边角料做起,第一天就面对最核心的挑战——十万卡集群的稳定性、新算力性能调优、可观测性体系建设、自动化自愈。2.极快的成长速度:因为你要解决的问题足够复杂,而且是AGI时代才出现的全新问题,你的能力会被快速拉伸,从硬件到网络到调度到上层框架,你会建立完整的系统视野。3.技术自由:用什么技术栈由问题决定,而不是由"公司标准"决定。我们鼓励尝试新工具、新方案,你构建的自动化工具链会成为团队的核心资产。4.与优秀的人同行:团队里有一群和你一样对AGI充满热情的人,你们会一起踩坑、一起填坑、一起成长。【面试流程说明】我们的面试不考记忆、不考背诵、不考"你用过XX几年"。我们会让你:1.讲一个你真正动手做过的事情(任何领域都可以,不一定是技术),追问"为什么这么做","有没有想过其他方案"。2.面对一个你没见过的故障场景,观察你的推理路径是否清晰——比如"训练突然变慢了,你怎么查","新上线的这批卡跑不到理论峰值,你怎么排查","在十万卡规模下,如果监控系统自己扛不住了怎么办"。3.聊聊你对AGI的理解和想象——这不是考你,是想确认我们是不是同路人。我们希望面试是一场双向的技术对话,而不是一场单向的技术考试。【最后】如果你觉得自己经验不够、背景不匹配,但逻辑清晰、爱琢磨、对AGI底层技术充满好奇——请一定投递我们。我们相信,素质到位了,技术只是时间问题。 而AGI这条路,本来就没有人"有经验"。我们需要的是愿意一起走进无人区的同行者,而不是只会按手册操作的熟练工。
【团队使命】
AGI 时代的竞争,本质上也是大规模算力系统性能与可靠性的竞争。这里不是简单地维护机
任职要求
器,而是在参与建设 AGI 时代的核心基础设施。团队的价值,是让巨大而复杂的 AI 超算集群成为稳定可靠的生产力,让模型的每一次训练和推理都建立在坚实可靠的算力底座之上。
【岗位类别】:实习/全职
【我们在找什么样的人】
如果你对实现AGI这件事有强烈的兴趣和好奇心——不是因为风口热,而是你真的觉得"造出通用人工智能"是这个时代最值得投入的事情——那我们想认识你。
我们不太在意你过去有没有运维经验,也不太在意你是不是科班出身。我们在意的是: 当一个复杂问题摆在面前,边界模糊、文档缺失、没人知道答案的时候,你是退缩等别人解决,还是兴奋地冲上去拆解它、搞定它?
如果你现在不会GPU调度、不懂Kubernetes、没写过监控脚本——没关系。AGI本身就是人类从未走过的新路,没有人"有经验"。我们愿意和有热情、有潜力的人一起,从零到一建设AGI时代的基础设施。
【你将要面对的挑战】
这不是一个"按手册操作"的岗位。你会面对很多前人从未走过、文档也没写过的事情:
1.守护"吞金兽"——让十万卡集群像一台电脑一样稳定:AI超算集群里满是最前沿的加速卡、服务器和超节点,它们是大规模模型训练的命脉。你负责这些基础设施的全生命周期管理——从日常巡检、硬件维修,到故障定位与硬件置换。
(1)大模型训练动辄数周,十万张卡中的任何一张掉线、任何一个节点宕机,都可能让海量算力白白蒸发。而在十万卡的规模下,硬件故障不是"万一"会发生的事,而是"每时每刻"都在发生的事——你面对的不是"是否会坏",而是"坏了之后怎么办"。
(2)你的核心目标只有两个:持续缩短MTTR(平均故障恢复时间),以及每次故障都交出根因分析,而不是一句"重启就好了"。
(3)我们不在意你现在能不能背出某型号GPU的故障代码表,但我们要求你:面对一张"卡掉了"的模糊现象,知道从哪里开始查、怎么一步步逼近真相。 在十万卡规模下,这种能力不是锦上添花,是生死线。
2.让新算力"开箱即巅峰"——高质量交付每一批资源:新一代计算资源到货不是插上电就能用的。你需要独立完成新节点的基线检查、性能调优与生产验证,确保每一台新上线的机器都以最佳状态投入战斗。在十万卡集群中,新节点交付是持续进行的,每一批的质量都直接影响整体算力输出。
(1)你要回答的问题是:"这批新卡的理论峰值是多少?我们实际跑到了多少?差距来自硬件、驱动、网络还是配置?"
(2)我们不考你"会用什么工具做benchmark",而是在意你能不能设计一套验证流程,让"性能是否达标"这件事有数据可依、有标准可判。
3.把"黑盒"变透明——让集群健康实时可见:十万卡级的大模型训练是一个巨大的黑盒,规模越大,透明度越重要。你负责建设和优化面向AI超算集群的监控、告警与可观测性体系,让这个黑盒被彻底打开。
(1)每一帧GPU利用率的波动、每一次NCCL通信的延迟抖动、每一次checkpoint保存的耗时变化,都必须在你的视野之内——而在十万卡规模下,这些信号的数量级是前所未有的,你需要懂得降噪,知道哪些告警值得看、哪些可以忽略。
(2)我们要的不是"把Prometheus装起来就行"。我们要的是:当集群即将出问题的时候,告警先于业务投诉到达;当问题发生后,你能快速回答"为什么"。
(3)我们不问你用过哪些监控工具,而是问:如果只给你3个核心指标来判断集群整体健康度,你选哪三个?为什么选它们?
4.用自动化替代人工——让集群自己救自己:十万卡集群的运维不能靠堆人。当故障发生的频率远超人工响应的速度,唯一的出路是让机器自己修复自己。你需要构建自动化运维工具链,把常见故障的诊断和修复固化成代码,让集群具备故障自愈能力。
(1)目标很朴素:让值班工程师不再被半夜的报警电话吵醒。 在十万卡规模下,如果每张卡每年发生一次故障,平均每天就有近三百个故障需要处理——没有任何团队能靠人工扛住这个量级。
(2)我们不问"你用Ansible还是SaltStack",我们关心的是:你设计的自动化方案,能把人工干预减少多少?它能覆盖哪些故障场景?它的边界在哪里?当自动化判断错误时,代价是什么?
【我们提供的机会】
这不是一个"螺丝钉"岗位。
你入职的第一天,就会被放在最重要的业务场景上,承担最复杂的任务。不会让你从修机器、装系统、写日报开始。你会直接面对大模型训练与推理中最棘手的稳定性与性能问题——十万卡集群的故障定位、新算力性能调优、可观测性体系从0到1的建设。这些问题直接影响AGI的研发进度,而我们希望你从一开始就成为解决它们的人。
我们相信:把最重要的事情交给新人,新人才能快速成长为核心。 这不是风险,这是我们选择的管理方式。
【我们期待的素质(而非"经验要求")】
1.对AGI的真实热情:不是为了高薪或风口而来,而是真的觉得"造出AGI"这件事值得你投入数年的时间。
2.拆解问题的逻辑能力:遇到模糊的故障("训练变慢了""有张卡掉了""新节点性能不达预期"),你能把它拆成可验证的假设,一步步缩小范围,而不是靠直觉乱试。
3.系统性的技术视野:脑子里有从"加速卡→NVLink→网卡→存储→调度→上层框架"的完整地图,知道数据怎么流动、瓶颈可能在哪。性能调优不是拍脑袋,是逐层排查。
4.清晰的表达能力:能把复杂的技术问题,用简单清晰的语言讲清楚——包括写故障报告、画架构图、和跨团队沟通。
5.动手的冲动:看到一个新工具/新框架,第一反应是"拉下来跑一跑",而不是"先看看文档再说"。我们想听你踩过的坑,不想听你背诵的文档。
6.对生产环境的敬畏:每次变更前本能地想好"怎么回滚",每次事故后都能沉淀一份根因分析——不是应付流程,是真的想让自己和团队不再犯第二次。
【以下内容供参考(不是硬性门槛)】
如果你恰好有一些技术基础,可能会让你的初期探索更顺畅一些——但我们不会因为你不具备某一条而拒绝你,也不会因为你全部具备而录取你。素质优先。
1.熟悉Linux操作系统,理解进程、内存、文件系统、网络的基本原理。
2.接触过容器化技术(Docker/Kubernetes),理解Pod、调度、资源配额等概念。
3.了解PyTorch/TensorFlow的基本工作方式,能看懂常见的报错信息。
4.会用Python或Shell写脚本解决重复性劳动。
5.对RDMA/InfiniBand/GPU架构或性能调优有了解(加分,但不是必须)。
【我们能提供什么】
1.最重要的岗位:你不会从边角料做起,第一天就面对最核心的挑战——十万卡集群的稳定性、新算力性能调优、可观测性体系建设、自动化自愈。
2.极快的成长速度:因为你要解决的问题足够复杂,而且是AGI时代才出现的全新问题,你的能力会被快速拉伸,从硬件到网络到调度到上层框架,你会建立完整的系统视野。
3.技术自由:用什么技术栈由问题决定,而不是由"公司标准"决定。我们鼓励尝试新工具、新方案,你构建的自动化工具链会成为团队的核心资产。
4.与优秀的人同行:团队里有一群和你一样对AGI充满热情的人,你们会一起踩坑、一起填坑、一起成长。
【面试流程说明】
我们的面试不考记忆、不考背诵、不考"你用过XX几年"。
我们会让你:
1.讲一个你真正动手做过的事情(任何领域都可以,不一定是技术),追问"为什么这么做","有没有想过其他方案"。
2.面对一个你没见过的故障场景,观察你的推理路径是否清晰——比如"训练突然变慢了,你怎么查","新上线的这批卡跑不到理论峰值,你怎么排查","在十万卡规模下,如果监控系统自己扛不住了怎么办"。
3.聊聊你对AGI的理解和想象——这不是考你,是想确认我们是不是同路人。
我们希望面试是一场双向的技术对话,而不是一场单向的技术考试。
【最后】
如果你觉得自己经验不够、背景不匹配,但逻辑清晰、爱琢磨、对AGI底层技术充满好奇——请一定投递我们。
我们相信,素质到位了,技术只是时间问题。 而AGI这条路,本来就没有人"有经验"。我们需要的是愿意一起走进无人区的同行者,而不是只会按手册操作的熟练工。
立即投递