AI平台运维工程师

DeepSeek

岗位职责

】 1.平台架构设计和开发: 主导公司运维平台(CMDB、运维作业、可观测等)的架构设计和开发。 2.系统集成: 对接第三方开放平台、监控系统、仓管系统、采购系统等。 3.跨团队协作: 和运维团队、采购团队、研发团队深度协作,不断完善运维开发需求。 【

任职要求

】1.本科及以上学历。2.较好的 Python/Golang 等开发能力,扎实的工程能力。3.对运维体系有较全面的认知,深入理解运维流程。4.熟悉CMDB、工单系统等运维平台。5.较好的沟通能力和理解能力。【加分项】1.3年以上一线运维经历,深知运维痛点。2.熟悉SRE体系。3.成熟运维平台开发经历。 【团队使命】 在AGI的纪元,竞争的本质已升维为超大规模算力系统性能与可靠性的终极角力——这远非机械性的运维,而是以架构师之姿,亲手浇筑智能时代的“重力场”。我们不满足于守护算力的灯火,更致力于让万卡集群的澎湃算力化作如水电般无形却无处不在的基座:在纳秒级的延迟中雕琢极致,在洪流般的训练中锚定永恒稳定,将复杂的底层逻辑隐于幕后,让业务方只感知到“丝滑”与“确定”的纯粹体验。这不仅是构建平台,更是托举AGI进化的桥梁——我们拒绝被动的应急,选择主动定义未来,让每一次模型迭代都踏在坚实可靠的算力底座之上,直至智能的彼岸因我们的存在而触手可及。 招聘方向【实习/全职】: 集群运维方向、运维开发方向 集群运维方向 【我们在找什么样的人】 如果你对实现AGI这件事有强烈的兴趣和好奇心——不是因为风口热,而是你真的觉得"造出通用人工智能"是这个时代最值得投入的事情——那我们想认识你。 我们不太在意你过去有没有运维经验,也不太在意你是不是科班出身。我们在意的是: 当一个复杂问题摆在面前,边界模糊、文档缺失、没人知道答案的时候,你是退缩等别人解决,还是兴奋地冲上去拆解它、搞定它? 如果你现在不会GPU调度、不懂Kubernetes、没写过监控脚本——没关系。AGI本身就是人类从未走过的新路,没有人"有经验"。我们愿意和有热情、有潜力的人一起,从零到一建设AGI时代的基础设施。 【我们提供的机会】 这不是一个"螺丝钉"岗位。 你入职的第一天,就会被放在最重要的业务场景上,承担最复杂的任务。不会让你从修机器、装系统、写日报开始。你会直接面对大模型训练与推理中最棘手的问题:十万卡集群的稳定性、训练任务的断点续训、推理服务的秒级弹性伸缩——这些问题直接影响AGI的研发进度,而我们希望你从一开始就成为解决它们的人。 我们相信:把最重要的事情交给新人,新人才能快速成长为核心。 这不是风险,这是我们选择的管理方式。 【我们对"运维"的理解】 我们不希望你把自己定义为一个"运维工程师"。 在我们团队,"运维"只是一个出发点,而不是一个牢笼。我们希望你: 1.需要写代码的时候就写代码,需要调硬件的时候就调硬件,需要设计架构的时候就画架构图。 2.不局限于"这是我的分工"或"这不是运维该做的事"。 3.把全部精力放在解决问题和加速AGI实现这两个最终目标上。 所以我们称这个岗位为"不像运维的运维"——你的角色会随着问题的需要而流动。今天你在优化GPU网络通信,明天可能在设计自动化故障恢复系统,后天可能在帮算法团队排查一个诡异的显存溢出。边界由问题定义,不由岗位定义。 【你将要面对的挑战】 这不是一个"按手册操作"的岗位。你会面对很多前人从未走过、文档也没写过的事情: 1.让十万卡集群像一台电脑一样稳定:大模型训练动辄数周,任何单点故障都可能让数万元算力白白消耗。你需要设计系统,让整个集群具备自愈能力——哪怕天天有硬件在坏,训练也不能停。 2.在"快"与"稳"之间找到平衡:算法同学每天迭代多个版本,资源调度需要极度灵活。你需要让实验速度足够快,同时生产环境足够稳——这两个目标天然冲突,你的工作就是在夹缝中找最优解。 3.把"黑盒"变透明:大模型训练是一个巨大的黑盒。你要做的,是让每一帧GPU利用率的波动、每一次NCCL通信的延迟抖动、每一次checkpoint保存的耗时变化,都可观测、可追溯、可解释。 4.探索无人区:随着模型规模继续扩大,现有的调度系统、网络协议、存储方案可能都会失效。你需要保持对前沿技术的敏感,敢于尝试没人试过的方案。 【我们期待的素质(而非"经验要求")】 1.对AGI的真实热情:不是为了高薪或风口而来,而是真的觉得"造出AGI"这件事值得你投入数年的时间。 2.拆解问题的逻辑能力:遇到模糊的故障("训练变慢了"),你能把它拆成可验证的假设,一步步缩小范围,而不是靠直觉乱试。 3.系统性的技术视野:脑子里有从"GPU计算→显存→NVLink→网卡→存储→调度"的完整地图,知道数据怎么流动、瓶颈可能在哪。 4.清晰的表达能力:能把复杂的技术问题,用简单清晰的语言讲清楚——包括写文档、画图、和跨团队沟通。 5.动手的冲动:看到一个新工具/新框架,第一反应是"拉下来跑一跑",而不是"先看看文档再说"。我们想听你踩过的坑,不想听你背诵的文档。 6.对生产环境的敬畏:每次变更前本能地想好"怎么回滚",每次事故后都能沉淀一份根因分析——不是应付流程,是真的想让自己和团队不再犯第二次。 【以下内容供参考(不是硬性门槛)】 如果你恰好有一些技术基础,可能会让你的初期探索更顺畅一些——但我们不会因为你不具备某一条而拒绝你,也不会因为你全部具备而录取你。素质优先。 1.熟悉Linux操作系统,理解进程、内存、文件系统、网络的基本原理。 2.接触过容器化技术(Docker/Kubernetes),理解Pod、调度、资源配额等核心概念。 3.了解PyTorch/TensorFlow的基本工作方式,能看懂常见的报错信息。 4.会用Python或Shell写脚本解决重复性劳动。 5.对RDMA/InfiniBand/GPU架构等有了解(加分,但不是必须)。 【我们能提供什么】 1.最重要的岗位:你不会从边角料做起,第一天就面对最核心的挑战。 2.极快的成长速度:因为你要解决的问题足够复杂,你的能力会被快速拉伸。 3.技术自由:用什么技术栈由问题决定,而不是由"公司标准"决定。我们鼓励尝试新工具、新方案。 4.与优秀的人同行:团队里有一群和你一样对AGI充满热情的人,你们会一起踩坑、一起填坑、一起成长。 【面试流程说明】 我们的面试不考记忆、不考背诵、不考"你用过XX几年"。 我们会让你: 1.讲一个你真正动手做过的事情(任何领域都可以,不一定是技术),追问"为什么这么做""有没有想过其他方案"。 2.面对一个你没见过的故障场景,观察你的推理路径是否清晰。 3.聊聊你对AGI的理解和想象——这不是考你,是想确认我们是不是同路人。 我们希望面试是一场双向的技术对话,而不是一场单向的技术考试。 【最后】 如果你觉得自己经验不够、背景不匹配,但逻辑清晰、爱琢磨、对AGI底层技术充满好奇——请一定投递我们。 我们相信,素质到位了,技术只是时间问题。 而AGI这条路,本来就没有人"有经验"。我们需要的是愿意一起走进无人区的同行者,而不是只会按手册操作的熟练工。 运维开发方向 【
岗位信息来源于公开招聘渠道,仅作信息聚合展示。收录于 2026/7/23岗位编号 deepseek_campus-b48bdca9-742f-44f1-bde8-5c4e9b953f31
AI平台运维工程师 - DeepSeek | 好简历招聘岗位库