超算集群研发工程师

DeepSeek

岗位职责

】 你将根据团队目标和个人专长,参与以下关键领域中的一个或多个方向的架构设计与工程实现: 1.设计并实现大规模异构计算资源的调度系统,解决 CPU/GPU/NPU 等计算资源的抽象、池化与拓扑感知调度。持续优化调度算法,在任务吞吐、排队延迟和资源利用率之间取得均衡。 2.开发集群管理系统,覆盖任务和节点生命周期管理、日志采集和召回、关键性能数据收集与可视化、故障发现与自动容灾,以及新硬件、新软件栈的导入与适配。 3.从集群视角进行端到端系统性能调优,覆盖 CPU/GPU/NPU 计算任务优化、Linux 内核、I/O 和网络协议栈等,构建集群可观测性体系,主导大规模训练下的故障诊断、性能回归和全链路排障。分析大规模并行系统中的性能抖动、长尾延迟以及性能不均等系统性瓶颈,支撑所有同事更高效地使用集群。 4.AI 超算集群网络的拓扑设计、路由策略、多路径负载均衡和拥塞控制,深入研究 RDMA(RoCEv2 / InfiniBand)协议栈,与通信算子、存储团队配合,提供来自高性能网络的最优底层支撑。 5.参与新一代超算集群的架构规划与建设,探索和评估 GPU、国产 AI 加速器、网卡、以及新兴硬件,与 IDC 数据中心团队配合,以集群架构需求驱动数据中心的规划、建设与交付。 【

任职要求

】1.扎实的计算机体系结构基础:深刻理解计算机组成、操作系统、计算机网络等核心原理。你需要从硬件微架构、访存子系统到片上和网络互联架构,从数理逻辑到进程指令再到操作系统执行,能够系统性地思考和定位计算规模大幅提升后带来的性能优化与复杂性问题。2.熟悉 C / C++ / Rust / Python 之一,具备优秀的设计能力、极强的动手和工程能力以及代码质量意识。3.对分布式系统有深刻理解与实践经验,如熟悉分布式任务调度与资源编排,或能设计高性能、高可用的系统架构。4.对性能优化有较高热情,发自内心地想要跑满所有计算资源,榨干每一份算力。5.良好的中文沟通能力和团队协作能力。【加分项】以下为加分项,不强制要求,我们非常欢迎有扎实系统基础和强烈学习意愿的同学加入:1.熟悉容器运行时(cgroup、namespace 等)与容器编排系统(Kubernetes 等)的底层实现原理,理解资源隔离、调度(sched_ext)与 QoS 等机制。2.精通 RDMA 编程及 RoCEv2 / InfiniBand 网络架构,深入理解拥塞控制、多路径、自适应路由等机制,具备大规模 RDMA 网络排障与调优经验。3.有HPC和超算全机规模应用经验,熟悉并行编程范式,或有超大规模集群组网设计、部署建设、调优经验。4.有智能网卡 DPU、可编程交换机 P4 开发经验,或熟悉 GPU、国产 AI 加速器或国产 CPU 的体系结构和性能特性5.在大型开源软件中有深度贡献,或有优秀个人开源项目,或有HomeLab经历。6.在 HPC 赛事(SC / ASC / ISC / PAC)、数学或算法竞赛(CMO / NOI / IOI / ICPC)中取得优异成绩。【视野与思辨】我们对世界充满好奇心,这种好奇心会自然延伸到对复杂系统底层运作机制的持续探索。我们不满足于被动执行,对 AGI 的技术路径有着独立的思考与执着的好奇心。我们相信,广泛的兴趣——无论是音乐、体育、美术还是其他领域——都将为你带来独特的视角与创新灵感。【你会得到】1.直接参与定义并建设下一代超算基础设施,挑战更大规模数十万卡集群的极限性能。2.与顶尖算子、框架研发和算法研究员协作,从硬件到软件、从平台到应用全栈贯通。3.深入多种硬件体系结构,系统性地积累跨架构实践经验。4.你的工作直接影响大模型训练与推理的效率、成本和稳定性。 【团队使命】 在 AI 时代,超算集群就是把电力转换为智能的引擎。它是通向 AGI 的坚实底座。 从万卡集群去往数十万卡的路上,丛生着系统复杂度的荆棘。我们的目标,是跑满所有计算资源,榨干每一份算力。这牵涉着异构算力的调度权衡、全系统栈的性能调优、超大规模网络的互联承载,以此探索下一代集群的更优架构。 每一层设计都需要我们从第一性原理出发,重新审视,重新思考。让每一瓦电力都尽可能多地转换为有效算力,让每一次模型训练和推理都扎根于极致高效的算力底座之上。 【岗位类别】:实习/全职 【
岗位信息来源于公开招聘渠道,仅作信息聚合展示。收录于 2026/7/23岗位编号 deepseek_campus-cdccf456-207f-4ea0-9fdd-c30a5ce42d5b