AI基础设施架构师/高级AI基础设施研究员-基础设施

字节跳动

岗位职责

1、端到端AI Factory架构设计:负责超大规模、高可用AI Factory的端到端架构设计与演进;主导面向万卡/十万卡级GPU/加速器集群的计算、高性能网络(RDMA/RoCE/1、6T/CPO)及低延迟存储系统的协同设计,支撑百亿/千亿参数大模型(LLM/VLM)的高效Pre-training和超大规模分布式Inference工作负载; 2、下一代分布式调度与资源管理:设计并实现面向服务(SOA/MicROServices)的下一代AI/ML分布式调度系统与集群联邦架构(基于Kubernetes、高性能调度插件或自定义编排框架);利用智能资源流转、工作负载感知放置(Topology-aware placement)与故障自动恢复(Fault-tolerance)机制,极致提升集群算力利用率(MFU/HFU)并降低TCO; 3、全栈性能极致优化与瓶颈分析:全链路剖析并优化AI/ML计算堆栈:涵盖机器学习编译器(XLA/TVM/Triton)、通信库(NCCL/RCCL)、算子优化、大模型训练/推理框架(Megatron-LM,DeepSpeed,vLLM等);主导构建低开销(Low-overhead)的分布式Metrics监控、可观测性系统及微基准测试(Micro-Benchmarking)框架,精准定位并消除超大规模集群的系统级长尾瓶颈; 4、下一代高性能存储与数据管道:针对大模型长周期训练的Checkpointing、多模态海量数据预处理、以及推理场景下的长文本/高并发需求,设计下一代高性能分布式存储、缓存系统及存算一体架构;主导构建高吞吐的分布式ETL与数据摄取管道。

任职要求

1、硕士学位及以上,计算机科学、计算机工程、电子工程或相关专业; 2、工作经验:5年以上高并发/分布式系统工程经验,其中至少3年聚焦于ML/AI基础设施领域,有GPU集群实践经验者优先; 3、技术功底:深入理解现代GPU/加速器微架构、高速互联架构(NVLink/NVSwitch)及数据中心网络(RDMA/RoCE/InfiniBand);精通至少一种主流分布式训练/推理框架的底层源码与优化机制;具备扎实的系统编程能力,精通C++、Go或Rust,并具备深厚的Python底层开发与调试功底; 4、素养:具备出色的第一性原理(First-princIPles)思考能力,面对复杂的软硬件级联故障能迅速推导本质,具备优秀的技术前瞻性。
岗位信息来源于公开招聘渠道,仅作信息聚合展示。岗位编号 bytedance_social-7509779941983586568
AI基础设施架构师/高级AI基础设施研究员-基础设施 - 字节跳动 | 好简历招聘岗位库