AI Infra研发工程师 - 存储
字节跳动
岗位职责
团队介绍:字节跳动基础设施存储团队,为字节跳动全系产品提供存储服务,对外打造火山引擎公有云存储产品体系,在AI时代深度支撑豆包大模型和方舟大模型平台。我们根植字节跳动最佳技术实践,以数十万台服务器规模和百EB 级数据稳定存储的企业服务经验,通过火山引擎丰富的存储产品矩阵对外赋能。我们积极探索业界顶尖的技术,从底层硬件构造到数据治理和上层应用加速,致力于构建业界领先的云存储服务,释放海量数据的无限价值。
1、负责深度学习框架分布式并行策略的研发与优化,包括数据并行、张量并行、流水线并行等核心技术,支撑大模型的高效分布式训练;
2、参与分布式训练中集合通信技术的优化,解决并行策略下的通信瓶颈问题,提升大规模集群的并行效率;
3、配合存储团队完成分布式训练场景下的数据调度与缓存策略优化,保障并行训练时的数据高效读取;
4、负责分布式并行策略的落地推广与问题排查,跟进前沿技术并推动架构迭代。
任职要求
1、深入理解深度学习框架的分布式并行策略(数据并行、张量并行、流水线并行等),有相关研发或优化经验;
2、熟悉分布式训练中的集合通信机制(如AllReduce、AllGather等),能独立定位和解决并行训练中的通信问题;
3、熟练掌握C++/Python等编程语言,具备扎实的算法与数据结构基础;
4、有分布式系统开发经验,熟悉Linux操作系统与常用工具链。
加分项:
1、有存储系统开发经验(如分布式存储、内存存储等),了解分布式训练场景下的数据存储需求;
2、参与过AI大模型分布式训练相关项目,有实际落地经验;
3、熟悉CUDA编程或其他GPU加速技术,有GPU并行优化经验。