硬件加速训练AI Infra工程师-Data
字节跳动
岗位职责
1、负责自研硬件训练框架开发(Torch、Megatron、Dtensor等);
2、对接业务大模型例如豆包、Seedance等模型在自研硬件上训练任务支持;
3、开发DP、SP、TP、PP等分布式并行方式并且优化;
4、训练业务通信、计算、通算融合算子研发以及性能优化。
任职要求
1、1-5年异构硬件、GPU相关领域训练开发经验,熟悉PyTorch、FSDP、Megatron-LM、VeRL分布式训练框架;
2、对数据并行、模型并行、分布式数据并行等常见训练模式有深入理解;
3、参与过硬件加速器训练相关研发工作,包含Torch Compiler、算子开发、编译调度优化等;
4、有主动学习、快速解决问题的能力和自我驱动力。
以下为加分项:
1、有大模型训练百、千卡以上集群训练落地经验;
2、有异构硬件、NPU等训练、推理开发经验,对硬件比较了解;
3、熟悉计算机体系结构和并行计算;
4、有GPU、FPGA或AI芯片相关的开发和评测经验。