AI Infra架构师/工程师
均普智能
岗位职责
1. 规划GPU集群、存储、网络、容器和训练作业调度,支撑大规模多模态与具身模型训练;
2. 建设模型训练基础设施,适配FSDP、DeepSpeed、Megatron、Transformers等框架;
3. 打通数据集版本、训练配置、模型产物、实验追踪、评测结果和部署包管理;
4. 优化训练效率、稳定性、成本和可复现性,建立故障排查与资源使用规范;
5. 支撑训练、评测、部署全过程中的模型版本一致性和实验可追溯。
任职要求1. 本科及以上学历,计算机、人工智能、分布式系统等相关背景;
2. 5年以上AIInfra、MLOps、分布式训练平台或大规模工程系统经验;
3. 熟悉Linux、Docker/K8s、GPU/NCCL、分布式存储和网络性能优化;
4. 熟悉PyTorch分布式训练和主流大模型训练框架;
5. 具备系统设计能力,能在研发速度、稳定性和成本之间做工程取舍。
任职要求
1. 本科及以上学历,计算机、人工智能、分布式系统等相关背景;
2. 5年以上AIInfra、MLOps、分布式训练平台或大规模工程系统经验;
3. 熟悉Linux、Docker/K8s、GPU/NCCL、分布式存储和网络性能优化;
4. 熟悉PyTorch分布式训练和主流大模型训练框架;
5. 具备系统设计能力,能在研发速度、稳定性和成本之间做工程取舍。
立即投递