机器学习系统SRE工程师-Seed

字节跳动

岗位职责

团队介绍:字节跳动Seed团队成立于2023年,致力于寻找通用智能的新方法,追求智能上限,为科技和社会发展作出贡献。 Seed团队在AI领域拥有长期愿景与决心,团队研究方向涵盖MLLM、GenMedia、AI for Science、机器人等,在中国、新加坡、美国等地设有实验室和岗位。目前,团队已推出业界领先的通用大模型以及前沿的多模态能力,支持豆包、即梦、TRAE等超过50个应用场景,并通过火山引擎开放给企业客户。第三方数据显示,豆包App用户量在中国市场排名第一,豆包大模型日均Token调用量行业领先。 1、负责维护机器学习系统的稳定运转,支持大模型的开发、训练与部署的多个环节; 2、负责集团GPU资源的管理与规划,成本与预算,包括:GPU/CPU机器资源,存储等资源,为管理层提供资源决策数据; 3、负责集群、业务服务的稳定性治理,资源利用率提升和运维人效提升,通过平台化系统化的手段提升资源使用的效率; 4、负责多地域、多机房的系统容灾、服务部署管理和集群机器治理,提供稳定高效的GPU系统运行环境; 5、负责系统和业务的运维支持,参与业务和系统的问题排查工作。

任职要求

1、一年以上运维开发项目经验; 2、熟练掌握Linux环境下的Go/Python/Shell等1至2种以上语言; 3、有分布式系统的资源管理和任务调度系统运维经验,熟悉Kubernetes生态和架构; 4、熟悉Docker/Kata等容器化技术; 5、有强烈的工作责任心,较好的学习能力、沟通能力和自驱力,良好的团队合作精神; 6、有优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分。
岗位信息来源于公开招聘渠道,仅作信息聚合展示。收录于 2026/7/23岗位编号 bytedance_campus-7408957562853378314