超大规模分布式训练自动优化探索
京东
岗位职责
1. 深度参与CTR、LLM及多模态等大模型的算法引擎与样本引擎研发,解决大规模分布式训练的性能瓶颈。
2. 针对超大规模异构算力集群进行底层优化,大幅提升计算资源的扩展性与利用效率。
3. 深入挖掘零售核心算法业务中的功能与性能痛点,设计并落地端到端的高效技术优化方案。
4. 追踪前沿训练引擎与数据引擎的发展趋势,开展软硬结合的技术攻关,打造行业级技术影响力。
任职要求
1. 计算机科学、电子工程或相关领域的本硕博在校生。
2. 具备扎实的数据结构与算法功底,熟练掌握Python、C/C++等编程语言,具备极佳的工程素养。
3. 熟悉主流深度学习框架及其底层运行机制,拥有分布式计算引擎开发与性能调优实战经验。
4. 在机器学习、自然语言处理、多模态或系统底层优化等任一领域具有深入的钻研与技术沉淀。
5. 了解CUDA编程,有基于国产化芯片(如昇腾、寒武纪等)框架优化经验者优先。
6. 在OSDI、SOSP、SIGMOD或AI顶会有学术成果,或作为核心开发者参与过优秀开源项目者优先。