机器学习存储架构工程师 - Data AML
字节跳动
岗位职责
团队介绍:Data AML是字节跳动的机器学习中台,为抖音/今日头条/西瓜视频等业务提供推荐/广告/CV/语音/NLP的训练和推理系统。为公司内业务部门提供强大的机器学习算力,并在这些业务的问题上研究一些具有通用性和创新性的算法。同时,也通过火山引擎将一些机器学习/推荐系统的核心能力提供给外部企业客户。
1、负责通用性与架构设计的平衡,构建可支持多业务不同场景(低成本、高可用性、高吞吐、高性能、大空间)诉求的统一中台系统;
2、攻克多级/分级存储的架构复杂度难题,覆盖显存、内存、外存等全层级存储场景,持续追求索引与存储结构的极致性能,探索无锁化、渐进式数据结构等技术方向,挑战CAP定理边界;
3、跟进前沿软件与硬件架构的演进趋势,并开展技术尝试与落地;
4、负责站内中台多代际、多机房、多套餐及不同库存资源的规划与利用率优化,实现基于模型规模与服务流量感知的自动/动态调优;
5、统筹多个子系统的多目标优化:训练侧聚焦功能性、可用性、容错性优化;服务侧聚焦成本、容量、性能优化;系统同步侧聚焦数据一致性、实效性、带宽容量优化。
任职要求
1、熟练掌握Linux环境下的C++/Python编程语言的使用;
2、掌握分布式系统原理,参与过分布式系统的设计、开发、维护和持续优化,能够识别复杂分布式系统中的潜在问题;
3、参与过推荐/搜索/机器学习等分布式系统工作,涉及过诸如资源调度、任务编排、模型训练、模型推理、特征抽取、MLsys、AIOps等内容;
4、有优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分,良好的团队合作精神;
5、有强烈的工作责任心,较好的学习能力、沟通能力、自驱力和执行力;
6、有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档。
加分项
1、参与过类似ParameterServer系统优化,或者搜索系统的索引结构优化;
2、了解Redis、LevelDB/RocksDB、MonGo等开源存储类项目;或者有HDFS、Ceph等分布式存储系统使用/优化经历;
3、熟悉主流的机器学习框架(TensorFlow/PyTorch/MXNet);
4、有以下某一方向领域的经验:AI InfRAStructure,HW/SW Co-Design,High performance Computing,ML Hardware Architecture(GPU,Accelerators,Networking),Machine Learning Frameworks,ML for System,Distributed StoRAGe;
5、对于Linux Kernel,操作系统,有深入了解/追查能力;
6、有ACM/OI竞赛背景。