大模型高吞吐低延迟推理引擎研发
京东
岗位职责
1. 基于高性能注意力机制、模型压缩与并行解码等前沿技术,构建高吞吐、低延迟的大模型推理底座。
2. 研发算子融合与计算通信重叠等软硬件一体化优化方案,极限突破底层硬件的算力瓶颈。
3. 面向海量业务的高并发诉求,探索PD分离、弹性容量、负载均衡及异构算力调度的核心机制。
4. 构建高可用、低成本的AI原生服务架构,通过高水平论文与开源贡献提升团队技术生态声量。
任职要求
1. 计算机科学、体系结构或相关STEM领域的本硕博在校生。
2. 熟练掌握大语言模型底层基础理论,精通vLLM、SGLang或TensorRT-LLM等主流推理加速框架。
3. 具备极强的MLSys全栈底层优化工程经验,对打破技术天花板充满技术热忱。
4. 具备优秀的系统级创新思维、扎实的代码实现能力与跨团队业务协作意识。
5. 在计算机系统或人工智能顶级会议/期刊有高质量论文发表经历者优先。