AI大模型架构师
腾讯
岗位职责
1.负责公司大模型(LLM/VLM/MoE等)的整体技术架构规划,参与千亿/万亿参数级别大模型的训练、推理全流程架构优化;
2.优化大规模分布式训练系统(3D并行、ZeRO优化等),参与解决断点续训、通信瓶颈、显存优化等技术难题,提升稳定性和降低成本;
3.规划公司AI基础设施,包括AI芯片、存储、通信等。参与大模型训练的全流程规划(数据处理、预训练、精调、强化、后训练等)。参与大模型推理的全流程规划(改写、压缩、多轮对话、Agent等)。
任职要求
1.5年以上AI相关开发经验,包括不限于搜索、推荐、CV等。2年以上专注于大模型(GPT、Llama、Qwen、DeepSeek等系列)领域工作经验;
2.深入理解Pytorch、Megatron、DeepSpeed等分布式训练框架,有千卡以上集群训练实战经验优先,有强化训练实战经验优先;
3.熟悉千亿模型训练工程化相关技术,3D并行、ZeRO、混合精度、Overlapping等;
4.熟悉主流大模型算法,Transformer、MoE、MLA等。熟悉后训练算法,SFT、DPO、GPRO等;
5.了解大模型推理部署框架和工程化,vLLM框架、KV Cache优化等。关注当前最新LLM最新技术发展。