多模态大模型在视频中的可控生成
京东
岗位职责
1. 开展电商场景下的视频生成大模型算法研究,攻克商品一致性、多参考图、多镜头控制等核心技术难题;
2. 负责视频生成模型的训练与推理优化,解决训练与应用阶段的速度及稳定性等问题,保障研究成果具备规模化落地能力;
3. 围绕电商内容应用场景构建数据迭代机制,持续优化并提升应用场景下的核心模型指标;
4. 推动多模态视频生成研究成果在集团内容业务及商品素材等场景的端到端落地,提升消费者购物体验与商品转化率。
任职要求
1. 获得本科及以上学历,计算机科学、人工智能等相关专业;
2. 具备扎实的机器学习、深度神经网络及强化学习理论基础,熟悉大语言模型(LLM)训练与后训练流程;
3. 具备图像生成或视频生成领域丰富的项目落地经验,深入理解并精通扩散模型(Diffusion Model)底层架构与核心算法;
4. 熟练掌握PyTorch深度学习框架,具备基于DeepSpeed或Megatron-LM等架构的大规模分布式训练实战经验;
5. 在CVPR、NeurIPS、AAAI、ICCV、ECCV等人工智能顶级学术会议有高质量论文发表记录,或在相关主流开源项目中有突出代码贡献。