世界模型与视频生成时空建模研究
京东
岗位职责
1. 深度参与多模态生成大模型与世界模型(World Model)的全流程研发与底座架构设计。
2. 围绕预训练、后训练、多模态对齐与联合生成(图/文/音/视)开展系统性的技术探索。
3. 攻坚视频生成(Text-to-Video)及世界模型中的时空建模与动态环境建模等核心算法难题。
4. 协同开展大规模分布式训推调优,参与核心模型发布及高质量学术论文/技术报告的撰写。
任职要求
1. 计算机视觉、人工智能或计算机图形学等相关领域的本硕博在校生。
2. 对多模态生成或世界模型方向有强烈技术信仰,具备卓越的代码落地与工程实现能力。
3. 深入掌握生成式模型(Diffusion/DiT等)或多模态基础模型(VLM/MLLM)的核心理论。
4. 熟悉深度学习底层的训练与推理Infra,具备Megatron、FSDP、vLLM等框架实战经验者优先。
5. 在AI领域顶级会议有论文发表经历,或能保证6个月以上长期实习者优先。