LLM大模型评测产品经理-豆包手机助手
字节跳动
岗位职责
1、从用户视角定义产品体验,并细化到对模型效果的理想态定义和评测标准制定;
2、负责构建大模型在真实应用场景下的效果评估体系,产出稳定可信的评测结论;能够从用户反馈、模型行为观察、研究侧目标中提炼评估方向,并提出可落地的模型能力提升与应用体验优化策略,推动模型和产品迭代;
3、与研发、数据科学、用户研究等团队紧密协作,基于线上观测、实验结果和用户访谈,识别模型缺陷与改进机会,并给出可执行的优化方向与评估策略;
4、负责推动跨团队协作闭环,统筹评估目标、资源优先级与落地节奏,确保关键模型行为、风险点、用户体验问题能够被快速验证、追踪与优化;
5、持续跟进业界评测研究与方法论,结合真实业务场景迭代方案,探索更反映真实用户体验和价值的评测方法。
任职要求
1、本科及以上学历,2年以上模型策略/评测/数据产品相关经验,熟悉LLM/多模态/Agent产品评估者优先;
2、具备结构化分析能力,能够从复杂的模型行为中提炼本质问题,并将模型能力、用户需求与产品指标连接起来;
3、对数据和指标体系敏感,能基于实验、日志、线上表现快速定位模型问题,并熟练制定合理的验证方案与评测集;
4、对AI技术发展、Agent体系有兴趣或基础理解,愿意阅读最新研究论文/直接体验产品,并将其转化为评估与产品改进思路;
5、具备自驱力和结果导向,能跨算法/数据/研发对齐指标、节奏和交付,推动闭环落地。