Agent模型评估产品经理
岗位摘要
负责构建大模型在真实应用场景下的行为与质量评估体系,涵盖用户价值、可靠性、多模态表现、安全性等维度;从用户反馈、模型行为观察、研究侧目标中提炼评估方向,并形成评估结论推动模型迭代;持续迭代评估方法,包括可扩展的自动化Evals、Benchmark任务设计、评估工具链与流程优化
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责构建大模型在真实应用场景下的行为与质量评估体系,涵盖用户价值、可靠性、多模态表现、安全性等维度
- 从用户反馈、模型行为观察、研究侧目标中提炼评估方向,并形成评估结论推动模型迭代
- 持续迭代评估方法,包括可扩展的自动化Evals、Benchmark任务设计、评估工具链与流程优化
- 确保评估体系能覆盖新能力、Badcase及模型升级版本
- 基于线上观测、实验结果和用户访谈,识别模型缺陷与改进机会,给出可执行的优化方向与验证方案
- 推动跨团队闭环,统筹评估目标、资源优先级与落地节奏
- 确保关键模型行为、风险点、用户体验问题能够被快速验证、追踪与优化
任职要求
- 本科及以上学历,具备3年以上模型策略/评估相关产品经验
- 熟悉大语言模型、多模态模型或Agent评估者优先
- 具备强结构化分析能力,能够从复杂的模型行为中提炼本质问题
- 能够将研究目标、用户需求与产品指标连接起来
- 对数据和指标体系敏感,能基于实验、日志、线上表现快速定位模型问题
- 熟练制定合理的验证方案与评测集
- 对AI技术发展、模型训练原理、模型行为对齐、安全机制、Agent体系有兴趣或基础理解
- 愿意阅读最新研究论文、model card、技术报告,并将其转化为评估与产品改进思路
- 具备强自驱力和结果导向,能在多团队协作、节奏快且信息不足的环境下推进项目
- 英语可作为工作语言者加分
福利待遇
- 月薪20-40K,16薪制
工作地址
北京海淀区京东科技大厦13
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。