返回岗位列表

月之暗面

大模型评估产品专家

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

负责构建大模型在真实应用场景下的行为与质量评估体系,涵盖用户价值、可靠性、多模态表现、安全性等维度;从用户反馈、模型行为观察、研究侧目标中提炼评估方向,并形成评估结论推动模型迭代;持续迭代评估方法,包括可扩展的自动化评估、基准任务设计、评估工具链与流程优化

岗位职责

  • 负责构建大模型在真实应用场景下的行为与质量评估体系,涵盖用户价值、可靠性、多模态表现、安全性等维度
  • 从用户反馈、模型行为观察、研究侧目标中提炼评估方向,并形成评估结论推动模型迭代
  • 持续迭代评估方法,包括可扩展的自动化评估、基准任务设计、评估工具链与流程优化
  • 确保评估体系能覆盖新能力、Badcase及模型升级版本
  • 与研究、工程、数据科学等团队紧密协作,基于线上观测、实验结果和用户访谈,识别模型缺陷与改进机会,并给出可执行的优化方向与验证方案
  • 负责推动跨团队闭环,统筹评估目标、资源优先级与落地节奏,确保关键模型行为、风险点、用户体验问题能够被快速验证、追踪与优化

任职要求

  • 本科及以上学历,具备3年以上模型策略或评估相关产品经验
  • 熟悉大语言模型、多模态模型或智能体评估者优先
  • 具备强结构化分析能力,能够从复杂的模型行为中提炼本质问题,并将研究目标、用户需求与产品指标连接起来
  • 对数据和指标体系敏感,能基于实验、日志、线上表现快速定位模型问题,并熟练制定合理的验证方案与评测集
  • 对AI技术发展、模型训练原理、模型行为对齐、安全机制、智能体体系有兴趣或基础理解,愿意阅读最新研究论文、模型卡片、技术报告,并将其转化为评估与产品改进思路
  • 具备强自驱力和结果导向,能在多团队协作、节奏快且信息不足的环境下推进项目
  • 英语可作为工作语言者加分