返回岗位列表

阶跃星辰

大模型评测产品经理

地点:北京 薪资:30-60K 日期:2026-06-26

岗位摘要

负责大模型评测体系的产品化建设,面向LLM、多模态理解/生成、Agent、工具调用、长文本、推理等场景,设计科学、可扩展的评测方法与产品流程;与算法、工程、数据标注、业务产品团队协作,定义评测指标、评测集、Badcase分类、人工评审标准和自动化评测方案

岗位职责

  • 负责大模型评测体系的产品化建设,面向LLM、多模态理解/生成、Agent、工具调用、长文本、推理等场景,设计科学、可扩展的评测方法与产品流程
  • 与算法、工程、数据标注、业务产品团队协作,定义评测指标、评测集、Badcase分类、人工评审标准和自动化评测方案
  • 定期输出内部/竞品评估报告,给到有效洞察
  • 搭建标准-评测-线上反馈的闭环迭代机制,通过人工评估+自动评估的方式提升算法迭代效率和评估标准的合理性
  • 持续跟踪行业前沿Benchmark、评测方法、模型能力演进,探索更贴近真实业务场景的评测范式

任职要求

  • 本科及以上学历,3年以上AI评测产品经验
  • 理解大模型基本原理和常见能力维度,如指令遵循、事实性、推理、幻觉、安全性、多轮对话、工具调用、多模态生成等
  • 具备优秀的结构化分析能力,能将模糊的“效果不好”拆成可评估、可归因、可优化的问题
  • 熟悉数据分析、实验设计和指标体系建设,能推动复杂跨团队项目落地
  • 对模型评测、数据质量、AI体验优化有强兴趣,严谨、细致,能长期打磨标准和方法论

加分项

  • 有大模型评测平台、数据标注平台、实验平台、A/B 平台、模型管理平台经验
  • 熟悉 Python、SQL 或常用数据分析工具

福利待遇

  • 薪资范围:30-60K
  • 工作地点:北京海淀区大恒科技大厦
  • 有机会与算法、工程、数据标注、业务产品团队紧密协作
  • 持续跟踪行业前沿技术,参与大模型评测体系创新

工作地址

北京海淀区大恒科技大厦12F