返回岗位列表

美团

大模型评测专家

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

设计覆盖基座模型、端到端Agent、用户体验等场景的评测框架和标准,保障评测可解释可复现;主导Benchmark数据集构建与持续迭代,防控数据污染与评测失效;搭建自动化评测工程,通过judge model等自动评测流水线,设计多评委协作机制,控制评测偏见

岗位职责

  • 设计覆盖基座模型、端到端Agent、用户体验等场景的评测框架和标准,保障评测可解释可复现
  • 主导Benchmark数据集构建与持续迭代,防控数据污染与评测失效
  • 搭建自动化评测工程,通过judge model等自动评测流水线,设计多评委协作机制,控制评测偏见
  • 持续提升自动评测与人工标注的一致性,推动评测提效
  • 主导评测/训练数据合成方案设计,建立标注规范与质检体系
  • 与数据团队协作,保障大规模数据生产的稳定性与准确性
  • 输出结构化评测报告,将评测结论转化为可落地的优化建议
  • 与模型训练团队深度协作,建立评测→优化→再评测闭环
  • 沉淀团队评测方法论,输出可复用框架与工具

任职要求

  • 紧跟人工智能行业进展,接触到前沿技术和行业趋势
  • 磨练出对人工智能的独到见解
  • 参与大模型评测的全流程体系,了解从理论到工程实践的全面技能
  • 与一流的人工智能团队合作,快速成长,提升自身能力
  • 有机会参与部门的重点项目,跨足不同领域,拓宽人工智能技术的应用范围

福利待遇

  • 紧跟人工智能行业进展,接触到前沿技术和行业趋势
  • 磨练出对人工智能的独到见解
  • 参与大模型评测的全流程体系,了解从理论到工程实践的全面技能
  • 与一流的人工智能团队合作,快速成长,提升自身能力
  • 有机会参与部门的重点项目,跨足不同领域,拓宽人工智能技术的应用范围