返回岗位列表

美团

AI Agent评测专家

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

围绕OpenClaw、Claude Code等主流Agent框架,设计并落地适配长程任务场景的评测体系,确保Agent在真实约束下的交付稳定性与可度量性;设计Coding、数据分析等核心生产力场景的端到端评测流程,搭建自动化评测数据生产与自动化Rubrics生成的标准化pipeline

岗位职责

  • 围绕OpenClaw、Claude Code等主流Agent框架,设计并落地适配长程任务场景的评测体系,确保Agent在真实约束下的交付稳定性与可度量性
  • 设计Coding、数据分析等核心生产力场景的端到端评测流程,搭建自动化评测数据生产与自动化Rubrics生成的标准化pipeline
  • 建设具备强技术背景的专家标注资源池,确保Case评审、效果判定等关键环节的专业度与一致性
  • 将评测数据转化为模型迭代的策略输入,建立“评测→归因→策略建议→效果验证”的数据驱动闭环,推动Agent能力持续提升
  • 持续跟踪OpenClaw、Claude Code及行业前沿Agent框架的能力演进与架构变化,及时调整评测策略与度量标准

任职要求

  • 主导构建覆盖“认知-决策-执行”全链路的Agent评测体系,推动Agent从Demo走向生产
  • 关注AI Agent从“能对话”走向“能交付”的范式变革,具备前瞻性视野
  • 欢迎算法或工程背景转型,具备从“实现能力”转向“定义效果”的意愿与潜力
  • 能够从“写代码/训模型”转向“搭体系/做闭环”,具备体系化思维

福利待遇

  • 参与定义行业评测标准,引领Agent技术发展方向
  • 处于AI Agent范式变革的关键节点,获得前沿技术实践机会
  • 提供从技术实现向效果定义转型的友好环境与成长路径