AI Agent评测专家
岗位摘要
围绕OpenClaw、Claude Code等主流Agent框架,设计并落地适配长程任务场景的评测体系,确保Agent在真实约束下的交付稳定性与可度量性;设计Coding、数据分析等核心生产力场景的端到端评测流程,搭建自动化评测数据生产与自动化Rubrics生成的标准化pipeline
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 围绕OpenClaw、Claude Code等主流Agent框架,设计并落地适配长程任务场景的评测体系,确保Agent在真实约束下的交付稳定性与可度量性
- 设计Coding、数据分析等核心生产力场景的端到端评测流程,搭建自动化评测数据生产与自动化Rubrics生成的标准化pipeline
- 建设具备强技术背景的专家标注资源池,确保Case评审、效果判定等关键环节的专业度与一致性
- 将评测数据转化为模型迭代的策略输入,建立“评测→归因→策略建议→效果验证”的数据驱动闭环,推动Agent能力持续提升
- 持续跟踪OpenClaw、Claude Code及行业前沿Agent框架的能力演进与架构变化,及时调整评测策略与度量标准
任职要求
- 主导构建覆盖“认知-决策-执行”全链路的Agent评测体系,推动Agent从Demo走向生产
- 关注AI Agent从“能对话”走向“能交付”的范式变革,具备前瞻性视野
- 欢迎算法或工程背景转型,具备从“实现能力”转向“定义效果”的意愿与潜力
- 能够从“写代码/训模型”转向“搭体系/做闭环”,具备体系化思维
福利待遇
- 参与定义行业评测标准,引领Agent技术发展方向
- 处于AI Agent范式变革的关键节点,获得前沿技术实践机会
- 提供从技术实现向效果定义转型的友好环境与成长路径
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。