Agent 数据评测专家
岗位摘要
设计并构造高质量的Agent评测数据集,精准区分不同模型的能力边界,针对规划、工具调用、多轮交互、指令跟随等核心能力构建多样化测试场景与用例;持续迭代评测标准,确保评测体系能够跟进业界前沿并反映真实用户需求
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计并构造高质量的Agent评测数据集,精准区分不同模型的能力边界,针对规划、工具调用、多轮交互、指令跟随等核心能力构建多样化测试场景与用例
- 持续迭代评测标准,确保评测体系能够跟进业界前沿并反映真实用户需求
- 与研发团队紧密协作,围绕代码生成、通用Agent等场景设计高质量训练语料,构建端到端测试用例从多维度评估模型表现
- 与研究人员深度合作,探索不同数据标注策略对模型Agent能力的影响路径,研究模型能力的可控性检测方法
- 基于Claude Code、OpenClaw等主流Agent产品实践经验,系统性分析模型能力短板与失败模式,构建补齐数据与边界测试用例
- 推动模型在弱项上的持续迭代与突破,为训练策略优化提供数据侧支撑
任职要求
- 具备Claude Code、Cursor、OpenClaw等AI编程工具的重度使用经验,对LLM辅助开发有自己的理解与思考
- 熟练掌握Python,能够独立编写数据处理、评测脚本等工具
- 对大语言模型有基础认知且对探索大模型能力边界具有较高的热情
- 具备良好的自主能动性,能够独立发现问题、定义问题并推动解决
- 善于跨团队协作,能够与研发、算法团队高效配合
- 具有多年工程开发经验、完成过大型项目的交付
加分项
- 有前端开发经验,熟悉 React 或 Vue 等主流框架,对前端设计有独立的审美与品味
- 有大模型数据标注、评测体系设计或数据质量管理经验
工作地址
北京海淀区融科资讯中心C座
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。