返回岗位列表

DeepSeek

Agent 数据评测专家

地点:北京 薪资:25-50K 日期:2026-05-08

岗位摘要

设计并构造高质量的Agent评测数据集,精准区分不同模型的能力边界,针对规划、工具调用、多轮交互、指令跟随等核心能力构建多样化测试场景与用例;持续迭代评测标准,确保评测体系能够跟进业界前沿并反映真实用户需求

岗位职责

  • 设计并构造高质量的Agent评测数据集,精准区分不同模型的能力边界,针对规划、工具调用、多轮交互、指令跟随等核心能力构建多样化测试场景与用例
  • 持续迭代评测标准,确保评测体系能够跟进业界前沿并反映真实用户需求
  • 与研发团队紧密协作,围绕代码生成、通用Agent等场景设计高质量训练语料,构建端到端测试用例从多维度评估模型表现
  • 与研究人员深度合作,探索不同数据标注策略对模型Agent能力的影响路径,研究模型能力的可控性检测方法
  • 基于Claude Code、OpenClaw等主流Agent产品实践经验,系统性分析模型能力短板与失败模式,构建补齐数据与边界测试用例
  • 推动模型在弱项上的持续迭代与突破,为训练策略优化提供数据侧支撑

任职要求

  • 具备Claude Code、Cursor、OpenClaw等AI编程工具的重度使用经验,对LLM辅助开发有自己的理解与思考
  • 熟练掌握Python,能够独立编写数据处理、评测脚本等工具
  • 对大语言模型有基础认知且对探索大模型能力边界具有较高的热情
  • 具备良好的自主能动性,能够独立发现问题、定义问题并推动解决
  • 善于跨团队协作,能够与研发、算法团队高效配合
  • 具有多年工程开发经验、完成过大型项目的交付

加分项

  • 有前端开发经验,熟悉 React 或 Vue 等主流框架,对前端设计有独立的审美与品味
  • 有大模型数据标注、评测体系设计或数据质量管理经验

工作地址

北京海淀区融科资讯中心C座