AI Agent评测专家
岗位摘要
建设Agent评测体系,深入理解Agent在复杂真实场景下的能力边界,系统性构建涵盖多场景、多模态、多任务类型的评测方法论,将效果好坏转化为科学、可量化的能力度量体系;持续跟踪国内外Agent评测领域前沿,主导设计具有挑战性与行业影响力的Benchmark,推动在小米内外部建立影响力
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 建设Agent评测体系,深入理解Agent在复杂真实场景下的能力边界,系统性构建涵盖多场景、多模态、多任务类型的评测方法论,将效果好坏转化为科学、可量化的能力度量体系
- 持续跟踪国内外Agent评测领域前沿,主导设计具有挑战性与行业影响力的Benchmark,推动在小米内外部建立影响力
- 将评测洞察转化为高质量训练数据与产品优化方向,驱动产品与模型的持续演进
- 作为评测方向的核心角色,与算法、产品、工程等多团队深度协作,以评测视角影响产品决策
任职要求
- 本科及以上学历,计算机、数学、统计或相关专业优先
- 5年以上相关工作经验,有AI产品或大模型领域背景优先
- 对Agent技术方向有深入理解,能够独立判断评测方案的合理性与完整性
- 熟悉主流LLM/Agent Benchmark,有独立研究或复现经验者优先
- 有评测数据集构建或训练数据标注体系设计的实际经验者优先
- 有车载、IoT、手机AI助手等AI场景的从业经历者优先
- 有强烈的产品直觉,能在技术语言与用户场景之间自由切换
- 主动性强,能在方向模糊的环境中自驱推进,有强目标感
- 对AI能力边界保持好奇心,热衷于深究模型为什么在这里失败
加分项
- 熟悉主流 LLM / Agent Benchmark,有独立研究或复现经验
- 有评测数据集构建或训练数据标注体系设计的实际经验
- 有车载、IoT、手机 AI 助手等 AI 场景的从业经历
福利待遇
- 具有竞争力的薪酬和绩效奖金
- 完善的五险一金及补充商业保险
- 弹性工作制,支持远程办公
- 丰富的职业发展机会和培训资源
- 员工股票期权计划
- 定期团队建设活动和节日福利
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。