返回岗位列表

月之暗面

AI评估系统工程师

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

构建一体化评估系统,定义并持续改进Agent Eval Platform,维护Internal Benchmark,支持不同Harness和Eval策略下的灵活评估;优化线上监控与评估体系,打通在线评估与离线评估的闭环

岗位职责

  • 构建一体化评估系统,定义并持续改进Agent Eval Platform,维护Internal Benchmark,支持不同Harness和Eval策略下的灵活评估
  • 优化线上监控与评估体系,打通在线评估与离线评估的闭环
  • 构建和维护全面的评估套件,确保模型质量和产品发布及更新的一致性
  • 指导产品工程师掌握快速工程最佳实践,帮助团队构建首个评估系统
  • 与公司内其他评估团队建立持久合作关系,制定共享路线图,避免共享评估基础设施的公共悲剧
  • 在快节奏环境中快速适应并创造性解决问题,支持模型功能的每日迭代
  • 通过基建支持拓展评估维度,推动衡量行为偏差、Tokens效率、资源利用率等难以量化但关键的指标

任职要求

  • 3年以上软件工程经验,精通Python编程,包括生产或研究基础设施
  • 具备构建或运维分布式系统、数据管道或其他大规模可靠性基础设施的经验
  • 与研究和产品团队协作,具备清晰的书面和口头沟通能力,尤其是向非专业人士解释技术结果
  • 能胜任高速的模型迭代节奏
  • 熟悉LLM及Agent核心概念和技术原理,包括Agent Loop、Skills、MCP、Memory、Multi-Agent等
  • 对评估和常见评估Harness/Scaffold有深入研究
  • 加分项:具备从零搭建评估体系的经验,包括定义任务、构建数据集、实现评分机制、验证并交付仪表盘
  • 加分项:熟悉主流Agent评测Benchmark如Terminal bench、OS World、Apex Agent的评测框架和题目标准格式,了解如何解耦模型、Harness、Tasks和Eval

加分项

  • 具备从零开始搭建一套新的评估体系,用于测试特定的 Agent 能力——从定义任务、构建数据集、实现评分机制、根据已知信号进行验证,并最终交付一个清晰易懂的仪表盘,展示评估结果熟悉主流 Agent 评测 Benchmark 如 Terminal bench、OS World、Apex Agent 的相关评测框架以及题目标准格式,了解如何在评估系统中解耦模型,Harness,Tasks 以及 Eval
  • 每当每一个版本的模型版本迭代,或者模型发布,我们需要一套稳健与鲁棒的系统负责回答 “它在我们的产品中真的更好吗?”。当产品团队想要更改 Kimi 的模型行为,需要一套评估系统能够告诉他们是否破坏了模型 Golden behavior 以及应该如何改进
  • 构建一体化评估系统
  • 定义并且持续改进 Agent Eval Platform,维护 Internal Benchmark,支持在不同的 harness 以及 Eval 策略下灵活评估,优化线上监控与评估体系,打通在线评估与离线评估的闭环
  • 打通训练与生产的评估
  • 构建和维护全面的评估套件,以确保模型质量和产品发布及更新的一致性
  • 指导产品工程师掌握快速工程最佳实践,并帮助团队构建他们的第一个评估;与公司内其他评估团队建立持久的合作关系,制定共享路线图,并避免在共享评估基础设施上出现 tragedy-of-the-commons
  • 在快节奏的环境中工作,模型功能每天都在进步,需要快速适应和创造性地解决问题
  • 通过基建支持拓展评估维度
  • 推动团队去衡量那些难以衡量但是对于业务至关重要的指标——例如行为偏差、Tokens 效率、资源利用率
  • 具备从零开始搭建一套新的评估体系,用于测试特定的 Agent 能力——从定义任务、构建数据集、实现评分机制、根据已知信号进行验证,并最终交付一个清晰易懂的仪表盘,展示评估结果
  • 熟悉主流 Agent 评测 Benchmark 如 Terminal bench、OS World、Apex Agent 的相关评测框架以及题目标准格式,了解如何在评估系统中解耦模型,Harness,Tasks 以及 Eval
  • 允许6个月内投递3个职位,请选择适合的职位进行投递

福利待遇

  • 参与前沿AI模型评估体系建设
  • 与顶尖研究和产品团队协作
  • 快节奏创新环境,快速成长机会
  • 推动关键业务指标评估的挑战性工作