返回岗位列表

月之暗面

评估系统工程师

地点:北京 薪资:35-55K 日期:2026-06-26

岗位摘要

构建一体化评估系统:定义并持续改进Agent Eval Platform,维护Internal Benchmark,支持不同harness和Eval策略下的灵活评估,优化线上监控与评估体系,打通在线评估与离线评估的闭环

岗位职责

  • 构建一体化评估系统:定义并持续改进Agent Eval Platform,维护Internal Benchmark,支持不同harness和Eval策略下的灵活评估,优化线上监控与评估体系,打通在线评估与离线评估的闭环
  • 打通训练与生产的评估:构建和维护全面的评估套件,确保模型质量和产品发布及更新的一致性
  • 团队协作:指导产品工程师掌握快速工程最佳实践,帮助团队构建他们的第一个评估;与公司内其他评估团队建立持久的合作关系,制定共享路线图,避免共享评估基础设施上的公地悲剧
  • 快速迭代:在快节奏环境中工作,适应模型功能的每日进步,快速解决问题
  • 通过基建支持拓展评估维度:推动团队衡量难以衡量但对业务至关重要的指标,如行为偏差、Tokens效率、资源利用率

任职要求

  • 3年以上软件工程经验,精通Python编程,包括生产或研究基础设施,具备构建或运维分布式系统、数据管道或其他需要大规模可靠性的基础设施的经验
  • 与研究和产品团队协作,具备清晰的书面和口头沟通能力,尤其是向非专业人士解释技术结果;能胜任高速的模型迭代节奏
  • 熟悉LLM及Agent相关的核心概念和技术原理,包括Agent Loop、Skills、MCP、Memory、Multi-Agent等知识,对评估和常见评估harness/Scaffold有深入研究
  • 加分项:具备从零搭建评估体系的经验,包括定义任务、构建数据集、实现评分机制、验证并交付清晰易懂的仪表盘
  • 加分项:熟悉主流Agent评测Benchmark如Terminal bench、OS World、Apex Agent的评测框架及题目标准格式,了解如何在评估系统中解耦模型、Harness、Tasks及Eval

加分项

  • 具备从零开始搭建一套新的评估体系,用于测试特定的 Agent 能力——从定义任务、构建数据集、实现评分机制、根据已知信号进行验证,并最终交付一个清晰易懂的仪表盘,展示评估结果
  • 熟悉主流 Agent 评测 Benchmark 如 Terminal bench、OS World、Apex Agent 的相关评测框架以及题目标准格式,了解如何在评估系统中解耦模型,Harness,Tasks 以及 Eval

福利待遇

  • 薪资范围:35-55K·16薪
  • 工作地点:北京海淀区京东科技大厦13F
  • 与顶尖团队合作,参与前沿AI模型评估与迭代
  • 快节奏创新环境,推动技术成长

工作地址

北京海淀区京东科技大厦13F