评估系统工程师
岗位摘要
构建一体化评估系统:定义并持续改进Agent Eval Platform,维护Internal Benchmark,支持不同harness和Eval策略下的灵活评估,优化线上监控与评估体系,打通在线评估与离线评估的闭环
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 构建一体化评估系统:定义并持续改进Agent Eval Platform,维护Internal Benchmark,支持不同harness和Eval策略下的灵活评估,优化线上监控与评估体系,打通在线评估与离线评估的闭环
- 打通训练与生产的评估:构建和维护全面的评估套件,确保模型质量和产品发布及更新的一致性
- 团队协作:指导产品工程师掌握快速工程最佳实践,帮助团队构建他们的第一个评估;与公司内其他评估团队建立持久的合作关系,制定共享路线图,避免共享评估基础设施上的公地悲剧
- 快速迭代:在快节奏环境中工作,适应模型功能的每日进步,快速解决问题
- 通过基建支持拓展评估维度:推动团队衡量难以衡量但对业务至关重要的指标,如行为偏差、Tokens效率、资源利用率
任职要求
- 3年以上软件工程经验,精通Python编程,包括生产或研究基础设施,具备构建或运维分布式系统、数据管道或其他需要大规模可靠性的基础设施的经验
- 与研究和产品团队协作,具备清晰的书面和口头沟通能力,尤其是向非专业人士解释技术结果;能胜任高速的模型迭代节奏
- 熟悉LLM及Agent相关的核心概念和技术原理,包括Agent Loop、Skills、MCP、Memory、Multi-Agent等知识,对评估和常见评估harness/Scaffold有深入研究
- 加分项:具备从零搭建评估体系的经验,包括定义任务、构建数据集、实现评分机制、验证并交付清晰易懂的仪表盘
- 加分项:熟悉主流Agent评测Benchmark如Terminal bench、OS World、Apex Agent的评测框架及题目标准格式,了解如何在评估系统中解耦模型、Harness、Tasks及Eval
加分项
- 具备从零开始搭建一套新的评估体系,用于测试特定的 Agent 能力——从定义任务、构建数据集、实现评分机制、根据已知信号进行验证,并最终交付一个清晰易懂的仪表盘,展示评估结果
- 熟悉主流 Agent 评测 Benchmark 如 Terminal bench、OS World、Apex Agent 的相关评测框架以及题目标准格式,了解如何在评估系统中解耦模型,Harness,Tasks 以及 Eval
福利待遇
- 薪资范围:35-55K·16薪
- 工作地点:北京海淀区京东科技大厦13F
- 与顶尖团队合作,参与前沿AI模型评估与迭代
- 快节奏创新环境,推动技术成长
工作地址
北京海淀区京东科技大厦13F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。