AI评估系统工程师
岗位摘要
构建一体化评估系统,定义并持续改进Agent Eval Platform,维护Internal Benchmark,支持不同Harness和Eval策略下的灵活评估;优化线上监控与评估体系,打通在线评估与离线评估的闭环
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 构建一体化评估系统,定义并持续改进Agent Eval Platform,维护Internal Benchmark,支持不同Harness和Eval策略下的灵活评估
- 优化线上监控与评估体系,打通在线评估与离线评估的闭环
- 构建和维护全面的评估套件,确保模型质量和产品发布及更新的一致性
- 指导产品工程师掌握快速工程最佳实践,帮助团队构建首个评估系统
- 与公司内其他评估团队建立持久合作关系,制定共享路线图,避免共享评估基础设施的公共悲剧
- 在快节奏环境中快速适应并创造性解决问题,支持模型功能的每日迭代
- 通过基建支持拓展评估维度,推动衡量行为偏差、Tokens效率、资源利用率等难以量化但关键的指标
任职要求
- 3年以上软件工程经验,精通Python编程,包括生产或研究基础设施
- 具备构建或运维分布式系统、数据管道或其他大规模可靠性基础设施的经验
- 与研究和产品团队协作,具备清晰的书面和口头沟通能力,尤其是向非专业人士解释技术结果
- 能胜任高速的模型迭代节奏
- 熟悉LLM及Agent核心概念和技术原理,包括Agent Loop、Skills、MCP、Memory、Multi-Agent等
- 对评估和常见评估Harness/Scaffold有深入研究
- 加分项:具备从零搭建评估体系的经验,包括定义任务、构建数据集、实现评分机制、验证并交付仪表盘
- 加分项:熟悉主流Agent评测Benchmark如Terminal bench、OS World、Apex Agent的评测框架和题目标准格式,了解如何解耦模型、Harness、Tasks和Eval
加分项
- 具备从零开始搭建一套新的评估体系,用于测试特定的 Agent 能力——从定义任务、构建数据集、实现评分机制、根据已知信号进行验证,并最终交付一个清晰易懂的仪表盘,展示评估结果熟悉主流 Agent 评测 Benchmark 如 Terminal bench、OS World、Apex Agent 的相关评测框架以及题目标准格式,了解如何在评估系统中解耦模型,Harness,Tasks 以及 Eval
- 每当每一个版本的模型版本迭代,或者模型发布,我们需要一套稳健与鲁棒的系统负责回答 “它在我们的产品中真的更好吗?”。当产品团队想要更改 Kimi 的模型行为,需要一套评估系统能够告诉他们是否破坏了模型 Golden behavior 以及应该如何改进
- 构建一体化评估系统
- 定义并且持续改进 Agent Eval Platform,维护 Internal Benchmark,支持在不同的 harness 以及 Eval 策略下灵活评估,优化线上监控与评估体系,打通在线评估与离线评估的闭环
- 打通训练与生产的评估
- 构建和维护全面的评估套件,以确保模型质量和产品发布及更新的一致性
- 指导产品工程师掌握快速工程最佳实践,并帮助团队构建他们的第一个评估;与公司内其他评估团队建立持久的合作关系,制定共享路线图,并避免在共享评估基础设施上出现 tragedy-of-the-commons
- 在快节奏的环境中工作,模型功能每天都在进步,需要快速适应和创造性地解决问题
- 通过基建支持拓展评估维度
- 推动团队去衡量那些难以衡量但是对于业务至关重要的指标——例如行为偏差、Tokens 效率、资源利用率
- 具备从零开始搭建一套新的评估体系,用于测试特定的 Agent 能力——从定义任务、构建数据集、实现评分机制、根据已知信号进行验证,并最终交付一个清晰易懂的仪表盘,展示评估结果
- 熟悉主流 Agent 评测 Benchmark 如 Terminal bench、OS World、Apex Agent 的相关评测框架以及题目标准格式,了解如何在评估系统中解耦模型,Harness,Tasks 以及 Eval
- 允许6个月内投递3个职位,请选择适合的职位进行投递
福利待遇
- 参与前沿AI模型评估体系建设
- 与顶尖研究和产品团队协作
- 快节奏创新环境,快速成长机会
- 推动关键业务指标评估的挑战性工作
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。