大模型评测开发工程师
岗位摘要
设计并执行系统化评测,覆盖真实开发任务、长程多轮交互、工具调用、代码修改与提交、测试/构建/部署等全链路场景,识别不同 Code Agent 的优势与短板;参与构建并持续迭代 Code Agent 评测体系与标准,定义任务分层、指标体系、数据规范与打分口径,确保评测过程科学、可复现、可对比、可迭代
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计并执行系统化评测,覆盖真实开发任务、长程多轮交互、工具调用、代码修改与提交、测试/构建/部署等全链路场景,识别不同 Code Agent 的优势与短板
- 参与构建并持续迭代 Code Agent 评测体系与标准,定义任务分层、指标体系、数据规范与打分口径,确保评测过程科学、可复现、可对比、可迭代
- 设计并开发可扩展的自动化评测框架,支持多模型/多工具并行跑分、任务编排与环境隔离、过程日志与行为记录、结果归档与可视化
- 输出可复现的缺陷清单与复现脚本,定位 Agent 的典型失败模式,并沉淀为回归用例
- 定期输出深度评测报告,包含不同 Agent/模型的对比分析、关键案例拆解、指标解读及产品优化建议
- 构建高质量 Demo 与标准化任务集,帮助团队理解 Agent 能力边界,支撑模型优化与产品方向探索
任职要求
- 具备独立开发者背景或完整应用项目开发经验,能独立负责关键模块设计与实现
- 熟练掌握至少两门编程语言(Python / TypeScript / Golang / Rust 等)
- 一年以上 Code Agent 深度使用经验(如 Cursor、Copilot、Claude Code 等),熟悉 Agent 的多轮协作、工具调用与代码变更工作流
- 具备强逻辑思维与数据分析能力,能从复杂体验中抽象出指标与可复现评测流程,能对评测结果做统计解释与误差分析
- 有 AI 辅助开发相关开源项目经验或独立开发过有真实用户的产品者优选
- 在 AI Coding / Agent 评测领域有内容输出经历(教程、测评文章、基准设计等)者优选
- 具备 Benchmark/评测工程经验,如任务集设计、回归测试体系、CI 集成、容器化评测等者优选
- 具备产品思维,能从用户视角提出可落地的 Agent 产品优化方向者优选
加分项
- 有 AI 辅助开发相关的开源项目经验,或独立开发过有真实用户的产品
- 或组织过团队级代码评审/质量体系建设
- 在 AI Coding / Agent 评测领域有内容输出经历(教程、测评文章、项目案例、基准设计、工具链实践等)
- 有 Benchmark/评测工程经验:如任务集设计、回归测试体系、CI 集成、容器化评测、日志与可观测性建设等
- 具备产品思维,能从用户视角提出可落地的 agent 产品优化方向(交互、可控性、权限/安全、可解释性、成本效率等)
- 智谱华章 · 高级HRBP
福利待遇
- 具有竞争力的薪酬体系,薪资范围 40-70K,享受 16 薪
- 加入智谱华章,参与大模型前沿技术的探索与落地
工作地址
北京海淀区搜狐网络大厦11层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。