算法评测工程师
岗位摘要
参与公司自研或开源Code Agent框架的设计、开发与迭代,优化代码理解、工具调用、多轮交互、记忆管理及任务规划等核心能力;面向主流Code Agent(如Claude Code、Roo Code、Cline等)及自研框架,设计并执行系统化评测,构建覆盖真实开发任务、长程多轮交互、完整工具链(构…
岗位职责
- 参与公司自研或开源Code Agent框架的设计、开发与迭代,优化代码理解、工具调用、多轮交互、记忆管理及任务规划等核心能力
- 面向主流Code Agent(如Claude Code、Roo Code、Cline等)及自研框架,设计并执行系统化评测,构建覆盖真实开发任务、长程多轮交互、完整工具链(构建/测试/部署)的基准测试集
- 设计并开发高可扩展自动化评测平台,支持多Agent并行评测、环境隔离、过程可观测、结果自动化分析与可视化报告生成
- 创新评测方法论,通过设计算法自动识别Agent典型失败模式(如指令偏移、上下文遗忘、测试投机等),产出可复现的缺陷诊断包与回归用例
- 负责自研harness的评测与迭代,分析代码理解、任务规划、工具调用、多轮交互等环节的问题,推动产品能力优化
任职要求
- 具备AI Agent框架或复杂开发工具链的实际开发或深度迭代经验,熟悉其架构设计与核心模块
- 拥有一年以上深度使用AI编程工具(如Cursor、Copilot、Claude Code等)进行实际项目开发或大规模代码重构的经验,对其工作流与局限性有切身理解
- 熟练掌握Python及至少一门系统级语言(如Go/Rust/TypeScript),具备独立负责关键模块的设计与实现能力
- 具备优秀的软件工程素养,熟悉设计模式、代码规范与自动化测试
- 具备强大的逻辑思维与数据分析能力,能够从复杂交互中抽象出可量化的指标与科学对比实验方法
- 加分项:在AI辅助开发、开发者工具等领域有活跃的开源项目贡献或独立项目经历,GitHub有高质量公开代码
- 加分项:具备复杂系统、效能平台或工具链开发背景,熟悉高标准的工程实践与协作流程
- 加分项:在Benchmark设计、回归测试体系、CI/CD集成、容器化评测等方面有直接经验
- 加分项:能从终端开发者视角出发,将技术洞察转化为清晰的产品优化建议或特性需求
加分项
- 开源经历:在AI辅助开发、开发者工具等领域有活跃的开源项目贡献或独立项目经历,GitHub有高质量公开代码
- 平台工程背景:具备复杂系统、效能平台或工具链开发背景,熟悉高标准的工程实践与协作流程
- 评测工程专长:在Benchmark设计、回归测试体系、CI/CD集成、容器化评测等方面有直接经验
- 产品化思维:能从终端开发者视角出发,将技术洞察转化为清晰的产品优化建议或特性需求
- 崔女士 刚刚活跃
- 智谱华章 · 高级HRBP
福利待遇
- 提供40-70K·16薪的薪资待遇
工作地址
北京海淀区搜狐网络大厦11层