Agent RL 算法研究员(实习)
岗位摘要
设计和构建Code Agent评测体系(Harness),包括benchmark设计、评测pipeline搭建、指标定义与分析;调研和复现前沿Agent评测框架,提出改进方案;搭建端到端的Agent能力评估环境(sandbox隔离、代码执行、多轮交互评测)
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计和构建Code Agent评测体系(Harness),包括benchmark设计、评测pipeline搭建、指标定义与分析
- 调研和复现前沿Agent评测框架,提出改进方案
- 搭建端到端的Agent能力评估环境(sandbox隔离、代码执行、多轮交互评测)
- 分析Agent行为trace,挖掘bad pattern,驱动prompt/策略优化
- 探索Agent能力的细粒度拆解
- 参与Code Agent产品的dogfood测试和真实场景评估
任职要求
- 计算机相关专业在读硕士/博士,或优秀本科生
- 熟悉Python,有实际的工程项⽬经验
- 对LLM Agent / Tool Use / Code Generation有浓厚兴趣,了解相关论文
- 参与过LLM评测/benchmark相关工作者优先
- 熟悉SWE-bench、TerminalBench等代码评测集者优先
- 有Agent框架(Claude Code/Codex等)使用或开发经验者优先
- 有Docker / 沙箱隔离经验者优先
- 主动性强,能独立推进研究问题
- 在顶会发表过Agent / Code Intelligence相关论文者优先
- 有开源项目贡献经验(特别是Agent或开发工具方向)者优先
- 熟悉多语言编程(不只是Python)者优先
- 自己搭建过或深度使用过Coding Agent(Cursor、Copilot、Aider、Devin等)者优先
加分项
- 在顶会发表过 Agent / Code Intelligence 相关论文 有开源项目贡献经验(特别是 Agent 或开发工具方向) 熟悉多语言编程(不只是 Python) 自己搭建过或深度使用过 Coding Agent(Cursor、Copilot、Aider、Devin 等) 你会获得 直接参与国内顶尖大模型团队的 Code Agent 核心方向 接触最前沿的 Agent 技术栈和海量真实用户场景 与算法、工程、产品多方协作,体验完整的 AI 产品闭环 表现优异者可获得 return offer
福利待遇
- 直接参与国内顶尖大模型团队的Code Agent核心方向
- 接触最前沿的Agent技术栈和海量真实用户场景
- 与算法、工程、产品多方协作,体验完整的AI产品闭环
- 表现优异者可获得return offer
工作地址
北京海淀区大恒科技大厦12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。