返回岗位列表

阶跃星辰

大模型评测算法实习生

地点:北京 薪资:330-630元/天 日期:2026-06-26

岗位摘要

参与大模型自动化评测框架的设计、开发与维护,支持与训练框架的联动开发,持续提升评测流程的稳定性、可扩展性和执行效率;跟进学术界与工业界最新的大模型评测基准,包括主客观评测、Agent Benchmark等,负责将相关指标和数据集快速、准确地集成到现有评测平台中

岗位职责

  • 参与大模型自动化评测框架的设计、开发与维护,支持与训练框架的联动开发,持续提升评测流程的稳定性、可扩展性和执行效率
  • 跟进学术界与工业界最新的大模型评测基准,包括主客观评测、Agent Benchmark等,负责将相关指标和数据集快速、准确地集成到现有评测平台中
  • 负责评测数据集的清洗、处理与管理,对大规模评测结果进行统计分析、深度挖掘和可视化呈现,为模型优化和迭代提供数据洞察
  • 协助团队完成多维度、多场景下的大模型能力评测,参与发版模型技术报告、评测分析报告等内容的撰写

任职要求

  • 计算机科学、软件工程、人工智能、电子信息等相关专业在读本科或研究生
  • 具备扎实的Python编程能力,代码风格良好,重视代码质量和工程规范
  • 具备较强的逻辑思维能力、快速学习能力和问题解决能力
  • 具备良好的沟通能力和团队协作意识
  • 能够连续线下实习3个月及以上,每周出勤不少于4天

加分项

  • 有 ACM/ICPC、NOI/OI/CSP 等编程竞赛经历并取得优异成绩者优先
  • 发表过 LLM 相关顶级会议论文,或具备主流开源 LLM 框架开发经验者优先
  • 有大模型 Agent 系统开发、评测系统开发、Benchmark 构建等相关经验者优先
  • 工程基础扎实,熟练使用 AI Agent 辅助 coding,有个人项目或开源社区贡献经验者优先
  • 对大模型评测、Agent Benchmark、模型能力分析、数据分析与可视化有浓厚兴趣
  • 深度参与大模型研发与发版流程,接触真实的大模型评测体系
  • 覆盖评测框架、Benchmark 接入、数据分析、模型报告等完整评测链路
  • 有机会了解模型能力迭代过程,为模型优化提供直接数据支持
  • 适合希望在 LLM Evaluation / Agent Benchmark / 大模型工程化 / 算法评测 方向深入发展的同学

福利待遇

  • 深度参与大模型研发与发版流程,接触真实的大模型评测体系
  • 覆盖评测框架、Benchmark接入、数据分析、模型报告等完整评测链路
  • 有机会了解模型能力迭代过程,为模型优化提供直接数据支持
  • 适合希望在LLM Evaluation、Agent Benchmark、大模型工程化、算法评测方向深入发展的同学

工作地址

北京海淀区大恒科技大厦-南座中关村大恒科技大厦南座12F