大模型评测算法实习生
岗位摘要
参与大模型自动化评测框架的设计、开发与维护,支持与训练框架的联动开发,持续提升评测流程的稳定性、可扩展性和执行效率;跟进学术界与工业界最新的大模型评测基准,包括主客观评测、Agent Benchmark等,负责将相关指标和数据集快速、准确地集成到现有评测平台中
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与大模型自动化评测框架的设计、开发与维护,支持与训练框架的联动开发,持续提升评测流程的稳定性、可扩展性和执行效率
- 跟进学术界与工业界最新的大模型评测基准,包括主客观评测、Agent Benchmark等,负责将相关指标和数据集快速、准确地集成到现有评测平台中
- 负责评测数据集的清洗、处理与管理,对大规模评测结果进行统计分析、深度挖掘和可视化呈现,为模型优化和迭代提供数据洞察
- 协助团队完成多维度、多场景下的大模型能力评测,参与发版模型技术报告、评测分析报告等内容的撰写
任职要求
- 计算机科学、软件工程、人工智能、电子信息等相关专业在读本科或研究生
- 具备扎实的Python编程能力,代码风格良好,重视代码质量和工程规范
- 具备较强的逻辑思维能力、快速学习能力和问题解决能力
- 具备良好的沟通能力和团队协作意识
- 能够连续线下实习3个月及以上,每周出勤不少于4天
加分项
- 有 ACM/ICPC、NOI/OI/CSP 等编程竞赛经历并取得优异成绩者优先
- 发表过 LLM 相关顶级会议论文,或具备主流开源 LLM 框架开发经验者优先
- 有大模型 Agent 系统开发、评测系统开发、Benchmark 构建等相关经验者优先
- 工程基础扎实,熟练使用 AI Agent 辅助 coding,有个人项目或开源社区贡献经验者优先
- 对大模型评测、Agent Benchmark、模型能力分析、数据分析与可视化有浓厚兴趣
- 深度参与大模型研发与发版流程,接触真实的大模型评测体系
- 覆盖评测框架、Benchmark 接入、数据分析、模型报告等完整评测链路
- 有机会了解模型能力迭代过程,为模型优化提供直接数据支持
- 适合希望在 LLM Evaluation / Agent Benchmark / 大模型工程化 / 算法评测 方向深入发展的同学
福利待遇
- 深度参与大模型研发与发版流程,接触真实的大模型评测体系
- 覆盖评测框架、Benchmark接入、数据分析、模型报告等完整评测链路
- 有机会了解模型能力迭代过程,为模型优化提供直接数据支持
- 适合希望在LLM Evaluation、Agent Benchmark、大模型工程化、算法评测方向深入发展的同学
工作地址
北京海淀区大恒科技大厦-南座中关村大恒科技大厦南座12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。