评测工程师/研究员
岗位摘要
跟进学术界和企业界前沿的评测基准(如AIME、GPQA、HLE、Codeforces等);持续健全世界级SOTA模型(如OpenAI、Anthropic等发布的模型)的观测榜单;保证建设的评测体系与开源社区和头部闭源模型可对比
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 跟进学术界和企业界前沿的评测基准(如AIME、GPQA、HLE、Codeforces等)
- 持续健全世界级SOTA模型(如OpenAI、Anthropic等发布的模型)的观测榜单
- 保证建设的评测体系与开源社区和头部闭源模型可对比
- 建立完善的对点机制,保障评测结果的可靠性
- 日常维护评测榜单
- 健全评测工程体系
- 提高评测的效率
任职要求
- 熟悉AIME、GPQA、HLE、Codeforces、SWE、MultiChallenge、BrowseComp、Tau-Bench、Aider、MMMU、MathVista、charXiv-Reasoning等学术界和企业界前沿的AI评测基准
- 具备建设世界级SOTA模型观测榜单和健全评测体系的能力,能够保障与开源社区及头部闭源模型的对点对比机制
- 具备跟踪学术界和企业界前沿技术动态的敏锐度和信息收集能力
- 具备评测工程体系的开发、维护和效率优化能力,能够保障评测结果的可靠性
- 具备对OpenAI、Anthropic等顶级实验室发布的SOTA模型进行能力评估和分析的专业知识
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。