大模型评测专家
岗位摘要
设计覆盖基座模型、端到端Agent、用户体验等场景的评测框架和标准,保障评测可解释可复现;主导Benchmark数据集构建与持续迭代,防控数据污染与评测失效;搭建自动化评测工程,通过judge model等自动评测流水线,设计多评委协作机制,控制评测偏见
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计覆盖基座模型、端到端Agent、用户体验等场景的评测框架和标准,保障评测可解释可复现
- 主导Benchmark数据集构建与持续迭代,防控数据污染与评测失效
- 搭建自动化评测工程,通过judge model等自动评测流水线,设计多评委协作机制,控制评测偏见
- 持续提升自动评测与人工标注的一致性,推动评测提效
- 主导评测/训练数据合成方案设计,建立标注规范与质检体系
- 与数据团队协作,保障大规模数据生产的稳定性与准确性
- 输出结构化评测报告,将评测结论转化为可落地的优化建议
- 与模型训练团队深度协作,建立评测→优化→再评测闭环
- 沉淀团队评测方法论,输出可复用框架与工具
任职要求
- 紧跟人工智能行业进展,接触到前沿技术和行业趋势
- 磨练出对人工智能的独到见解
- 参与大模型评测的全流程体系,了解从理论到工程实践的全面技能
- 与一流的人工智能团队合作,快速成长,提升自身能力
- 有机会参与部门的重点项目,跨足不同领域,拓宽人工智能技术的应用范围
福利待遇
- 紧跟人工智能行业进展,接触到前沿技术和行业趋势
- 磨练出对人工智能的独到见解
- 参与大模型评测的全流程体系,了解从理论到工程实践的全面技能
- 与一流的人工智能团队合作,快速成长,提升自身能力
- 有机会参与部门的重点项目,跨足不同领域,拓宽人工智能技术的应用范围
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。