大模型评测负责人
岗位摘要
从零到一构建覆盖文本、多模态(图/文/视频)、语音大模型的全生命周期评测体系,制定科学、客观、可量化的评测标准与指标;主导自动化评测平台与工具链的架构设计,实现大模型在预训练、SFT、RLHF等各阶段的自动化、常态化评测,支撑十亿/百亿/千亿级模型的快速迭代
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 从零到一构建覆盖文本、多模态(图/文/视频)、语音大模型的全生命周期评测体系,制定科学、客观、可量化的评测标准与指标
- 主导自动化评测平台与工具链的架构设计,实现大模型在预训练、SFT、RLHF等各阶段的自动化、常态化评测,支撑十亿/百亿/千亿级模型的快速迭代
- 构建高质量的通用评测集、行业垂类评测集以及对抗性测试集,确保评测集具备高区分度且严防数据泄露
- 紧密配合算法研发团队与业务团队,通过精准的诊断报告定位模型缺陷,为模型优化方向提供极具价值的“数据雷达”和改进建议
- 负责评测团队的梯队建设与人才培养,管理内部评测算法工程师,平衡评测的成本、效率与准确度
任职要求
- 计算机、数据科学、人工智能或相关专业硕士及以上学历(博士优先)
- 5年以上AI算法/NLP/多模态/语音相关研发或评测经验,2年以上团队管理经验
- 深入理解主流大模型(LLM, LMM, Audio-LLM)的原理、训练流程及局限性,精通主流开源评测框架(如 OpenCompass, AA等),并在多模态评估(VQA、视频理解)或语音评估(MOS、WER、端到端交互延迟)至少一个领域有深厚落地经验
- 熟悉 LLM-as-a-judge 机制,对人工评测(Human Evaluation)的信度/效度检验(如 Kappa 值、一致性校验)有严谨的方法论
- 极强的自驱力与批判性思维,对技术趋势敏感,能追踪最新的学术界/工业界评测动态
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。