返回岗位列表

百度

医疗大模型评测专家

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

负责医疗健康场景下LLM/VLM/Agent等模型评测体系建设,设计数据驱动、可复现、可扩展的评测框架,覆盖医学问答、健康科普、辅助问诊、报告解读、用药咨询、多模态理解等核心场景;探索并落地智能化、平台化评测能力,包括LLM-as-Judge、自动化弱项挖掘、医疗风险识别、模型对比分析、评测任务调…

岗位职责

  • 负责医疗健康场景下LLM/VLM/Agent等模型评测体系建设,设计数据驱动、可复现、可扩展的评测框架,覆盖医学问答、健康科普、辅助问诊、报告解读、用药咨询、多模态理解等核心场景
  • 探索并落地智能化、平台化评测能力,包括LLM-as-Judge、自动化弱项挖掘、医疗风险识别、模型对比分析、评测任务调度、指标看板、评测报告生成和多模型多版本回归分析
  • 基于评测结果开展模型误差归因与能力诊断,构建可复用的case mining、error analysis和能力边界分析方法,沉淀自动化诊断与质量监控能力,反向指导模型训练、post-training、prompt和产品策略优化
  • 持续跟踪医疗大模型、医学知识评测、多模态医疗理解、Agent评测、RAG评测、用户模拟评测等前沿方法,结合真实医疗健康业务场景建设评测范式,为模型迭代和产品上线提供质量决策依据

任职要求

  • 计算机、人工智能、自然语言处理、机器学习、统计学、数学等相关专业本科及以上学历,具备5年以上算法、NLP、模型评测或大模型相关经验
  • 具备系统性评测体系建设经验,熟悉benchmark构建、rubric设计、人工评测、自动评测、A/B实验、误差分析、质量闭环和模型上线验收机制
  • 具备扎实的数据分析与工程实现能力,熟练使用AI工具,理解ACC、AUC、F1、Recall、MAE、Bias、Cohen’s Kappa、置信区间、显著性检验等常用评测指标和统计方法
  • 对大模型前沿技术和评测范式有持续关注,熟悉LLM-as-Judge、偏好评估、对齐评测、Agent评测、RAG评测、多模态评测、自动化数据生成等方法,具备良好的问题抽象、跨团队协作和项目推进能力