医疗大模型评测专家
岗位摘要
负责医疗健康场景下LLM/VLM/Agent等模型评测体系建设,设计数据驱动、可复现、可扩展的评测框架,覆盖医学问答、健康科普、辅助问诊、报告解读、用药咨询、多模态理解等核心场景;探索并落地智能化、平台化评测能力,包括LLM-as-Judge、自动化弱项挖掘、医疗风险识别、模型对比分析、评测任务调…
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责医疗健康场景下LLM/VLM/Agent等模型评测体系建设,设计数据驱动、可复现、可扩展的评测框架,覆盖医学问答、健康科普、辅助问诊、报告解读、用药咨询、多模态理解等核心场景
- 探索并落地智能化、平台化评测能力,包括LLM-as-Judge、自动化弱项挖掘、医疗风险识别、模型对比分析、评测任务调度、指标看板、评测报告生成和多模型多版本回归分析
- 基于评测结果开展模型误差归因与能力诊断,构建可复用的case mining、error analysis和能力边界分析方法,沉淀自动化诊断与质量监控能力,反向指导模型训练、post-training、prompt和产品策略优化
- 持续跟踪医疗大模型、医学知识评测、多模态医疗理解、Agent评测、RAG评测、用户模拟评测等前沿方法,结合真实医疗健康业务场景建设评测范式,为模型迭代和产品上线提供质量决策依据
任职要求
- 计算机、人工智能、自然语言处理、机器学习、统计学、数学等相关专业本科及以上学历,具备5年以上算法、NLP、模型评测或大模型相关经验
- 具备系统性评测体系建设经验,熟悉benchmark构建、rubric设计、人工评测、自动评测、A/B实验、误差分析、质量闭环和模型上线验收机制
- 具备扎实的数据分析与工程实现能力,熟练使用AI工具,理解ACC、AUC、F1、Recall、MAE、Bias、Cohen’s Kappa、置信区间、显著性检验等常用评测指标和统计方法
- 对大模型前沿技术和评测范式有持续关注,熟悉LLM-as-Judge、偏好评估、对齐评测、Agent评测、RAG评测、多模态评测、自动化数据生成等方法,具备良好的问题抽象、跨团队协作和项目推进能力
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。