Agent / 工程
LangSmith 如何成为医疗 AI 的可靠性基础设施
医疗 AI 系统的准确性往往取决于工程团队之外的专业人士——临床医生的时间是整个系统中最稀缺的资源。LangSmith 帮助医疗 AI 团队将这种专家判断转化为可复用的标注数据集、校准评估器和自动化发布门控,而非每次迭代都从零开始。Abridge 利用 LangSmith 运行评估流程,将发布周期从原来的一到两个月压缩至数天;Included Health 则借助 LangSmith 监控其 AI 健康向导 Dot 的路由质量与安全性,上线后聊天参与度提升 75%,高风险情况识别准确率超过 99%。两家机构的实践表明,医疗 AI 评估的核心挑战在于:临床正确答案并非唯一、正确的不作为同样需要被评估,以及审查者的专业背景本身就是评估规范的一部分。将临床专业知识转化为可持续运作的基础设施,是让专家判断价值持续复利的关键路径。
在医疗 AI 领域,工程团队构建的系统是否真正可靠,最终裁判往往是临床医生。一位医生能迅速判断生成的病历是否正确归因了某个症状,或患者是否被推荐了最合适的护理级别。然而,面对数以千计的就诊记录,这种人工审查无法无限持续。随着规模扩大,专家验证本身成为整个系统的瓶颈。许多医疗 AI 团队因此开始将临床审查视为基础设施,而非反复发生的运营成本。
Included Health 构建了由 LangGraph 和 Deep Agents 驱动的 AI 向导 Dot,它能解读模糊的用户需求、回答保险和账单问题、将用户路由至合适的护理渠道,并识别紧急情况。评估 Dot 不仅要检验其回答的准确性,还要判断它是否充分利用了用户的完整上下文来推荐安全且恰当的下一步行动。Abridge 则专注于将患者与临床医生的对话转化为临床笔记,在这一场景中,信息归因至关重要——若将患者的陈述误标为医生的结论,症状可能被错误地转化为可计费诊断。
医疗 AI 评估面临三项核心挑战,使得专家判断难以直接规模化复制。首先,临床笔记不存在唯一的标准答案,合理的专家之间本就可能存在分歧;其次,正确的不作为同样需要被评估,例如紧急情况守卫是否在恰当时机触发、在良性情况下是否保持静默;第三,审查者的专业背景本身构成评估规范的一部分——Abridge 会预先确定某项评估是否需要持证医师或特定专科医生参与。
Abridge 的评估体系从已知的失败模式出发,将其按发生频率和严重程度排序,归类为准确性、合规性、风格和完整性等维度,并为每类问题构建独立的评估器。这种方式取代了单一的综合质量评分,能够针对性地检测笔记可能出现的具体错误。在技术实现上,Abridge 同时采用两种互补的评估方法:无参考评估器直接将笔记与源对话进行比对,可跨就诊场景泛化并在生产环境中持续运行;有参考评估器则将输出与精心策划的示例进行比较,能够捕捉特定医学专科所需的细节与语境。
LangSmith 在这一流程中扮演了关键角色。通过 Align Evaluator 功能,团队可以将自动化评估器的打分结果与临床医生的标注进行对比校准,确保评估器的判断与专家判断保持一致。Abridge 表示,这套机制将原本需要人工反复调整提示词的过程自动化,显著降低了每次迭代的人力投入。Included Health 则利用 LangSmith 的监控能力持续追踪路由质量和安全标志的触发情况,在产品上线后实现了对高风险场景超过 99% 的准确识别。
两家机构的实践共同指向一个核心理念:专家判断的价值不应随单次审查结束而消散,而应通过标注数据集、校准评估器和自动化发布门控等形式持续积累。正如 Abridge 团队所言,信任是一滴一滴积累的,却可能在瞬间崩塌。将临床专业知识转化为可复用的评估基础设施,不是为了取代人类判断,而是让每一次专家投入的价值在未来的每一次发布中持续发挥作用。
要点
- Abridge 借助 LangSmith 将发布周期从一到两个月压缩至数天,核心在于将临床审查转化为可复用的评估器和标注数据集。
- Included Health 的 AI 向导 Dot 上线后聊天参与度提升 75%,高风险情况识别准确率超过 99%,LangSmith 的持续监控是关键支撑。
- 医疗 AI 评估需同时覆盖正确行动与正确不作为,单一综合评分无法满足临床场景的精细化需求。
- 无参考评估器与有参考评估器的组合使用,能够在跨场景泛化能力与专科细节捕捉之间取得平衡。
- 将临床专业知识视为可持续积累的基础设施而非一次性成本,是医疗 AI 团队实现安全规模化的关键路径。
原始标题:The Reliability Layer for Healthcare AI: Common LangSmith Use Cases
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。