AI资讯 / 工程

工程 / 工程

AWS开源38个医疗AI智能体技能,推理准确率提升最高86%

AWS Machine Learning

AI智能体在医疗健康与生命科学(HCLS)场景中存在一个隐蔽但危险的缺陷:它们能够引用正确的临床指南,却在实际应用时出现逻辑错误。例如,要求智能体依据ACMG/AMP标准对TP53错义变异进行分类时,模型会正确引用框架,却错误归类证据类别、跳过种群频率阈值或捏造计算预测分数。这类「看似正确」的输出在变异解读、理赔审核、临床试验设计等场景中可能带来监管与患者安全风险。为此,AWS发布了包含38个开源智能体技能的HCLS Agent Skills集合,覆盖基因组学、药物发现、医疗影像等11个领域。这些技能以结构化Markdown文档形式编码领域决策流程,可在Amazon Bedrock、Strands SDK、Kiro等20余个服务上直接使用,无需微调模型。基于410道提示词的评测显示,配备技能的智能体在与未配备技能的同类智能体的对比中胜率达70-86%,批判性思维维度的提升效果最为显著。

基础模型在医疗健康领域的核心问题并非知识缺失,而是缺乏结构化推理程序。临床从业者经过多年训练内化的决策流程,无法仅凭训练数据或系统提示词传递给模型。当智能体被要求执行变异分类、风险调整编码或影像分析等任务时,它会生成表面合理但逻辑错误的输出,这种「沉默失败」在高风险医疗场景中尤为危险。AWS的HCLS Agent Skills项目正是为填补这一方法论缺口而设计。

该技能集合包含38个技能,分为推理技能与流水线技能两类。推理技能编码方法论与决策框架,指导智能体的思考方式,例如基因组变异解读技能完整编码了ACMG/AMP分类框架,包括证据类别、种群频率阈值和计算预测截断值。流水线技能则编码工具命令、验证参数和代码模板,例如变异调用技能提供带有正确注释组的GATK4 HaplotypeCaller命令及Mutect2肿瘤-正常配置。两类技能共同赋予智能体正确决策的判断力与精确执行的技术能力。

与检索增强生成(RAG)和模型微调相比,智能体技能具有三项独特优势。首先是可审计性:所有决策标准以人类可读的Markdown格式呈现,不隐藏在模型权重中。其次是可移植性:单一技能文件可跨Amazon Bedrock AgentCore、AWS Strands Agents SDK、Kiro、Claude Code、OpenAI Codex等20余个服务使用,无需针对各平台定制。第三是易维护性:医疗政策年度更新或新实验标准只需编辑文本文件即可反映,无需重新训练模型。

在安装与集成方面,该项目提供了灵活的多平台支持。用户可通过克隆GitHub仓库并运行通用技能CLI命令快速安装,也可针对Kiro、AWS Strands Agents SDK、AgentCore或Amazon Quick Desktop分别使用对应的安装脚本和API。以Strands SDK为例,仅需数行Python代码即可将技能目录加载至智能体实例。对于生产环境,AgentCore提供托管托管、自动扩缩容、安全边界和可观测性能力,适合企业级部署场景。

实际效果通过三个典型用例得到验证。在风险调整编码场景中,配备技能的智能体在收到关于ICD编码RAF影响的查询时,能够自动触发风险调整技能,输出具体的HCC映射、层级解析和量化RAF差值,而非泛泛建议用户「查阅文档」。基于410道提示词的系统评测显示,配备技能的智能体在头对头比较中胜率达70-86%,其中批判性思维维度的效果量(Cohen's d)达到0.65-1.03,提升效果最为显著。所有技能均以MIT-0许可证开源发布,用户也可根据自身场景定制和扩展技能。

要点

  • 基础模型在HCLS场景中的主要缺陷是缺乏结构化推理程序,而非领域知识不足,这导致输出看似正确但逻辑错误,存在患者安全风险。
  • AWS发布的38个开源智能体技能覆盖11个HCLS领域,分为推理技能和流水线技能两类,分别解决决策判断和技术执行两个层面的问题。
  • 相比RAG和微调,智能体技能具备可审计、可移植、易维护三大优势,支持跨20余个AI服务平台使用,医疗政策更新只需修改文本文件。
  • 410道提示词评测显示配备技能的智能体胜率达70-86%,批判性思维维度效果量最高达1.03,改善效果显著且可量化。
  • 该项目以MIT-0许可证完全开源,用户可在现有技能基础上自定义扩展,适配特定业务场景的决策流程。
查看原始来源

原始标题:Improving HCLS AI reasoning with open-source agent skills

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。