产业 / 媒体
付费用户更优质,免费用户风险更高
OpenAI正在向美国18岁以上用户推出“Health in ChatGPT”功能,允许连接Apple Health、医疗记录和健康应用,用于查看化验结果、准备就诊和分析健康数据。然而,免费用户获得的健康建议质量较低,因为该功能基于GPT-5.5 Instant模型,而付费用户则使用更强大的GPT-5.6 Sol模型。尽管OpenAI声称两个模型在健康基准测试中都优于医生回答,但专家警告AI聊天机器人可能以高置信度给出错误结果,而非承认不确定性。超过3亿人每周向ChatGPT咨询健康问题,但该功能尚未在欧洲推出。
OpenAI正在向美国18岁以上用户推出“Health in ChatGPT”功能,允许用户连接Apple Health、医疗记录和健康应用,用于查看化验结果、准备就诊和分析睡眠或活动数据。OpenAI表示不会将连接的健康数据用于模型训练或广告。该功能自1月公布并测试以来,已吸引超过3亿用户每周向ChatGPT咨询健康问题。
免费用户获得的健康建议质量较低,因为该功能基于GPT-5.5 Instant模型,而付费用户则使用更强大的GPT-5.6 Sol模型。在OpenAI的HealthBench Professional测试中,GPT-5.6 Sol在完整性(88.0%对53.2%)和健康决策有用性(83.0%对50.8%)方面显著优于GPT-5.5 Instant。OpenAI可能以两个模型都优于医生回答为由,为这种分层系统辩护。
然而,基准测试来自人工测试环境,医生可能因时间压力、疲劳或缺乏患者记录而得分较低。基准测试也无法捕捉实际医疗检查中的许多要素,如医生面对面检查患者、捕捉非语言线索和利用多年经验评估整体状况。OpenAI在公告中反复强调ChatGPT仍可能犯错,不能替代医疗建议。
OpenAI早期测试发现,超过70%的参与者在专用健康部分之外询问健康问题,因为切换过于繁琐。公司随后使Health功能可在任何对话中使用,同时保留专用部分用于管理数据和访问历史健康聊天。OpenAI表示超过260名医生参与了健康功能的开发。
OpenAI尚未说明健康功能是否或何时在欧洲推出。1月公布时,它明确排除了欧洲经济区、瑞士和英国。更严格的欧盟数据隐私规则以及该功能可能被归类为高风险AI系统的可能性是主要原因。在最新的放射学基准测试RadLE 2.0中,16个AI模型无一表现优于人类放射科医生,主要问题是聊天机器人以高置信度给出错误结果,而非承认局限性。
AI的过度自信、说服力和谄媚行为(即聊天机器人验证用户而非挑战错误假设)已导致严重的心理健康伤害。尽管如此,一些报告显示AI在健康数据中发现医疗专业人员遗漏的模式,有时结果惊人。研究人员将AI代理比作飞机自动驾驶仪:这些系统可以支持并减轻医疗专业人员的工作负担,但最终责任始终在医生身上。
要点
- OpenAI向美国用户推出Health in ChatGPT功能,免费用户使用较弱模型,付费用户享受更强模型。
- 付费用户使用的GPT-5.6 Sol在健康基准测试中显著优于免费用户的GPT-5.5 Instant。
- 超过3亿人每周向ChatGPT咨询健康问题,但AI可能以高置信度给出错误结果。
- 健康功能尚未在欧洲推出,可能因欧盟严格的数据隐私法规。
- AI在健康数据中可能发现人类遗漏的模式,但最终责任仍在医生。
原始标题:ChatGPT will give you worse health advice if you don't pay
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。