
波士顿贝斯以色列女医生医院(BIDMC)与谷歌合作的一项最新研究显示,人工智能系统在真实临床环境中展现出惊人的潜力。这项发表于《柳叶刀》的研究表明,谷歌开发的对话式AI系统AMIE在辅助初级护理诊断方面,表现可比肩优秀的医学住院医师。
临床实测:高准确率与零安全事故
在2025年4月至11月期间,研究人员招募了114名成年人,其中98人完成了完整的AI聊天及门诊环节。在就诊前几天,患者先与AMIE进行居家对话。该系统通过提问探索症状,列出潜在病因和治疗方案,并生成摘要供医生参考。
结果令人瞩目:在四分之三的案例中,AI被证明对医生有益;超过一半的案例中,AI提供的信息改变了医生的诊疗计划。在诊断准确性方面,AMIE在前七种鉴别诊断中包含正确最终诊断的比例高达90%,前三位匹配率为75%,单一最高猜测准确率为56%。更重要的是,在数百轮对话中,系统未触发任何安全停止机制,仅出现一例幻觉,显示出极高的安全性。
BIDMC AI项目负责人Adam Rodman指出,该研究旨在建立现实世界AI对话的基线特征。共同第一作者Peter Brodeur表示,医生们普遍认为AI的表现优异,有助于他们在接诊前做好充分准备。
鲜明对比:消费级AI的健康风险
这一成果与近期针对消费级AI健康工具的评估形成强烈反差。今年二月发表在《自然·医学》上的一项研究显示,OpenAI的ChatGPT Health在模拟测试中漏诊了52%的紧急病例,常将糖尿病酮症酸中毒等危重情况错误建议为“24至48小时内就医”。此外,《BMC急诊医学》的荟萃分析也指出,当前大型语言模型在识别高危患者方面敏感性有限,尚不具备独立急诊分诊能力。
尽管存在风险,科技巨头仍在加速布局。OpenAI已于2026年1月推出专用健康聊天机器人,日均处理4000万次健康查询;亚马逊也在今年9月为其One Medical会员推出健康AI助手。然而,热情背后隐忧浮现:今年7月,一名佛罗里达州牧师起诉OpenAI,指控ChatGPT淡化肺栓塞症状并延误治疗。
行业困境:效率提升与信任危机并存
医疗系统正在权衡AI带来的效率与安全边界。英国国家医疗服务体系(NHS)正推广AI分诊功能,早期试点使电话排队减少29%,目标是在2028年4月前覆盖所有应用用户。在美国,麦肯锡估计AI目前可处理16%至22%的门诊护理。
但技术引入也引发了新的复杂问题。保险公司利用AI挑战医院提交的诊断代码,导致近两年近10亿美元的额外成本争议,患者面临意外账单风险。同时,医生群体内部也存在分歧:一方面,AI帮助发现被忽视的模式;另一方面,担忧实习生过度依赖工具而丧失诊断能力。
结论:谨慎的进步
谷歌强调,AMIE专为临床推理构建,而非通用搜索,其生成的摘要能让医生带着更充分的信息进入诊室,从而腾出时间处理复杂病例。然而,作者也承认研究存在规模小、单中心等局限性。所有患者均已预约就诊,且全程有人工监督,这与无监督的实际部署场景仍有差距。
AMIE的结果被视为一种谨慎的进步而非变革。它证明在严格监督下,对话式AI可以嵌入工作流并避免明显伤害。但要真正弥合实验室成功与床旁可靠性之间的差距,仍需更大规模、更多样化人群的长期研究,以验证其在减少急诊访问、降低成本和提高满意度方面的硬性指标。