我们介绍了一项通过全国规模研究,探索AI用于鉴别诊断与症状检查的开创性研究成果。
大部分临床诊断可以仅通过语言访谈得出。这类诊断性访谈通常由临床医生通过线上或线下的医患互动来完成。尽管这类交互是症状评估的黄金标准,但由于经济、地理及系统性障碍,其可及性往往受到限制。当前的语言模型在经过精心整理的医学案例评估中,已展现出较强的鉴别诊断能力,这也凸显了其辅助诊断的潜力。然而,现有评估大多依赖经过高度整理、信息详尽甚至人工合成的病例描述,可能无法反映真实世界中患者的实际表现。这些评估并未捕捉到普通患者描述症状时的真实状态,例如医学素养参差不齐、信息不完整,以及自然对话中出现的各种复杂情况。这是一个关键缺口,导致语言模型在真实场景中的表现存在较大不确定性。
为填补这一缺口,我们开展了一项现场对比研究,测试了一组实验性对话AI智能体原型,旨在探索对话式AI如何完成端到端的症状访谈与鉴别诊断评估,以供研究基准测试使用。在我们最新发表的论文《SymptomAI:面向日常症状评估的对话式AI智能体》中,我们报告了一项全国规模随机研究(n=13,917)的成果。在该研究中,获得知情同意的参与者与五种基于Gemini Flash 2.0的SymptomAI智能体之一进行交互。研究过程中生成的所有诊断、标签和疾病关联仅用于研究分析,不构成经临床确认的诊断或官方医疗评估。在与AI智能体交互两周后,我们邀请参与者反馈其就医所获得的诊断结果。基于这些数据,我们开展了临床专家标注研究,将SymptomAI的诊断表现与真实临床医生的医疗评估进行了对比。
在评估SymptomAI鉴别诊断准确性之后,我们进一步将其诊断结果与参与者在与AI对话前一段时间内的Fitbit可穿戴设备生物信号进行比对。结果显示,SymptomAI判断为感染性疾病病因的对话,与可能指示免疫反应的生理趋势相吻合,为SymptomAI的诊断性能提供了进一步佐证。
研究设计与参与者互动方式
本研究部署了一套对话AI智能体,用于端到端的患者访谈与鉴别诊断评估。参与者可与智能体就其症状展开对话,获得候选鉴别诊断列表,并进入后续诊断环节。
共有13,917名知情同意的研究参与者,每人向五种随机分配的SymptomAI智能体之一描述自身症状,各智能体在症状访谈方式上具有不同程度的灵活性。在对话过程中,参与者描述症状,SymptomAI则提出追问,最终形成鉴别诊断结果(即一份包含多个可能诊断的列表)及后续建议。参与者随后可选择就医,并被要求在两周后通过问卷分享就诊结果。为评估SymptomAI的表现,我们还开展了临床专家标注研究:由三名通过委员会认证的临床医生审阅对话记录,并提供各自的评估意见(即鉴别诊断)。随后,每位医生以盲审方式对SymptomAI和其他医生提供的鉴别诊断进行排名。
研究结果显示,在超过50%的案例中,临床医生对SymptomAI生成的鉴别诊断的评价优于其他临床医生的诊断,表明SymptomAI的诊断质量与临床医生相当甚至更优。
SymptomAI生成的鉴别诊断被临床评估者评为最佳诊断的概率更高。
在Top-5准确率(即参与者就诊医生给出的真实诊断是否出现在鉴别诊断列表的前五项中)方面,临床医生判定SymptomAI生成的鉴别诊断准确的频率同样高于其他临床医生的诊断。
SymptomAI生成的鉴别诊断更有可能涵盖就诊医生给出的真实诊断结果。
不同访谈策略的效果比较
本研究还评估了不同病史采集访谈方式的效果。参与者被随机分配至五个研究组,每组采用不同的提示策略:两组(Dynamic Live和Dynamic Final)具有完全的自由追问权限,两组(Fixed Canonical和Fixed Canonical的灵活版本)采用医学院标准病史采集问题,最后一组为无提示的基础大语言模型,代表当前用户与大语言模型聊天机器人交互的默认状态。结果表明,所有主动提问策略(即SymptomAI主动向参与者提问的情形)的表现均显著优于基础组,验证了主动信息收集对提升鉴别诊断准确性的重要价值。
此外,研究发现SymptomAI在临床医生对自身诊断信心最低的案例中,超越临床基准的幅度最为显著。
生物信号分析的潜力
鉴于SymptomAI相对于临床基准的准确性,我们还可以探索其大规模应用潜力。目前,临床标注的高昂成本限制了真实世界中人群规模数据集的分析。SymptomAI等准确的症状检查系统,有望实现临床质量诊断的自动化参考标注,从而为生理数据的大规模分析提供支撑——这在目前尚属不可能完成的任务。
其中一个典型应用场景是将可穿戴设备的生物信号与不同类别的疾病进行关联分析。急性呼吸道感染在可穿戴生物信号中表现出最为显著的变化。为在人群规模上研究这一现象,我们收集了参与者在与SymptomAI交互前最多30天内的每日生物特征数据。结果显示,在用户报告症状的前几天,生物信号出现了明显偏移,提示症状发作的时间节点。值得注意的是,组间差异是通过对SymptomAI首选候选诊断进行分类、并将呼吸道感染诊断归为一组来实现的,该组排除了过敏性鼻炎或慢性阻塞性肺病等非感染性呼吸系统疾病。可穿戴生物信号偏移峰值与参与者报告症状日期的吻合,为其所报告症状提供了可观测的生理学证据。
基于AI的症状评估为新型研究打开了大门。通过SymptomAI分析大量症状报告,并与实时Fitbit数据相结合,我们可以探索多种疾病的数字生物信号表型。分析揭示了生理指标的明显变化,包括心血管功能、呼吸、皮肤温度和睡眠质量,这些变化发生在用户与SymptomAI对话前的数天内,且与症状对话的时间高度吻合,这为验证患者自报症状或提供被动数据、辅助鉴别诊断提供了可能的路径。此外,实时可及性也凸显了AI症状检查的一项核心优势:与可能因排班延误而推迟的传统门诊不同,参与者可在症状出现时即时参与SymptomAI研究,这有助于提高患者自报发病时间的准确性——这对人群规模的健康分析至关重要。
局限性与未来展望
SymptomAI是一项探索性研究,代表了AI症状评估领域的重要研究进展,展示了其为寻求症状解读的公众提供帮助的潜力。尽管人群规模的部署评估揭示了远程患者访谈的症状评估准确性,但与临床医生评估进行比较时仍存在一定局限。
首先,鉴别诊断本身具有模糊性,已报告的诊断也可能随时间推移发生变化和演进。症状评估是对某一时刻症状表现的快照,由于研究规模较大,我们无法对症状报告的频率和时间进行控制。部分参与者可能在更具代表性的体征尚未出现前便已报告症状,而另一些患有慢性病的参与者则可能在已有多年经验的情况下,在症状明显时才进行报告。未来研究可聚焦于疾病发展特定阶段的具体疾病,如代谢综合征早期或呼吸道感染初期症状。研究过程中生成的所有诊断、标签和疾病关联均为AI生成,仅供研究分析使用,不构成经临床确认的诊断或官方医疗评估。
其次,在本次评估中,临床医生审阅的是静态对话记录,无权自行追问。若由临床医生主导症状访谈,他们可能会直觉性地获取不同的信息。此外,尽管近期研究表明对话式AI系统能够以媲美临床医生的细致程度和准确性采集临床数据,但此类系统可能会错过肢体语言、视觉评估、病历记录等替代信号,以及在基层医疗中医患之间已有的信任关系。
总结
本研究由Joe Breda、Jake Sunshine与Daniel McDuff共同主导完成。感谢来自Google Research和Google DeepMind的共同作者与合作者对本研究的贡献。
Q&A
Q1:SymptomAI是什么?它能诊断疾病吗?
A:SymptomAI是谷歌研究团队开发的一种实验性对话AI智能体,用于通过自然对话进行症状访谈和鉴别诊断评估。它能根据用户描述的症状提出追问,并给出可能的诊断列表。但需要注意,SymptomAI生成的所有诊断结果仅供研究分析使用,不构成经临床确认的正式医疗诊断,不能替代医生的专业判断。
Q2:SymptomAI的诊断准确率如何,与真实医生相比怎么样?
A:研究结果显示,在超过50%的案例中,临床医生对SymptomAI生成的鉴别诊断评价优于其他临床医生的诊断。在Top-5准确率方面,SymptomAI生成的诊断列表包含患者就诊医生所给出真实诊断的比例也高于临床医生。尤其是在临床医生对自身诊断信心较低的案例中,SymptomAI超越临床基准的幅度最为显著。
Q3:SymptomAI是基于哪个大语言模型开发的,研究规模有多大?
A:SymptomAI基于谷歌的Gemini Flash 2.0大语言模型开发,共设计了五种不同提示策略的智能体变体。研究共招募了13,917名知情同意的参与者参与全国规模的随机对照研究,是目前同类研究中规模最大的一次,研究还结合了参与者的Fitbit可穿戴设备数据进行生理信号分析。