概要:Google Research 与 Google DeepMind 近日发布了一项被其称为"同类首个"的研究——实验性医疗 AI 系统 AMIE(Articulate Medical Intelligence Explorer,清晰的医学智能探索者)完成了实时音视频临床视频问诊。这标志着医疗对话式 AI 从过去的纯文本诊断对话,向更贴近真实就诊的"多模态语音 + 视频"交互迈出关键一步。

2026年8月12日资讯,Google Research 与 Google DeepMind 近日发布了一项被其称为"同类首个"的研究——实验性医疗 AI 系统 AMIE(Articulate Medical Intelligence Explorer,清晰的医学智能探索者)完成了实时音视频临床视频问诊。这标志着医疗对话式 AI 从过去的纯文本诊断对话,向更贴近真实就诊的"多模态语音 + 视频"交互迈出关键一步。


一、技术架构:Gemini + Project Astra 的多智能体系统

AMIE 此前的版本主要被研究为基于文本的诊断对话智能体。此次研究将 AMIE 推进到实时视频问诊阶段:系统构建在 Gemini 大模型与 Project Astra 之上,采用多智能体架构,能够实时解读患者的视觉线索(表情、动作)与听觉线索(语音、语调),引导虚拟体格检查,并进行诊断推理——整体流程更接近一次真实的面对面就诊。

二、研究设计:模拟问诊,医生 + 患者演员双视角评估

需要强调的是,这是一项使用模拟问诊的随机化研究:采用"患者演员(patient actors)"配合、并与一组全科医生(primary care physicians)对照,而非面向真实患者。研究结果包括两个层面:

  • 临床评估者维度:Google 表示,评估者在病史采集的全面性、诊断准确性、管理方案的适宜性以及沟通质量等核心能力上,均对 AMIE 给出积极评价。
  • 患者体验维度:患者演员普遍更偏好视频问诊而非文本聊天,认为多模态交互更接近真实医患沟通。

三、边界与启示:仍是研究系统,离临床部署尚有距离

Google 明确表示,AMIE 目前仍是一个研究系统,在负责任地推向真实临床之前,还需要更多研究。对医疗 AI 从业者与临床医生而言,这项研究释放了两个重要信号:其一,医疗 AI 的竞争正从"能否读懂病历文本"升级为"能否听懂、看懂并实时对话";其二,实时多模态流式交互带来了文本聊天所没有的延迟、带宽与隐私合规成本,这些"工程与监管成本"不会因模型进步而自动消失,需要产业界与技术界共同补齐。

来源:Google Research Blog、Google AI Blog

解螺旋科研助手企业微信二维码,扫码添加免费领取科研资料礼包,包含AI科研提效、SCI投稿技巧、国自然基金、医学科研绘图、科研软件工具等实用资料


声明:本文资讯来源于公开报道及学术期刊,仅作行业信息传播,不构成临床用药建议。转载需注明来源。