全文概要
9 月 15 日,《自然·医学》(Nature Medicine)发表德国德累斯顿工业大学团队的研究:一套完全在本地(on-premise)部署的自主临床 AI 智能体在七疾病基准上诊断准确率达 90.04%,并发现"行为一致性"是最可靠的决策可信度信号——据此可在 49.4% 的病例上以 98.9% 的准确率实现"选择性自主",其余不确定病例则交由医生复核,为临床 AI 的安全落地提供了可操作框架。

1. 临床 AI 的两大落地难题:数据主权与可靠性
大语言模型处理复杂医疗任务的能力日益增强,但进入临床仍面临两大根本挑战:一是敏感的医疗数据必须留在机构内部、不能外传;二是医生需要判断 AI 给出的诊断是否可信。研究团队(通讯作者为德累斯顿工业大学临床人工智能教授 Jakob N. Kather)构建了一套完全本地运行的诊断 AI 系统,并采用"医生智能体 + 患者智能体"交互的模拟环境进行评估,覆盖阑尾炎、胆囊炎、肺炎、肺栓塞、尿路感染等疾病场景。
2. 核心发现:行为一致性优于模型自身置信度
在基于 MIMIC-IV 数据构建的基准上,本地运行的最佳模型在一个七疾病任务上诊断准确率达 90.04%,另一四疾病任务上为 83.8%。研究的关键在于如何判断某个 AI 结论是否可信:团队比较了"模型内部似然""语言类信号"与"行为一致性"三类可靠性指标,发现行为一致性(同一病例多次运行是否给出相同诊断)最能区分正确与错误诊断(AUC=0.860),而模型自身的概率分数反而不够可靠——在"压力测试"移除关键信息后,模型更易出错,但其概率信号并未相应下降。
3. “选择性自主”:为医生与 AI 协作提出可操作路径
据此,研究者提出一种"选择性自主"的协作模式:以行为一致性阈值(如 0.90)作为闸门,仅让 AI 自主处理低风险、高一致性的病例(可保留 49.4% 病例,其诊断准确率达 98.9%),其余病例一律交由医生复核。Kather 教授强调,目标是"具有选择性自主的 AI 智能体"——支持临床决策但不完全取代人类,且当输出不确定时必须明确提示;诊断与治疗的责任始终由医生承担。本地化部署则为数据治理、模型版本与权限管理提供了技术基础。
来源:《自然·医学》(Nature Medicine)、德累斯顿工业大学 EKFZ 数字健康中心

声明:本文资讯来源于公开报道及学术期刊,仅作行业信息传播,不构成临床用药建议。转载需注明来源。
- 1. 临床 AI 的两大落地难题:数据主权与可靠性
- 2. 核心发现:行为一致性优于模型自身置信度
- 3. "选择性自主":为医生与 AI 协作提出可操作路径






