想象医生拿到一套腹部CT:它不是一张照片,而是用X射线从多个角度成像后重建出的层层切片,其中同时包含多个器官。过去的医学AI常像“专科小助手”,一种模型盯一种疾病;现在,一项《Science》论文尝试打造统一入口,让一个系统处理多种异常发现。
它怎样读懂整套CT?
据AAAS新闻稿,Qi Zhang等人开发的系统名为RADAR(Rapid Abdominal Diagnosis with AI and Radiology),面向增强腹部CT的广泛诊断解读,论文于2026年9月17日发表。
关键思路是先把庞大的CT体数据拆到具体解剖结构,再把每个结构与放射科报告中的相应文字连接起来。它采用对比学习——让匹配的影像与描述在模型内部更接近,让不匹配的组合彼此远离。可以把它理解为:不只把整套CT和整份报告粗略配对,而是尽量指出“这段描述说的是这里”。
新闻稿称,RADAR使用424,911次检查训练,包括约150万组影像—文本配对,以及超过1500万组按解剖结构对应的数据。
数字说明了什么?
在146种腹部CT发现的评估中,RADAR平均AUC为0.913,新闻稿所称的最佳对比视觉—语言模型为0.776。AUC衡量模型把阳性病例排在阴性病例之前的能力:0.5约等于随机猜,1代表完全区分;它并不等同于临床诊断正确率。
RADAR在超过27,000例急诊CT上取得0.904的AUC,尽管训练时未专门使用急诊数据;在八家外部中心的队列中,AUC为0.895。后一个测试主要考察模型换到不同患者、机构和成像流程后能否继续工作。
为什么值得关注?
这项工作的意义不只是又多识别一种疾病,而是尝试把医学AI从分散的单病种模型,推向覆盖多种发现的通用读片入口。这里的“通用”不是能诊断所有腹部疾病,而是用同一系统处理更广的任务范围。
局限与未知
- “expert-level”和“generalist”来自论文标题;现有材料未提供对照医生、样本构成、统计显著性等细节,不能直接写成“已经达到专家水平”。
- 主要效果数字均来自AAAS新闻稿,尚无独立信源交叉印证。
- 纸刊卷期标为《Science》2026年9月第393卷、第6817期;材料未说明在线发表与纸刊排期是否完全一致。