近日,西安交通大学计算机科学与技术学院、国家医学攻关产教融合创新平台李辰教授团队联合剑桥大学、哈佛医学院、新加坡国立大学等机构,研发了通用型视觉语言模型ALPaCA(Adapting Llama for Pathology Context Analysis),正式发表于《自然·通讯》(Nature Communications)。该研究攻克了传统病理多模态模型只能读取切片局部区域的技术短板,创新性实现千兆像素全切片病理图像的玻片级问答能力,为计算病理领域带来全新技术范式。推动病理人工智能从“观察局部、输出标签”,进一步迈向“理解全片、交互问答”。
当前主流病理大模型仅针对局部感兴趣区域开展分析,无法整合整张切片多区域、多放大倍率信息;通用多模态模型又受限于算力,不能直接处理亿级像素病理切片,严重制约 AI 在真实病理场景应用。
针对这一问题,针对超大病理切片的分析难题,研究团队为ALPaCA设计了“全景地图+问题驱动显微镜”的混合机制:模型先从不同放大层级提取切片特征并概括全片的代表性形态,形成病理“全景地图”;再根据具体问题,从海量信息中精准检索相关区域,如同一台智能显微镜。通过融合整体与局部信息,ALPaCA既能把握切片全貌,又能追踪与当前问题相关的关键细节。

图1ALPaCA总体框架及三阶段训练流程
在包含337例独立留出病例的内部测试集中,研究团队设置了2403道封闭式问题和1641道开放式问题。性能最优的ALPaCA在封闭式问答中的总体准确率达到91.76%,比最强通用大视觉语言模型(Gemini-2.0、GPT-4o)基线高28.21个百分点;两名病理专家还结合原始切片,对全部道开放式问题进行了复核,在可由已有切片回答的1,357道开放式问题中, ALPaCA完全正确或部分正确的回答占70%以上。
团队还建立了两个独立外部队列:西安交大一附院队列(肾癌和胃癌),剑桥大学医院CUH-OV队列(卵巢癌)。ALPaCA在两个队列的封闭式问答中分别取得82%和77%的准确率;在XJTU-RG队列的97道开放式问题中,75道回答被评为正确或部分正确。ALPaCA还支持针对特定疾病进行微调,能够进一步提升细粒度分子特征和细粒度形态学问题的分析能力,同时在完成全切片特征提取后可快速响应临床问题。

图2ALPaCA与基线模型在内部测试集及独立临床队列中的性能比较
ALPaCA突破了传统病理模型只能分析固定区域、输出预设标签的局限,能够围绕同一张切片理解不同层次的问题,并动态定位相关组织区域和放大层级。未来,该模型有望应用于病理报告辅助、科研数据挖掘、教学培训及临床二次诊断,并为融合多张切片与患者信息的智能病理系统奠定基础。目前,ALPaCA推理所需的硬件门槛较低,代码、数据集和模型权重均已开源;团队还将进一步增强空间定位能力、补充罕见病真实样本,推动交互式病理AI走向更广泛的科研与临床应用。
该研究由西安交通大学计算机科学与技术学院、第一附属医院病理科,剑桥大学肿瘤学系、早癌研究中心及剑桥大学医院病理科,新加坡国立大学公共卫生学院以及哈佛医学院病理系等机构联合完成。论文第一作者高泽宇曾在李辰教授团队接受博士阶段培养,现于剑桥大学肿瘤学系从事博士后研究;西安交通大学第一附属医院王春宝医生与两位剑桥大学医院病理专家共同承担病理学复核工作。论文通讯作者为西安交通大学李辰教授、剑桥大学Mireia Crispin教授和新加坡国立大学Mengling Feng教授。
论文原文:https://www.nature.com/articles/s41467-026-76372-z
开源代码:ALPaCA GitHub仓库
开放数据:CNX-PathLLM数据集
模型权重:ALPaCA模型检查点
团队主页:Chen Li Group