LoC-Path: Learning to Compress for Pathology Multimodal Large Language Models

发布时间:2026/9/4 16:28:21
LoC-Path: Learning to Compress for Pathology Multimodal Large Language Models LoC-Path 文章总结与翻译一、主要内容该研究针对全切片图像(WSI)分析中多模态大语言模型(MLLMs)存在的计算成本过高问题展开。WSI 具有十亿像素级规模,且诊断相关区域极度稀疏,现有模型需暴力处理数千个切片特征,导致计算和内存负担沉重。研究通过分析 2000 个 TCGA WSI 发现:一是 WSI 切片特征存在显著的全局和局部冗余,少量原型即可重构大部分特征;二是仅约 35.2% 的切片与任务(如报告生成、视觉问答)真正相关,其余切片对任务贡献极小。基于上述发现,研究提出高效 MLLM 框架 LoC-Path,核心流程为:切片特征压缩:通过稀疏令牌合并器(STM)消除局部冗余,再经 MAE 预训练的重采样器压缩全局冗余,将数千个切片令牌转化为紧凑的 latent 表示;任务相关令牌选择:通过令牌重要性评分器(TIS)筛选与任务最相关的 Top-M 个 latent;高效多模态融合:通过跨注意力路由适配器(CARA)将筛选后的视觉特征注入 LLM 解码器层,避免传统自注意力的二次复杂度。实验表明,LoC-Path 在病理诊断、报告生成等任务上达到现有 SOTA 模型相当的性能,同时推理计算量降低 70%,内存消耗减少 30%。二、创新点冗余感知的切片压缩机制:提出 STM 与 MAE 预训练重采样器的组合,分别针对局部和全局冗余进行压缩,且 MAE 预训练通过重构任务保证压缩后特征的完整性,同时引入覆盖度和多样性