分割方向论文精读

发布时间:2026/8/31 6:52:33
分割方向论文精读 一、趋势① 简单介绍CVPR 2026 的分割方向共收录多篇相关论文覆盖从基础模型适配、弱/无监督、视频时序、3D 与跨模态到遥感、医学、特殊模态与评测基准的全谱系是收录量最大的视觉子方向之一。整体呈现出「底座通用化、监督轻量化、场景极端化」三条主线。② 基础模型成为「分割操作系统」研究重心从造网络转向用好网络SAM / SAM2、CLIP、DINOv2/v3 等视觉基础模型被广泛当作通用底座大量工作聚焦于「冻结主干 轻量提示/适配器/LoRA」的免训练或高效迁移与此同时训练-free 与免标注方案集中爆发把部署成本压到最低。③ 生成式反向服务分割 长尾极端场景成为两大新增量一方面扩散 / DiT / 流匹配从「生成图像」反转为「直接生成掩码」或「合成带标训练数据」开辟生成式分割新范式另一方面伪装、异常、低光、水下、事件、雷达、裂缝、X 光等极端/长尾场景成为论文最密集的增量区体现分割研究正从「标准自然图像」走向「真实产业难题」。二、方法可见 SAM/CLIP/DINO 三类基础模型几乎覆盖过半论文LoRA/MoE/蒸馏/SSM/生成式是主要增量引擎。方法家族简介占比LoRA / Adapter / 提示学习参数高效只训练极少量增量参数即可把大模型适配到新域/新任务是兼顾性能与部署成本的主流微调手段。18.5%视频 / 时序建模对视频序列做分割、跟踪、抠图与推理强调时序一致性、流式/实时与运动线索利用。14.8%SAM / SAM2 基础模型与适配Segment Anything 系列已成分割事实标准大量工作围绕「冻结主干 轻量提示/适配器」做零样本或高效迁移是出现频率最高的方法底座。13.6%弱 / 半 / 无监督用图像级/框/点等廉价标注或完全无标注训练像素级分割是降低标注成本、面向长尾场景的关键范式。8.6%扩散 / DiT / 流匹配生成式从「生成图像」反转为「生成掩码」或「合成训练数据」代表生成式反向服务分割的新兴增量DiT 直接出掩码、流匹配替代扩散加速二分分割。7.4%注意力 / Transformer 架构作为通用骨干被广泛采用配合掩码分类、滑窗、token 合并等变体服务各类分割任务。6.8%3DGS / 3D 表征与跨模态3D 高斯溅射、跨视图、跨模态深度/语言→3D表征迁移是 3D 与跨模态分割的主要技术载体。6.2%CLIP / LLaVA 视觉-语言对齐提供文本-像素的跨模态桥接是开放词汇、推理分割、对话式分割的语言侧引擎常与 SAM 配合形成「语言定位掩码精修」范式。5.6%知识蒸馏含 VFM 蒸馏把 SAM/CLIP/DINO 等基础模型的能力蒸到轻量学生网络是「大模型能力 小模型部署」的桥梁。4.9%原型 / 最优传输 / 匹配用类原型、最优传输闭式解或代价聚合做像素-类别/掩码-掩码匹配是免训练、小样本与跨域分割的核心匹配机制。4.3%域适应 / 域泛化处理训练/测试分布偏移合成→真实、昼→夜、源域缺失等是分割落地部署的刚需能力。3.7%DINO / DINOv3 自监督表征无需语言、纯视觉自监督得到的强表征被用于上下文分割、部件分割与 3D 蒸馏是与 CLIP 互补的「视觉侧底座」。3.1%SSM / Mamba 状态空间以线性复杂度建模长序列被用于视频/雷达/裂缝等需要长程依赖或高效推理的场景替代部分注意力。3.1%MoE 混合专家用多个专家分支 门控按需激活处理多模态RGB-D、RGB-T或难样本伪装稀疏激活兼顾容量与效率。2.5%三、主题把这 多论文按其「主要贡献」归入 15 个主题。每一类有各自不同的落地场景。A. 开放词汇与免训练分割简述让模型不依赖像素级标注、直接用文本提示分割任意类别免训练方案成为主流以降低部署成本。应用场景开放词汇零样本分割、检索、机器人/具身感知中「指任何东西都能分」的场景。意义打破封闭词表限制是通用分割/多模态交互的基础能力直接服务机器人、AR 与开放世界感知。代表论文The Power of Prior: Training-Free Open-Vocabulary Semantic Segmentation with LLaVAB. 弱/半/无监督分割简述用图像级/框/点等弱标注或完全无标注训练像素级分割重点是更聪明地利用监督信号与未标数据。应用场景标注昂贵或不可得的场景医学影像、工业缺陷、长尾类别、动作时序切分。意义把分割从「重标注」解放出来决定了算法能否在真实长尾、稀缺标注场景落地。代表论文From Softmax to Dirichlet: Evidential Learning for Semi-supervised Semantic SegmentationC. 视频与指代分割简述在视频序列上做实例/语义/指代/抠图/推理分割强调时序一致性、流式实时与运动线索。应用场景视频理解、内容检索、自动驾驶、具身智能中需要「分割跟踪描述」联动的场景。意义视频是真实世界的主要载体视频分割质量直接决定后续理解、检索与决策的上限。代表论文CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal ObjectsD. 伪装/异常/显著目标检测简述针对「外观与背景高度相似」或「异常/显著」目标引入几何、频率、多模态线索破解难分问题。应用场景工业瑕疵/缺陷检测、生物医学息肉、病变、生态监测、安防伪装人员/物体。意义这类目标是传统分割的盲区关系工业质检良率、医疗早筛与国家安全等高风险场景。代表论文Beyond Appearance: Camouflaged Object Detection via Geometric StructureE. 域适应与域泛化简述处理训练/测试分布偏移分无源域适应UDA、域泛化DG、测试时适应TTA等子方向。应用场景跨域部署合成数据→真实、昼→夜/雨雾、源域数据不可得隐私/保密的迁移。意义模型能否在没见过的环境里仍work决定其在真实世界能否被信任地部署。代表论文GeCo: Geometry-Consistent Regularization for Domain Generalized Semantic SegmentationF. 3D 与跨模态分割简述面向 3D 点云/高斯场景的语义、实例、指代与功能(affordance)分割及 2D→3D 知识迁移。应用场景三维重建/编辑、机器人抓取、AR/VR、自动驾驶场景理解、数字孪生。意义从「看」到「懂三维世界」是机器人与具身智能的核心能力跃迁。代表论文B³-Seg: Camera-Free, Training-Free 3DGS Segmentation via Analytic EIG and Beta-Bernoulli Bayesian UpdatesG. 遥感/雷达/高光谱分割简述面向多光谱/高光谱/SAR/雷达等遥感模态的语义与显著分割强调超高分辨率与模态缺失鲁棒性。应用场景国土监测、农业估产、灾害评估、城市规划、SAR/高光谱军事与环保遥感。意义遥感分割是数字政府、粮食安全与应急响应的基础设施级能力。代表论文SARMAE: Masked Autoencoder for SAR Representation LearningH. 医学/显微/X光分割简述医学/显微/X 光场景的分割常面临标注稀缺、模态特殊、对精度与可解释性要求高。应用场景医疗影像诊断息肉/病变/亚细胞、电镜三维重构、安检 X 光违禁品识别。意义直接服务于临床早筛、科研与公共安全是高价值垂直落地方向。代表论文XSeg: A Large-scale X-ray Contraband Segmentation Benchmark for Real-World Security ScreeningI. 扩散与生成式分割简述用扩散/DiT/流匹配等生成模型「直接生成掩码」或「合成带标训练数据」是生成式反向服务分割的新增量。应用场景数据合成缓解长尾/稀缺标注、生成式分割、图像编辑/分层、二分高精度分割。意义把生成模型的强表征「反哺」分割既补数据又开新分割范式是近年最热的方法分支之一。代表论文GenMask: Adapting DiT for Segmentation via Direct Mask GenerationJ. 多模态/推理/对话式分割简述按复杂语言属性/关系/推理/抽象概念或多轮对话做分割强调语言与像素的精细对齐。应用场景自然人机对话交互、视觉语言定位(VLG)、机器人抓取指令理解、推理/抽象概念接地。意义是从「点选分割」走向「说一句话就能分」的关键直接决定多模态助手与机器人的可用性。代表论文Conversational Image Segmentation: Grounding Abstract Concepts with Scalable SupervisionK. 提示学习/SAM/基础模型简述围绕视觉基础模型的提示学习、LoRA/Adapter 适配、知识蒸馏与多 VFM 特征融合。应用场景基础模型(SAM/CLIP/DINO)的高效适配、轻量部署、提示学习与多基础模型融合。意义基础模型是「分割操作系统」如何低成本用好它是当前研究的工程主轴。代表论文GKD: Generalizable Knowledge Distillation from Vision Foundation Models for Semantic SegmentationL. 小样本与跨域少样本简述仅用极少标注几张支持集或跨域少样本完成语义/实例分割强调原型与贝叶斯框架。应用场景标注极少的新类/新域如罕见病种、跨域工业件快速适配。意义决定模型面对「没见过的少数样本」能否快速学会是少样本落地与持续学习的核心。代表论文Bayesian Decomposition and Semantic Completion for Few-shot Semantic SegmentationM. 高效/轻量/实时分割简述用 token 合并、纯编码器、端云协同、精简 MAE 等办法降低计算换实时与轻量。应用场景实时/边缘部署移动端、机器人机载、自动驾驶在线分割、视频实时推理。意义效率是算法能否上设备的硬约束是「论文→产品」的隐形刚需。代表论文MPM: Mutual Pair Merging for Efficient Vision TransformersN. 特殊模态与场景分割简述面向非自然 RGB 的特殊模态与场景强调定制算子、模态缺失鲁棒与物理线索利用。应用场景特殊成像与极端环境热成像、水下、事件相机、雷达、RGB-D、裂缝/建筑缺陷、CAD、地理定位、音视。意义这些「长尾极端场景」是产业真问题基建、安防、水下、夜间也是论文增量最集中处。代表论文CrackSSM: Reviving SSMs for Crack Segmentation via Dynamic ScanningO. 评测基准与通用框架简述评测基准、标注者一致性IAA元算法、超像素等「地基」工作服务整个方向的方法比较与数据治理。应用场景数据集质量评估、标注一致性把控、通用分割框架/超像素等基础设施。意义基础设施决定了研究方向是否健康——好的基准与一致性度量能避免方法「刷分」虚高。代表论文Kαlos finds Consensus: A Meta-Algorithm for Evaluating Inter-Annotator Agreement in Complex Vision Tasks