Seg-Zero推理实战:3步让AI一句话自动生成多目标分割掩码(多目标分割Demo)

发布时间:2026/8/28 10:21:00
Seg-Zero推理实战:3步让AI一句话自动生成多目标分割掩码(多目标分割Demo) Seg-Zero推理实战3步让AI一句话自动生成多目标分割掩码多目标分割Demo【免费下载链接】Seg-ZeroProject Page For Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement项目地址: https://gitcode.com/gh_mirrors/se/Seg-ZeroSeg-Zero 是一个开源的推理链引导图像分割项目只需一句自然语言例如我渴了可以喝什么AI 就能先思考再自动输出精确的多目标分割掩码。这篇文章带你完成 Seg-Zero 多目标分割 Demo 的推理实战全程 3 步无需训练经验约 10 分钟即可在 GPU 上跑通并支持替换成你自己的图片和问题。Seg-Zero 是什么为什么值得玩Seg-Zero 基于 Qwen2.5-VL-7B 多模态大模型通过**强化学习GRPO**训练让模型在输出分割结果之前先生成一段推理链Reasoning Chain再据此定位目标最终由 SAM2 分割模型生成像素级掩码。它的三大亮点涌现的测试时推理能力先思考、后分割复杂语义问题也能答对纯强化学习训练不依赖任何人工标注的推理数据⚡效果优于监督微调在域内和域外测试集上均领先 SFT 方案Seg-Zero多目标分割掩码是怎么生成的Seg-Zero 采用解耦架构一个负责想的推理模型多模态大模型 一个负责切的分割模型SAM2。训练时使用精心设计的奖励机制对思考格式、分割格式、IoU、边界框、点提示分别打分引导模型优化出高质量样本。下面是官方展示的推理链分割示例左侧是用户的问题中间是模型的思考过程右侧就是生成的分割掩码覆盖洞穴探险区、露营车、指挥家、镜头盖、狗链、价签等复杂语义目标。三步跑通多目标分割Demo 第一步一键安装环境与下载模型克隆仓库并创建 Python 3.12 环境需要 NVIDIA GPU CUDAgit clone https://gitcode.com/gh_mirrors/se/Seg-Zero cd Seg-Zero conda create -n visionreasoner python3.12 conda activate visionreasoner pip install torch2.6.0 torchvision0.21.0 pip install -e .下载预训练模型 VisionReasoner-7B在 Hugging Face 搜索Ricky06662/VisionReasoner-7B启用git lfs后克隆到pretrained_models/目录最终路径为pretrained_models/VisionReasoner-7B。分割模型 SAM2sam2-hiera-large会在首次运行时自动下载无需手动处理。 国内网络环境可设置export HF_ENDPOINThttps://hf-mirror.com加速下载。第二步准备图片和问题可跳过推理脚本 inference_scripts/infer_multi_object.py 内置了一张泳池餐食图assets/food.webp和默认问题直接运行即可看到完整效果默认问题What can I have if Im thirsty?我渴了可以喝什么模型会自动筛选出画面中的两杯饮品而不是沙拉、水果盘或三明治如果你有自定义图片可以在运行时通过参数传入详见第三步图片会被内部缩放到 840×840 再参与推理。第三步一键运行自动生成多目标分割掩码python inference_scripts/infer_multi_object.py运行后命令行会先打印模型完整的思考过程例如The question asks for items that can be consumed if one is thirsty. In the image, there are two glasses that appear to contain beverages… The other items, such as the salad, fruit platter, and sandwich, are not drinks…随后脚本会调用 SAM2 对每个目标的框和点提示进行分割把多目标掩码做或合并并保存对比图到inference_scripts/目录同时打印在原图上换成你自己的图片和问题只需加两个参数python inference_scripts/infer_multi_object.py --image_path 你的图片路径 --text 你的问题单目标场景也可以改用 inference_scripts/infer.py参数用法相同。实用注意事项 ⚠️显存不足脚本已默认启用flash_attention_2加速显存仍紧张时可降低输入图片分辨率修改resize_size 840输出位置掩码对比图默认保存在inference_scripts/test_output_multiobject.png可用--output_path自定义旧版单目标推理如需回退到早期单目标版本可参照 README 中的git reset说明想评估指标运行evaluation_scripts/eval_reasonseg_visionreasoner.sh按 GPU 显存调整 batch_size命令行会输出 gIoU想微调训练GRPO 训练入口为training_scripts/run_visionreasoner_7b_4x80G.sh推荐 4×80G 或 8×46G 显卡相关文件速查 文件说明inference_scripts/infer_multi_object.py多目标分割推理入口本文主角inference_scripts/infer.py单目标分割推理入口evaluation_scripts/eval_reasonseg_visionreasoner.shReasonSeg 基准评测脚本training_scripts/run_visionreasoner_7b_4x80G.shGRPO 强化学习训练脚本prepare_dataset/training_data_prepare_toturial.ipynb自定义训练数据准备教程assets/food.webpDemo 默认输入图片一句话总结装环境 → 给图片和问题 → 跑一条命令Seg-Zero 就会先思考再动手把我渴了能喝什么变成一张精确覆盖两杯饮料的多目标分割掩码。快去换上自己的图片试试吧✨【免费下载链接】Seg-ZeroProject Page For Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement项目地址: https://gitcode.com/gh_mirrors/se/Seg-Zero创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考