
ComfyUI-MultiGPU节点全家福一张图看懂70个MultiGPU与DisTorch2节点【免费下载链接】ComfyUI-MultiGPUThis custom_node for ComfyUI adds one-click Virtual VRAM for any UNet and CLIP loader as well MultiGPU integration in WanVideoWrapper, managing the offload/Block Swap of layers to DRAM *or* VRAM to maximize the latent space of your card. Also includes nodes for directly loading entire components (UNet, CLIP, VAE) onto the device you choose项目地址: https://gitcode.com/gh_mirrors/co/ComfyUI-MultiGPUComfyUI-MultiGPU 是 ComfyUI 的自定义节点插件为所有 UNet、CLIP、VAE 加载器一键提供MultiGPU 版和DisTorch2 虚拟显存版节点。它通过把模型层卸载offload / Block Swap到内存DRAM或其他 GPU 的显存VRAM中把主卡的显存榨干留给真正的推理计算——让你用同一张卡跑更长视频、更大模型。本文带你一图看懂全部 70 个节点、3 个核心参数和实战工作流新手也能快速上手多卡与虚拟显存推理。先看图DisTorch2 到底省在哪里这是官方 README 的核心理念Free almost all of your GPU for what matters把 GPU 几乎全部空出来干正事。⚠️ 注意DisTorch 增强的是内存管理不是并行加速。工作流步骤仍是顺序执行收益来自① 显存受限时避免反复加载/卸载模型② 把 UNet/CLIP/VAE 尽量挪出主计算卡腾出最大 latent 空间。安装很简单推荐用 ComfyUI-Manager 搜索ComfyUI-MultiGPU一键安装手动安装则把仓库克隆到ComfyUI/custom_nodes/下git clone https://gitcode.com/gh_mirrors/co/ComfyUI-MultiGPU70个MultiGPU节点分类全家福所有节点安装后自动注册在节点菜单的multigpu分类下可以找到。按来源分为五大阵营节点家族数量说明需要的前置插件核心加载器MultiGPU DisTorch2 双版本26Checkpoint、UNet、VAE、CLIP1~4头、ControlNet、Diffusers 等无装即用核心辅助节点3DeviceSelectorMultiGPU、UNetLoaderLP低精度LoRA省内存、CheckpointLoaderNF4MultiGPUNF4 需对应插件GGUF 量化加载器MultiGPU / DisTorch / DisTorch2 三版本18UNet、CLIP、Dual/Triple/Quadruple CLIP 全家ComfyUI-GGUFWanVideoWrapper 专用20模型/VAE/编解码/采样/ControlNet/文本编码全套多卡节点ComfyUI-WanVideoWrapper第三方集成11LTXVideo、Florence2、FLUX ControlNet、MMAudio、PuLID各自对应插件几个新手友好的要点自动检测插件启动时会自动扫描是否安装了 GGUF、WanVideoWrapper 等前置节点装了才注册对应节点日志会打印每个模块的注册数量逻辑见__init__.py。每个节点都自带帮助文档在 ComfyUI 里点击任意核心节点 → 菜单选帮助圆圈问号即可查看参数说明、输出规格和 DisTorch2 分配指南共 68 份文档存放在web/docs/目录。DisTorch2 比 V1 更快GGUF 模型使用 DisTorch2 推理相比旧版 DisTorch1 最高快 10%优先选 DisTorch2 版本。MultiGPU 与 DisTorch2 节点怎么选命名规律一学就会CheckpointLoaderSimpleMultiGPU ← 原版功能 指定设备 CheckpointLoaderSimpleDisTorch2MultiGPU ← 再叠加 DisTorch2 虚拟显存分配MultiGPU 节点功能与原版加载器完全一致只是多了一个device参数让你指定把模型放到哪张卡cuda:0、cuda:1或cpu。适合我就想把 VAE 放第二张卡这种场景。DisTorch2 节点在原基础上新增 3 个高级参数见下节可以把 UNet 的层按字节/比例精确切分到多张卡和内存实现虚拟显存。显存紧张时优先用这个。新手上手3个参数配置虚拟显存所有 DisTorch2 节点都只多这几个参数默认值直接可用参数作用默认值compute_device指定主计算卡cuda:0 / cuda:1 / cpu自动检测virtual_vram_gb虚拟显存滑块向供血设备借多少 GB0~1284.0donor_device供血设备被卸载的目的地通常是 cpucpuexpert_mode_allocations专家模式精确指定每个设备的分配字符串空普通模式只调virtual_vram_gb一个数字。调得越大越多模型层被推到donor_device主卡空出来的显存就越多——甚至可以卸载 100% 的模型、仍把计算跑在 CUDA 卡上。专家模式参考 Huggingfacedevice_map风格Bytes 模式官方推荐cuda:0,2.5gb;cpu,*→ 前 2.5GB 放 cuda:0剩余全部放内存Ratio 模式cuda:0,25%;cpu,75%→ 按 1:3 比例切分Fraction 模式旧版兼容按各设备总显存占比分配实战工作流从 SDXL 到 WanVideo 2.2官方提供了 18 套已测试的工作流2x30901060ti、4070、30901070ti 三套环境验证过全部在example_workflows/目录配套 JSON 直接拖入 ComfyUI 即可DisTorch2 虚拟显存示例——以 Qwen Image 为例UNet CLIP 分别用 DisTorch2 节点加载把大模型切碎分到多卡WanVideoWrapper 多卡视频生成——20 个 WanVideo 专属节点覆盖文生视频、图生视频、VACE、ControlNet 全流程下面是文生视频T2V示例性能实测虚拟显存不是白送的官方基准assets/目录还有 FLUX Q8_0、Qwen Image fp16/fp8、Wan2.2Qwen 组合等更多图表显示DisTorch2 在把模型层卸载到内存/第二卡的同时保持了相当高的出图速度——这正是避免反复加载模型 latent 空间最大化带来的收益。官方文档与源码路径索引想深入细节按图索骥节点参数文档68 份web/docs/例如 UNETLoaderDisTorch2MultiGPU.md、CheckpointLoaderAdvancedDisTorch2MultiGPU.md、WanVideoBlockSwapMultiGPU.md节点注册总表__init__.py含 DisTorch2 映射与第三方模块自动检测逻辑DisTorch2 虚拟显存分配核心distorch_2.py多卡加载器包装逻辑wrappers.py、checkpoint_multigpu.pyWanVideo 20 节点实现wanvideo.py设备检测与显存管理device_utils.py、model_management_mgpu.py18 套示例工作流API 版example_workflows/、ci/example_workflows_api/常见问题 FAQQ1单卡能用吗能。donor_device选cpu把 UNet 层卸载到内存即可虚拟扩容单卡跑更大模型是 DisTorch2 最经典用法。Q2装了插件没看到 GGUF / WanVideo 节点这些节点需要前置插件ComfyUI-GGUF、ComfyUI-WanVideoWrapper装好后重启 ComfyUI 才会注册启动日志会显示每个模块Found Y/N及节点数。Q3virtual_vram_gb调到多少合适从默认 4.0 起步模型越大、latent 空间需求越高视频、大分辨率就调越大遇到速度下降再回调。追求精确就用专家模式字符串分配。Q4会不会和 ComfyUI 新版 DynamicVRAM 冲突不会。插件会自动检测 comfy-aimdo 初始化状态在其管理的 CUDA 设备上保持 DynamicVRAM 生效仅对未覆盖设备回退到传统 model patching逻辑见__init__.py中的 aimdo 守护代码。一句话总结MultiGPU 节点管放哪张卡DisTorch2 节点管显存不够怎么办。装好插件后打开 multigpu 分类按本文的命名规律挑选配合 3 个参数即可把多卡与虚拟显存变成日常生产力。【免费下载链接】ComfyUI-MultiGPUThis custom_node for ComfyUI adds one-click Virtual VRAM for any UNet and CLIP loader as well MultiGPU integration in WanVideoWrapper, managing the offload/Block Swap of layers to DRAM *or* VRAM to maximize the latent space of your card. Also includes nodes for directly loading entire components (UNet, CLIP, VAE) onto the device you choose项目地址: https://gitcode.com/gh_mirrors/co/ComfyUI-MultiGPU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考