MiniMax-H3-Fun-Controlnet-Union完全指南:Canny、Depth、HED、MLSD、Pose五大控制模式详解

发布时间:2026/8/26 15:44:34
MiniMax-H3-Fun-Controlnet-Union完全指南:Canny、Depth、HED、MLSD、Pose五大控制模式详解 MiniMax-H3-Fun-Controlnet-Union完全指南Canny、Depth、HED、MLSD、Pose五大控制模式详解【免费下载链接】MiniMax-H3-Fun-Controlnet-Union项目地址: https://ai.gitcode.com/hf_mirrors/alibaba-pai/MiniMax-H3-Fun-Controlnet-UnionMiniMax-H3-Fun-Controlnet-Union是构建在MiniMax-H3视频生成模型之上的 ControlNet-Union 控制模型由 VideoX-Fun 流水线训练。仅凭一个约 6.8 GB 的 checkpoint就能同时支持 Canny、Depth、HED、MLSD、Pose 五大控制模式和视频修复inpainting让你用一段控制视频引导生成全新的视频。本指南面向新手讲清每种模式的用途、选型方法和部署步骤。ControlNet-Union 模型是什么传统 ControlNet 每一种控制条件都要单独训练一套权重切换很麻烦。MiniMax-H3-Fun-Controlnet-Union 用Union设计把五合一做到极致✅一个权重管所有条件Canny、Depth、HED、MLSD、Pose 五种控制视频共用同一个 checkpoint无需来回换模型✅控制分支独立加载checkpoint 只包含控制分支control_proj_in 5 个control_blocks叠加加载在基础 MiniMax-H3 transformer 之上✅引导蒸馏guidance-distilled推理时guidance_scale 1.0即可每步只需一次前向传播省掉 classifier-free guidance 的额外开销✅支持视频修复控制输入扩展到control_in_dim 49latent 带掩码 latent mask 通道可做局部视频重绘✅控制强度可调control_context_scale控制引导力度1.0最强小于1.0削弱控制0.0完全关闭控制分支。技术上5 个控制分支分别挂接在 50 层 transformer 的第 0、10、20、30、40 层每个 skip 都通过零门控投影加入主干既保留了控制信号又不会干扰基础模型的生成质量。五大控制模式逐一点评1️⃣ Canny边缘轮廓控制Canny 从控制视频中提取锐利边缘线生成视频会严格保持物体的轮廓与画面构图主体原封不动地迁移到新风格里。示例输入asset/canny_tokyo_street.mp4东京街头 Canny 边缘视频示例输出results/canny_tokyo_street.mp4适用场景实拍转动漫、保持人物/物体轮廓一致的重绘2️⃣ Depth深度控制深度图只保留远近空间关系不关心纹理和色彩。用它做控制生成视频会与实拍视频同一空间布局非常适合把真实场景整体改成另一种画风或替换场景元素。示例输入asset/depth_astronaut.mp4示例输出results/depth_astronaut.mp4适用场景空间结构一致的换风格、换场景生成3️⃣ HED手绘线稿控制HED 提取的是较柔和的手绘风格线条比 Canny 更松弛保留大致的形体但细节更自由。生成结果艺术感更强适合黏土、插画、绘画等风格化创作。示例输入asset/hed_trex_bmx.mp4示例输出results/hed_trex_bmx.mp4适用场景想要更柔和、更手绘感的艺术化转绘4️⃣ MLSD直线结构控制MLSD 只检测建筑、边框等直线元素对斜线和曲边不敏感。用它控制时建筑立面、城市天际线、几何结构会保持稳定的透视关系不会在生成中扭曲变形。示例输入asset/mlsd_village.mp4示例输出results/mlsd_village.mp4适用场景建筑/城市/室内结构为主的画面重绘5️⃣ Pose人物姿态控制姿态骨架捕捉的是人体关键点的运动轨迹生成视频里的人物会跟着骨架动。官方示例将一段普通舞蹈控制视频重新生成变成了弗拉明戈舞者风格动作完全跟随原视频。示例输入asset/pose_dance.mp4示例输出results/pose_dance_flamenco.mp4适用场景人物动作复刻、舞蹈换装、角色替换如何选择合适的控制模式模式控制信号一句话定位最佳场景Canny硬边缘线轮廓保真实拍转动漫、保持构图Depth深度图空间结构换风格、换场景HED手绘线稿艺术感插画、黏土风、软线条MLSD直线结构稳定建筑、城市、几何画面Pose骨架关键点动作复刻人物、舞蹈、表演快速选型口诀要轮廓选 Canny要空间选 Depth要艺术感选 HED要直线选 MLSD要人物动作选 Pose。 提示词技巧官方建议把场景、主体、镜头都写进 prompt描述越详细生成越稳定。快速部署与推理步骤第一步环境准备GPU 显存建议 80 GB。transformer 约 62 GB Qwen3-VL 文本编码器约 62 GB单卡无法全部常驻需开启model_group_offload最快或model_cpu_offload_and_qfloat8代码克隆 VideoX-Fun 仓库并执行mkdir -p models/Diffusion_Transformer。第二步下载模型并放入目录下载基础 MiniMax-H3 模型与本模型的 MiniMax-H3-Fun-Controlnet-Union.safetensors按如下目录摆放 models/ ├── Diffusion_Transformer/ │ ├── MiniMax-H3/ │ └── MiniMax-H3-Fun-Controlnet-Union/ │ └── MiniMax-H3-Fun-Controlnet-Union.safetensors⚠️ checkpoint 只包含控制分支model_name里必须存在完整的 MiniMax-H3 基础权重。第三步修改配置并运行生成编辑 VideoX-Fun 中examples/minimax_h3_fun/predict_v2v_control.py文件顶部的关键变量model_name models/Diffusion_Transformer/MiniMax-H3 config_path config/minimax_h3/minimax_h3_control.yaml transformer_path models/Diffusion_Transformer/MiniMax-H3-Fun-Controlnet-Union/MiniMax-H3-Fun-Controlnet-Union.safetensors control_video your_control_video.mp4 prompt your prompt然后执行python examples/minimax_h3_fun/predict_v2v_control.py视频修复inpainting请使用examples/minimax_h3_fun/predict_v2v_control_inpaint.py。官方全部示例统一采用num_inference_steps 40、guidance_scale 1.0、control_context_scale 1.00、seed 43。关键参数速查表参数推荐值说明num_inference_steps40去噪步数guidance_scale1.0必须为 1.0大于 1 会叠加引导、降低画质control_context_scale0 ~ 1.0控制强度越大越听话0 即关闭帧数17n 5自动取 VAE 可解码的最大帧数时长上限15 秒控制视频会被截断到上限内帧率24 fps固定分辨率32 的倍数保持控制视频原始宽高比在height × width像素预算内换算常见坑与排查Checkpoint 加载失败config_path必须与训练布局完全一致control_blocks_places: [0, 10, 20, 30, 40]、control_in_dim: 49、control_apply_audio: false布局不匹配会直接加载报错。画面变差检查guidance_scale是否被习惯性调大——本模型已做引导蒸馏大于 1 就是双重引导。缺基础权重只下载控制 checkpoint 是不够的MiniMax-H3 基础模型必须就位。显存不足务必开启 offload 参数不要尝试全量加载。许可说明 本模型是 MiniMax-H3 的衍生作品基于MiniMax H3 Community License Agreement发布详见仓库根目录的 LICENSE 与 NOTICE 文件。使用前请仔细阅读许可协议特别注意地域限制与可接受使用政策Acceptable Use Policy。更多细节见仓库 README.md。【免费下载链接】MiniMax-H3-Fun-Controlnet-Union项目地址: https://ai.gitcode.com/hf_mirrors/alibaba-pai/MiniMax-H3-Fun-Controlnet-Union创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考