
MiniMax 正式发布新一代通用全模态生成模型MiniMax H3作为品牌首款计划开源的多模态视听生成模型H3 将文本模型成熟的推理、上下文技术迁移至视频生成领域面向开发者与商业场景提供一体化音视频生成能力。1. 模型核心技术特点统一多模态理解管线原生支持文本、图像、短视频、音频混合输入统一编码多模态上下文支持参考素材联动生成、视频动作迁移V2V。创新画面生成方案 不依赖传统后置超分采用模型自生成方式提升分辨率更好保留画面结构、文字细节改善 AI 视频常见文字崩坏问题。架构复用文本模型成熟方案 引入复杂指令拆解、上下文扩展、Muon 优化器等经过验证的技术提升长提示词、复杂指令的遵循能力。2. 完整能力参数清单生成时长515s固定 24FPS最高分辨率2K1440P向下兼容 768P音频原生双声道同步生成音画输入上限9 图 3 视频 3 音频合计 12 份参考素材Prompt 上限7000 字符画幅9:16 /16:9 /1:1 /4:3 /21:9 全覆盖3. 适用开发场景API 云端调用搭建 AI 视频工具、短视频 SaaS、数字人配套视频生成本地私有化部署权重开放后企业内网部署数据不出域二次微调电商素材、品牌宣传片垂直场景定制优化多模态 Agent 联动图文、音频、视频联动自动化工作流4. API 相关信息H3 现已开放 API 接入支持文本生成视频、图生视频、参考素材驱动生成、首尾关键帧过渡生成。 调用模式支持多种条件生成方式纯提示词、单图起始帧、首尾帧动画、多素材参考驱动。计费参考2K 分辨率官方原价 0.8 元 / 秒768P 档位成本更低适合大批量素材生产。5. 开源计划重点官方披露未来数日将开放 H3 模型权重。 对于开发者意义 ✅ 脱离公有云 API自主控制推理成本 ✅ 行业数据集微调适配垂直业务 ✅ 可自主进行 GPU 适配、推理优化6. 横向对比与选型建议如果你需要快速上线工具、不想运维显卡优先公有云 API如果你有大量素材、数据合规要求高、长期稳定需求等待开源权重本地部署业务重点是广告、电商素材、需要稳定文字 / LOGO 渲染H3 具备明显优势。7. 待优化方向客观评价当前生成上限 15 秒连续长镜头生成能力有限复杂人物肢体细节依旧是现阶段所有文生视频模型共同难题。MiniMax H3 打通了「云端 API 开源本地部署」双路线补齐 MiniMax 在通用视频生成赛道的布局。随着权重开放国内开源多模态视频模型生态将迎来新一轮发展。更多资料福利领取后续我会持续跟进权重开放进度第一时间整理本地部署环境、推理测试教程。#MiniMaxH3 #AIGC #文生视频 #大模型开发 #AI 视频 API #开源大模型