MiniMax H3「导演工作台」全解:全模态视频生成与低显存本地部署工作流

3次阅读

共计 3824 个字符,预计需要花费 10 分钟才能阅读完成。

MiniMax 近期有两件紧密相关的事:一是开源了通用全模态生成系统 H3——用文本、图像、视频、音频做输入,能生成带原生立体声音轨的 2K 视频;二是推出了桌面创作应用 MiniMax Design(官方品牌名「导演椅 DIRECTOR'S CHAIR」),用多 Agent 编排整条创作流水线。本文把两者整理在一起:导演工作台到底是什么、H3 的架构与能力,以及低显存硬件上怎么跑起来。

一、「导演工作台」是什么

所谓「导演工作台」指的就是 MiniMax Design——MiniMax(上海稀宇科技)官方推出的桌面端 AI 创作工作室。它的口号是:" 执起你的导演椅。一个桌面指挥中心。一支随叫随到的 AI 剧组。"

官方定位:新一代 AI 原生创作平台、本地化多模态 AI 创作工作室——以 Agent 全流程协助创作,串联文本、图像与音视频模型,让每个创作者随时拥有一支全能团队。核心理念是 从操作像素到操作语义和表达意图:你不再逐个操作工具,而是像导演一样指挥一支 AI 剧组。

平台 系统要求
macOS(M 系列芯片) M1 / M2 / M3 / M4 · macOS 13 及以上
macOS(Intel 老款芯片) Intel 处理器 · macOS 13 及以上
Windows Windows 10 及以上 x64

官网:hub.minimaxi.com(国内版)/ hub.minimax.io(国际版);在线体验版为海螺 AI(hailuoai.video)。免费开始创作,模型调用走云端 API 计费。

二、五步创作链路

从灵感梳理、Agent 执行到审核交付,五个关键步骤在同一条连续创作链路中协同推进:

步骤 名称 说明
01 灵感输入 · AGENT MODE 说出想法,或直接丢进一份策划文档——主 Agent 理解意图后自动拆解任务分配,自动(也可手动)适配最优模型,开始执行。
02 画布编排 · CANVAS FLOW 脚本、分镜、图片、视频、音乐、剪辑全在一块画布上,节点自动连线;从调研到成片,告别工具割裂。
03 方法复用 · SKILL READY 对话生成专属 Skill,或一键调用广场成熟工作流;搭配专业级插件,一键解锁影视级特效。
04 本地衔接 · LOCAL INDEX 画布资料自动本地化存储,图片与工作流一键沉淀至资产中心;Agent 无缝调用本地文件,支持一键直连专业剪辑软件。
05 审核节点 · OUTPUT SYNC 关键节点 Agent 主动询问核心方向;Agent + Harness 后台调用专业知识库、多轮校验质量。适合短剧全流程、电商批量出图出视频、品牌 TVC、投放素材等场景。

三、多智能体并行与 Skill 生态

内部工作流分四步:理解创意目标 → 智能任务拆解 → 多智能体并行处理 → 合并、编辑与导出。四个专属智能体同时启动:文案智能体撰写文本,图像智能体生成视觉素材,视频智能体组装时间线,音频智能体制作配音——全部并行运行。

Skill 生态覆盖创作全链路(短剧漫剧、动画分镜、商业广告、电商内容、音频音乐、平台工具)。官方页面列出的 Skill 包括:

Skill 说明
角色场景分镜板 character-scene-storyboard 由参考图与剧本生成综合设定图
宣传视频 promo-video 把产品简介转化为宣传视频
电商商品图 ecommerce-image 从实拍图生成平台合规的电商组图
有声书 audiobook 把书籍转化为多角色有声书
动物播客 animal-podcast 生成搞笑动物对谈播客
图片重混 image-remix 复刻参考图氛围生成新图
MV 创作 mv-creator 把歌词转化为 MV 分镜与成片
格莱美说唱 MV 速成 rap-avatar-mv 零基础复刻同款 " 格莱美 " 风格 MV

四、MiniMax H3:全模态生成系统

H3 是一个通用全模态(omni-modal)生成系统,支持对文本、图像、视频、音频组成的多模态上下文做统一理解,并能生成 带原生立体声音轨 的视频,分辨率最高 2K、时长最长 15 秒。

输出规格 参数
时长 4–15 秒
宽高比 21:9 / 16:9 / 4:3 / 1:1 / 3:4 / 9:16 等多种比例
分辨率 短边默认 768px;2K 由 H3-Regenerate-2K 实现
帧率 24 FPS
音频 32 kHz 立体声
对白语言 稳定支持 11 种(中、英、日、韩、法、德、意、西、葡、俄、阿拉伯语)

三模块架构

模块 职责 开源状态
H3-Context-IR 深度理解并精炼复杂的多模态指令,转成 H3 易理解的上下文中间表示(Context Intermediate Representation)。官方强调它对最终输出质量至关重要 未开源,提供官方 API
H3-Base 基于 Context-IR 输出生成音视频,产出 768p 结果 已开源:FL2VA / Ref2VA 两个 checkpoint(BF16、CFG-distilled)
H3-Regenerate-2K 把 768p 结果连同原始上下文喂回 H3,以 in-context 方式再生成 2K 输出——能恢复小字、细节等超分方法需要 " 猜 " 的信息 暂未开源,提供官方 API

架构要点(与显存直接相关)

  • H3-Omni-Transformer 是 33B 参数的稠密单流 Transformer,其中约 13B 参数位于 AdaLN 调制分支——这些输出可以 预计算并缓存,纯推理部署时不需要加载。也就是说实际推理显存占用明显低于 "33B" 字面给人的感觉,这是官方架构层面的省显存设计
  • 文本编码器 H3-Encoder 复用 Qwen3-VL-32B 的完整预训练权重(取第 50 层隐状态)
  • 视觉 VAE:空间压缩 16×、时间压缩 4×、24 个 latent 通道;再经 1×2×2 patchify 后,进入 Transformer 的视觉 token 有效空间下采样达 32×
  • 音频 VAE:把 32 kHz 立体声压缩为 40 Hz 的 latent token 序列,左右声道独立处理
  • 使用三维 MM-RoPE 表示 (t, h, w) 时空位置关系;原生稀疏注意力(sparse attention)将在后续版本发布,可进一步降低长多模态序列的计算开销

五、低显存部署工作流

官方 README 没有明确标注最低显存要求,但架构本身带有省显存设计(AdaLN 预计算缓存 + CFG-distilled 权重)。以下是官方推荐的四种部署方式与两条验证工作流。

部署方式对比

框架 说明
SGLang 官方示例用 4 卡并行(–num-gpus 4 –ulysses-degree 4),详见 SGLang cookbook
vLLM 官方提供 recipes,见 recipes.vllm.ai
diffusers ModularPipeline.from_pretrained(“MiniMaxAI/MiniMax-H3”) 自动拉取所需组件,无需手动下载
ComfyUI 需独立版 ≥0.30.0(桌面版核心不支持 H3),官方提供 R2V / T2V 工作流模板

模型下载与启动(SGLang 示例)

# 原始 checkpoint,两个任务族(SGLang / vLLM 用)hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*" "Ref2VA/*" --local-dir MiniMax-H3

# FL2VA 服务启动示例(官方为 4 卡配置,单卡可参考 cookbook 调整)sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30010 \
  --model-variant fl2va

两条官方验证工作流

  • 纯本地(Local Deployment of H3-Base):只部署开源的 H3-Base checkpoint,验证 768p 输出。适合离线场景和低显存显卡——这是低显存路线的核心
  • Full 2K Workflow(本地 + 云端混合):本地 SGLang 跑 H3-Base 生成 768p,再依次调用官方 API /video-generation-v2-h3-context-ir(上下文理解)与 /video-generation-v2-regeneration(2K 再生成),复现纯 API 的 2K 质量。重活可以拆给云端

低显存实操建议

  • 优先只跑 H3-Base + 768p,不追本地 2K——2K 交给云端 API,本地卡只做基础生成
  • 官方示例是 4 卡配置;社区有 RTX 4090 / 5090 单卡或双卡 offload 跑通的反馈(第三方来源,未经官方确认,仅供参考)
  • ComfyUI 路线:独立版 ≥0.30.0 + 官方 R2V/T2V 模板,适合已有 ComfyUI 工作流的用户
  • 完全不想占本地显存:直接用 MiniMax Design(导演工作台),模型全部跑在云端,本机只需 CPU 和存储

六、参考链接

说明:本文基于 MiniMax H3 官方 GitHub README 与 MiniMax Design 官网整理,检索时间 2026-09-14。最低显存数字官方未公布,文中社区经验值仅供参考;H3-Context-IR 与 H3-Regenerate-2K 两个模块暂未开源,需通过官方 API 使用。

正文完
 0
hermes
版权声明:本站原创文章,由 hermes 于2026-09-14发表,共计3824字。
转载说明:除特殊说明外本站文章皆由CC-4.0协议发布,转载请注明出处。