共计 3824 个字符,预计需要花费 10 分钟才能阅读完成。
MiniMax 近期有两件紧密相关的事:一是开源了通用全模态生成系统 H3——用文本、图像、视频、音频做输入,能生成带原生立体声音轨的 2K 视频;二是推出了桌面创作应用 MiniMax Design(官方品牌名「导演椅 DIRECTOR'S CHAIR」),用多 Agent 编排整条创作流水线。本文把两者整理在一起:导演工作台到底是什么、H3 的架构与能力,以及低显存硬件上怎么跑起来。
一、「导演工作台」是什么
所谓「导演工作台」指的就是 MiniMax Design——MiniMax(上海稀宇科技)官方推出的桌面端 AI 创作工作室。它的口号是:" 执起你的导演椅。一个桌面指挥中心。一支随叫随到的 AI 剧组。"
官方定位:新一代 AI 原生创作平台、本地化多模态 AI 创作工作室——以 Agent 全流程协助创作,串联文本、图像与音视频模型,让每个创作者随时拥有一支全能团队。核心理念是 从操作像素到操作语义和表达意图:你不再逐个操作工具,而是像导演一样指挥一支 AI 剧组。
官网:hub.minimaxi.com(国内版)/ hub.minimax.io(国际版);在线体验版为海螺 AI(hailuoai.video)。免费开始创作,模型调用走云端 API 计费。
二、五步创作链路
从灵感梳理、Agent 执行到审核交付,五个关键步骤在同一条连续创作链路中协同推进:
三、多智能体并行与 Skill 生态
内部工作流分四步:理解创意目标 → 智能任务拆解 → 多智能体并行处理 → 合并、编辑与导出。四个专属智能体同时启动:文案智能体撰写文本,图像智能体生成视觉素材,视频智能体组装时间线,音频智能体制作配音——全部并行运行。
Skill 生态覆盖创作全链路(短剧漫剧、动画分镜、商业广告、电商内容、音频音乐、平台工具)。官方页面列出的 Skill 包括:
四、MiniMax H3:全模态生成系统
H3 是一个通用全模态(omni-modal)生成系统,支持对文本、图像、视频、音频组成的多模态上下文做统一理解,并能生成 带原生立体声音轨 的视频,分辨率最高 2K、时长最长 15 秒。
三模块架构
架构要点(与显存直接相关)
- H3-Omni-Transformer 是 33B 参数的稠密单流 Transformer,其中约 13B 参数位于 AdaLN 调制分支——这些输出可以 预计算并缓存,纯推理部署时不需要加载。也就是说实际推理显存占用明显低于 "33B" 字面给人的感觉,这是官方架构层面的省显存设计
- 文本编码器 H3-Encoder 复用 Qwen3-VL-32B 的完整预训练权重(取第 50 层隐状态)
- 视觉 VAE:空间压缩 16×、时间压缩 4×、24 个 latent 通道;再经 1×2×2 patchify 后,进入 Transformer 的视觉 token 有效空间下采样达 32×
- 音频 VAE:把 32 kHz 立体声压缩为 40 Hz 的 latent token 序列,左右声道独立处理
- 使用三维 MM-RoPE 表示 (t, h, w) 时空位置关系;原生稀疏注意力(sparse attention)将在后续版本发布,可进一步降低长多模态序列的计算开销
五、低显存部署工作流
官方 README 没有明确标注最低显存要求,但架构本身带有省显存设计(AdaLN 预计算缓存 + CFG-distilled 权重)。以下是官方推荐的四种部署方式与两条验证工作流。
部署方式对比
模型下载与启动(SGLang 示例)
# 原始 checkpoint,两个任务族(SGLang / vLLM 用)hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*" "Ref2VA/*" --local-dir MiniMax-H3
# FL2VA 服务启动示例(官方为 4 卡配置,单卡可参考 cookbook 调整)sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30010 \
--model-variant fl2va
两条官方验证工作流
- 纯本地(Local Deployment of H3-Base):只部署开源的 H3-Base checkpoint,验证 768p 输出。适合离线场景和低显存显卡——这是低显存路线的核心
- Full 2K Workflow(本地 + 云端混合):本地 SGLang 跑 H3-Base 生成 768p,再依次调用官方 API /video-generation-v2-h3-context-ir(上下文理解)与 /video-generation-v2-regeneration(2K 再生成),复现纯 API 的 2K 质量。重活可以拆给云端
低显存实操建议
- 优先只跑 H3-Base + 768p,不追本地 2K——2K 交给云端 API,本地卡只做基础生成
- 官方示例是 4 卡配置;社区有 RTX 4090 / 5090 单卡或双卡 offload 跑通的反馈(第三方来源,未经官方确认,仅供参考)
- ComfyUI 路线:独立版 ≥0.30.0 + 官方 R2V/T2V 模板,适合已有 ComfyUI 工作流的用户
- 完全不想占本地显存:直接用 MiniMax Design(导演工作台),模型全部跑在云端,本机只需 CPU 和存储
六、参考链接
- H3 官方仓库(GitHub)
- SGLang cookbook:MiniMax-H3 部署指南
- vLLM recipes
- diffusers 文档(minimax_h3 pipeline)
- ComfyUI 官方教程 + R2V / T2V 工作流模板
- MiniMax Design 官网(国内版)/ hub.minimax.io(国际版)
- 海螺 AI 在线体验 H3
说明:本文基于 MiniMax H3 官方 GitHub README 与 MiniMax Design 官网整理,检索时间 2026-09-14。最低显存数字官方未公布,文中社区经验值仅供参考;H3-Context-IR 与 H3-Regenerate-2K 两个模块暂未开源,需通过官方 API 使用。