MiniMax H3 全模态生成
H3 最容易被误解的一点是:拿到开源权重,不等于拿到官方效果。 完整系统由 H3-Context-IR、H3-Base、H3-Regenerate-2K 三个模块组成, 这次开源的只有中间那层(H3-Base,768p),前面的多模态上下文理解与后面的 2K 重生成都只有 API—— 而官方自己明说 Context-IR 对最终质量至关重要。 本专题共 25 篇,围绕四件事展开: 结构是怎么搭的、本地怎么跑起来、提示词该按什么格式写、几种跑法怎么选。 内容依据 官方仓库 的 README、模型配置文件与官方 h3-prompt-writing skill 文档整理,核对日 2026-08-09。 本专题内容为官方仓库口径,未在本机部署或调用过 H3;模型、部署方式与许可条款以官方最新说明为准。
MiniMax H3 是什么:一个全模态生成系统
从官方仓库口径梳理 MiniMax H3 的系统骨架:它是什么定位、输出规格有哪些硬性上限、三个模块里哪一个开源了哪两个没有、两个 checkpoint 分别对应什么任务、参考输入最多能塞几个文件。看完你能自己判断该走官方 API 还是拿开源权重本地跑,以及下一步该去查哪份文档。
系统与架构
三个模块里只有中间那个开源了、33B Omni-Transformer 有约 13B 参数推理时不用加载、f16t4d24 的视觉 VAE、2K 为什么不是超分——先把结构看明白,再谈怎么跑。
33B Omni-Transformer 的结构:MiniMax H3 里那 13B 参数为什么推理时不用加载
MiniMax H3 的 Omni-Transformer 是 33B 的 dense 单流结构,官方 README 说其中约 13B 参数位于 AdaLN 分支,调制输出可预先计算并缓存,仅推理的部署不需要加载。本文按官方仓库 README 与两份 config.json 逐条拆开:模态特定参数落在哪、MM-RoPE 为什么是三维、那张五十层五十六头的硬参数表怎么与文字互相印证,哪些数字看着像结论其实不能拿来做任何换算,以及为什么「原生支持稀疏注意力」和「开源版只能跑 full attention」必须分开说。
为什么必须用 MiniMax H3 自带的 tokenizer:从 H3-Encoder 的接口说起
MiniMax H3 官方要求必须使用仓库自带的 tokenizer 与配置文件。按官方仓库口径讲清 H3-Encoder 与 Qwen3-VL-32B 的关系、model_index.json 里两个类名为何不对称、新增特殊 token `<d>` 承担的对白边界职责,以及下载与自查该看哪几个文件。
稀疏注意力:能力与发布状态是两回事
MiniMax H3 的 README 里有两句话挨在一起:模型原生支持稀疏注意力的训练与推理,以及首次开源发布只提供 full attention 的推理、稀疏实现将在未来更新中发布。很多转述把前半句留下、后半句丢掉,于是变成「开源版支持稀疏注意力」。这篇拆开讲清楚这两句分别在说什么、稀疏注意力对长多模态序列意味着什么,以及为什么不能顺手推出任何性能结论。
H3 的 2K 为什么不是超分:H3-Regenerate-2K 的 in-context 重生成读法
MiniMax H3 的 2K 输出不是在 768p 结果后面接一个专用超分模块,而是把低分结果连同原始多模态上下文一起送回基础模型重新生成。本文按官方仓库口径讲清这条路径的两条理由、它与传统超分的差别究竟在哪一层、H3-Regenerate-2K 未开源只有 API 的现状,以及为什么不能把 ComfyUI 模板里 megapixels 2.0 那一档误当成 2K 来用,帮你分清「H3 支持 2K」和「开源版能出 2K」这两句话。
H3 开源了什么、没开源什么:三个模块的开放状态逐条拆开
MiniMax H3 放出权重,但开源的只是三个模块中间那一层,前后两层只提供 API。按官方仓库 2026-08-09 的 README 口径拆开 H3-Context-IR、H3-Base、H3-Regenerate-2K 的开放状态,说清为什么拿到权重不等于拿到官方效果,并给出走 API 还是本地权重的判断路径。
H3-VisualVAE:f16t4d24 是什么意思
MiniMax H3 的视频自编码器被官方记作 f16t4d24,这串符号里藏着空间 16 倍、时间 4 倍、24 个 latent 通道三件事。本文拆开这个记号,讲清 patch size 1×2×2 如何把有效空间下采样推到 32 倍而时间仍是 4 倍,并用仓库里 config.json 的 in_channels 与 patch_size 做交叉印证,顺带说明额外训练的 ViT decoder 解决的是什么问题。
MiniMax H3 的原生立体声是怎么做出来的:H3-AudioVAE 与音视频联合预测
按官方仓库口径拆解 MiniMax H3 的音频路径:左右声道共用一套 encoder/decoder 但独立处理、每声道把 32kHz 压成 40Hz 的 latent 序列、config 里音频 latent 维度为 32,并说清「原生立体声」为何指联合预测而非后期配音。
本地部署
权重怎么下才不重复、SGLang 两个变体怎么起、diffusers 为什么要用分支装、本地 768p 与官方 2K 之间差了哪两个模块。命令一律原样给。
本地部署 H3-Base 的完整路径:从下载范围到 SGLang 起服务
按 MiniMax H3 官方仓库 README(2026-08-09 快照)梳理本地部署 H3-Base 的路径:两条验证路径怎么选、两个 checkpoint 对应什么任务、hf download 为什么必须加 --include、requirements.txt 里 diffusers 分支的坑,以及起服务后该检查哪几处。
下载 MiniMax H3 权重时别下重了:`--include` 到底在挡什么
MiniMax H3 仓库把原始 checkpoint 与 diffusers 格式并排托管,不加限定条件全量拉会把两套都拖下来。本文按官方仓库口径讲清 FL2VA/ 与 Ref2VA/ 的结构、README 两条 hf download 命令里 --include 挡掉了什么、diffusers 用户为何不必手动下载,以及下完怎么验收。
用 diffusers 跑 MiniMax H3 的第一个坑:`pip install diffusers` 装到的版本可能没有 H3 模型类
MiniMax H3 官方仓库的 requirements.txt 注释里藏着一条很容易被跳过的信息:模型是作为 diffusers pipeline 发布的、通过 trust_remote_code 加载,而官方文档指向的是 diffusers 的 minimax-h3 分支。也就是说直接装 PyPI 版本,版本号能达标却可能不含 H3 的模型类,装成功不等于装对了。本文按官方仓库口径讲清这条依赖该怎么装、安装顺序为什么重要、transformers 与 accelerate 各自卡在哪一环,以及怎么一步步判断自己是不是已经装错了环境。
用 SGLang 起 H3 服务:两条官方命令怎么抄、怎么验收
MiniMax H3 官方 README 给了 SGLang 的部署示例,FL2VA 与 Ref2VA 是两条独立命令、分别占用 30010 与 30011 端口。本文逐项拆解这两条命令里的每个选项、说明哪些选项我们只能照抄不能解释、权重该下哪些目录、起完服务人要检查哪几处,以及哪些场景根本不该走这条路。
MiniMax H3 的 Full 2K Workflow:本地 SGLang 服务 + 官方 API 怎么串成一条链
拿到 MiniMax H3 开源权重后会发现,本地只能跑到 768p,2K 必须回到官方 API。这篇按官方仓库 README 口径拆解 Full 2K Workflow 的完整链路:权重下载范围怎么限定、SGLang 两个变体如何分端口起服务、三个环境变量和三个 API 端点分别对应哪一步、base_video 用 Base64 还是公开 URL、以及三个官方 case 的规格与验收要点。
提示词写法
官方 h3-prompt-writing skill 给的是一套硬格式:三个核心字段、十二种运镜写法、<d> 对白标记与说话人 ID、四类参考标签。写不对,模型接不住。
十二种运镜怎么写进 MiniMax H3 提示词:Zoom 与 Push 到底差在哪
MiniMax H3 官方 h3-prompt-writing skill 把运镜拆成运动类型、幅度、速度三要素,给出十二种运动类型。本文讲清 Zoom 与 Push、Pan 与 Truck、Tilt 与 Pedestal 三组易混写法的区别,以及幅度速度何时该省、运镜和切镜怎么选、后续镜头时间戳格式怎么写才合规。
H3 提示词的三个核心字段:对齐指令、字段顺序与 Ref2VA 的分工
MiniMax H3 官方 h3-prompt-writing skill 把提示词拆成一行对齐指令加三个顺序固定的核心字段。本文按官方仓库 2026-08-09 的快照,讲清五种输入模式各自要不要写对齐指令、三条指令的原文长什么样、时间为什么必须精确到两位小数、三个字段分别管哪一层画面与声音、字段名为什么一个字都不能改动,以及 H3-Context-IR 尚未开源时自建提示词流程的边界究竟在哪里。
MiniMax H3 提示词里的 `<d>` 标记、说话人 ID 与旁白怎么写
拆解 MiniMax H3 官方 h3-prompt-writing skill 对白部分的硬规则:(S1)/(S2) 说话人 ID 如何跨镜头保持一致、身份描述为什么必须写在 <d> 之外、旁白为什么要固定短语加嘴唇闭合说明、台词跨切点时 <scenetrans> 与 <cutoff> 的用法。
Ref2VA 的参考标签体系:<Subject N> / <Picture N> / <Video N> / <Audio N> 怎么用
MiniMax H3 的全参考模式 Ref2VA 靠一套参考标签把素材与提示词绑在一起。本文按官方 h3-prompt-writing skill 与 ComfyUI 官方 R2V 模板的口径,讲清四类标签的分工、六段式章节的固定顺序、subject_definitions 与 retention_analysis 的写法规则,以及「按连接顺序引用」这条工程约束。
在 ComfyUI 里跑
ComfyUI v0.30.0 起原生支持 H3。这几篇讲清五个模型文件放哪、分辨率和帧数被什么规则吸附、音视频联合 latent 怎么分头解码,以及量化权重与官方 BF16 的差别。
音视频联合 latent 是怎么解码成一个 MP4 的
MiniMax H3 的 Omni-Transformer 联合预测视频与音频 latent,落到 ComfyUI 节点图上就是一根 LATENT 线同时接进 VAEDecode 与 VAEDecodeAudio,再由 CreateVideo mux 成 MP4。本文按官方模板与教程页口径拆开这条链路并给出选择依据。
在 ComfyUI 里跑 MiniMax H3:版本门槛、模型放置与 R2V 模板节点链拆解
按官方文档口径梳理 MiniMax H3 在 ComfyUI 里的上手路径:0.30.0 版本门槛与 v0.31.0 的 H3 VAE 修复、五个模型文件该落到哪个目录、T2V/I2V/R2V 三个官方模板的区别,以及 R2V 节点链怎么读、怎么验收、什么情况别这么干。
ComfyUI 里 H3 的分辨率与帧数是怎么定的
ComfyUI 官方 H3 模板里,输出尺寸不是你直接填的,而是 megapixels 经 ResolutionSelector 换算出来的;秒数也不是你填多少就是多少,会被表达式吸附到 17k+5 帧网格。本文按官方教程页与模板 JSON 梳理这两条链路,给出按处境倒推的取值决策路径。
ComfyUI 里的 H3 和官方权重不是同一套
在 ComfyUI 里跑 MiniMax H3,下的是 Comfy-Org/MiniMax-H3 的 pruned_int8_convrot 与 nvfp4_awq 文件;MiniMax 官方 README 写的 checkpoint 精度是 BF16。这篇把两边的文件清单、版本铺路过程和 fl2va 与 ref2va 两套权重讲清楚,并给出一条按自身处境倒推的选择路径,以及为什么两边的结果不该混在一起评估。
MiniMax H3 的五个模型文件分别放哪:ComfyUI 侧的下载来源、目录对应与验收方法
在 ComfyUI 里跑 MiniMax H3 要准备五个模型文件,最常见的翻车不是放错目录,而是从 MiniMaxAI/MiniMax-H3 下了官方 BF16 权重。本文按官方教程与模板文件梳理五个文件与目录的对应关系、下载地址形态、fl2va 与 ref2va 两套权重的区别,以及放完之后怎么在节点里验收。
选型与合规
四种跑法怎么选、用官方 API 还是本地部署、许可与安全护栏的边界在哪。给决策路径,没有数据的维度直接说不比。
用官方 API 还是本地部署 H3:按你的实际处境倒推
MiniMax H3 由三个模块组成,开源的只有中间那层 H3-Base,本地部署的上限是 768p。本文按仓库口径梳理官方 API、本地部署与两者混合的 Full 2K Workflow 各自能做到什么,再从成品分辨率、输入复杂度、素材是否允许外发、有无命令行与多卡环境、要不要接进服务这几个岔路口,倒推出一组条件式结论,并逐条写明哪些维度官方没有给出数据、因此本文不做比较。
H3 的许可与合规边界怎么看:先分清「我们知道什么」和「必须去读原文的部分」
想把 MiniMax H3 用进项目里,绕不开两件事:一份叫「MiniMax H3 Community License Agreement」的许可协议,以及官方 README 里那段安全护栏说明。这篇不解读条款,只把许可原文挂在哪个仓库、护栏的四层官方原意、走官方 API 与本地部署在自动审核这一层的实际差异讲清楚,再给一条按你自己的处境倒推的判断路径,帮你判断该读哪一份文件、哪些问题应该交给法务而不是工程师。本文不构成法律意见。
SGLang / vLLM / diffusers / ComfyUI:H3 四种跑法怎么选
MiniMax H3 官方 README 推荐了 SGLang、vLLM、diffusers、ComfyUI 四个推理入口,四者的落地成本、权重形态与官方给料的详细程度都不一样,其中 ComfyUI 用的还不是官方那套原始权重。本文按官方仓库与 ComfyUI 官方教程的口径,把四条路线各自的版本门槛、下载方式与已知坑位摆清楚,再从你有没有图形界面需求、会不会命令行、要不要接进服务、能不能从 git 分支装依赖这几个真实处境出发,倒推出一组带前提的条件式选择建议。
想系统学会把开源模型接进自己的产品,而不是只跑通一个 demo?
从 AI 编程实践到 Agent 工程落地,站内有成体系的教程与课程。