ComfyUI 本地出图出视频核查:两款 Apache 2.0 模型能用,最后一节不能碰
一篇流传很广的 ComfyUI 本地出图/出视频教程,工具链和模型全都真实存在,两款主力模型还是 Apache 2.0 可商用。但它把 MiniMax H3 的下载体积说成显存,最后一节还在教绕过内容审核——这两处必须点出来。
- 工具链是真的,且没过时:ComfyUI + Z-Image Turbo(阿里通义,2025-11-27 发布,6B、8 步出图、Apache 2.0)+ Wan 2.2(阿里 2025-07-28 开源,5B/14B、Apache 2.0)。节点名、模型卡、目录结构逐一核对无误。
- 授权是它最大的价值:两款主力模型都是 Apache 2.0,明确允许商用、可修改、需保留版权声明。这把 AI 视觉纳入商业生产的前提解决了。
- 有一处明确误导:MiniMax H3 的「显存 123.6GB → 42.5GB、降 66%」是下载体积不是显存。本地真跑需 64GB+ 系统内存 + 重度卸载,很慢。
- 最后一节不能碰:帖子收尾教「替换越狱编码器绕过审核」,举例写「金瓶梅」。在国内生成成人内容涉违法、全平台必封,对专业品牌是毁灭性风险。
- 「8GB 起步」偏乐观:8GB 出图成立,出视频(Wan 2.2 5B)需卸载、很慢。能跑不等于跑得动。
- 对神机百炼的判断:把它当「本地内容生产工作室」,不要当「AI 短剧副业」。图生视频(i2v)拿实拍机器人图做首帧,才是我们的入口。
一套从装到出片的完整链路
这篇教程用 7 章加一个附录,手把手教本地部署 ComfyUI 做 AI 图与视频。ComfyUI 是节点连线式的开源出图工具,图、视频、音频通吃,社区里叫它「AI 绘画界的乐高」。
主线的骨架是这样的:硬件评估(决定性因素是显存)→ 安装(小白用秋叶整合包)→ 出图(默认六节点:提示词 → Checkpoint → KSampler → VAE Decode → Save Image)→ 选模型 → 做视频 → 进阶模型。
其中有一个设计很值得说:ComfyUI 产出的图自带工作流元数据,把图拖回界面就能复原整套节点连线。这意味着出图结果本身就是可复现的资产,不是一个黑箱 PNG。对我们做交付的团队,这一条比出图本身更重要——它让「这张图是怎么来的」变成可追溯的东西。
哪些属实,哪些被说歪了
把帖子里的关键断言逐条追到一手源,结论是:工具链与两款主力模型完全属实,MiniMax H3 那一节有明显的口径误导。
| 帖子断言 | 核查结果 | 判定 |
|---|---|---|
| Z-Image Turbo:阿里通义 6B、Apache 2.0、8 步出图、FP8 8GB / GGUF 6GB | 属实。2025-11-27 发布,S3-DiT 架构;RTX 4090 约 2.3 秒/1024²,中文渲染约 92%;BF16 14-16GB / FP8 8GB / GGUF 6GB | 属实 |
| Wan 2.2:Apache 2.0、5B 跑 8GB、720P/24fps、14B 进阶 | 属实。2025-07-28 开源,MoE 架构,官方 ComfyUI 模板齐全;TI2V-5B 兼顾文/图生视频,8GB 需卸载;节点名 Wan22ImageToVideoLatent / WanFirstLastFrameToVideo / Ctrl+B 逐一核对无误 | 属实 |
| MiniMax H3:2026-08 开源、ComfyUI 0.30.0+、显存 123.6→42.5GB(降 66%)、编码器 32B | 部分属实但有误导。2026-08-03 开放的只是 Base 权重(非全量);42.5GB 是下载体积不是显存;本地真跑需 64GB+ 内存与重度卸载,很慢。编码器确为 Qwen3-VL-32B | 误导 |
| 秋叶整合包 / 8GB 起步线 / 工作流存 PNG 元数据 | 属实,但 8GB 对「出图」成立,对「出视频」偏乐观 | 部分 |
| 越狱模型做视频(替换编码器绕过审核) | 作者自行改编码器的非官方玩法,非任何模型官方能力 | 高风险 |
MiniMax H3 这一处要说清楚。帖子把「下载体积从 123.6GB 优化到 42.5GB」讲成了显存优化,降幅 66% 听着很诱人,但这是两码事:下载体积是硬盘,显存是能不能跑起来。本地实际运行仍需 64GB 以上系统内存并重度卸载,速度很慢,且只开放 Base 权重,画质不等于官方 2K 托管版。
另外 H3 的社区许可证有地域与营收条款:排除美国、欧盟、英国、韩国的本地部署(我们在中国,不受影响);商用需在界面显著标注「MiniMax H3」,年营收超 2000 万美元需书面授权。
越狱附录:不是「敢不敢」的问题
帖子收尾教「替换越狱编码器,让生视频工作流不抗拒台词」,举例写「金瓶梅也可以」,并自注「越狱模型没有尺度,娱乐为主」。
这一节必须明确说清楚它的性质:这是作者自行替换编码器的非官方玩法,不是任何模型的官方能力。
先查自己显卡,再决定跑哪一档
帖子说「8GB 是 2026 起步线」,这句话对出图成立,对出视频偏乐观。真实情况是分档的。
| 显存档 | Z-Image Turbo(图) | Wan 2.2(视频) | MiniMax H3 |
|---|---|---|---|
| 6–8GB(3060/4060) | ✓ FP8/GGUF 流畅 | △ 5B 需卸载,慢 | ✗ |
| 12–16GB(4070/4080) | ✓ BF16 最佳 | ✓ 5B 顺,14B 卸载 | △ 需 64GB 内存 |
| 24GB+(4090) | ✓ 极速 | ✓ 14B 原生 | △ 可跑,慢 |
一句经验之谈:先查自己显卡显存再定模型档位,不要反过来。很多人是看了教程先下模型,下完 40GB 才发现跑不动。「能跑」和「跑得动」之间隔着一个数量级的体验差——前者是能不能出结果,后者是能不能在交稿deadline前出结果。
当内容中台,不要当副业
剥掉「副业暴富」的壳之后,这套工具链对我们的定位很清晰:本地内容生产工作室,而不是接单做 AI 短剧。
第 1 周
第 1–2 周
第 2–4 周
第 4–6 周
最后一个、也是我认为最关键的判断:图生视频(i2v)才是机器人内容的天然入口。
文生视频的问题是不可控——你描述得再细,出来的运动也不听你的。而 i2v 是把我们已经有的机器人实拍图、渲染图作为首帧,让模型只补中间的运动。做产品能力展示、演示动画,这条路比文生视频稳得多、可控得多,而且素材是我们本来就有的真实资产。
文生视频像让一个没见过你产品的人凭描述画概念图;图生视频像把实拍照片交给动画师,让他补上中间帧。前者的上限由想象力决定,下限由运气决定;后者的下限由你的素材质量决定,而素材质量是我们能控制的。
三条必守:① 永不碰越狱 / NSFW 工作流;② Apache 2.0 商用需保留原始许可证与版权声明,正式商用前在作品或文档里标注模型来源;③ MiniMax H3 仅 Base 权重、需 64GB 内存、有地域与营收条款,新手先 Wan 2.2。
另需提醒:生成的视觉素材要搭配真人写的工程文案使用,避免「AI 生成感」破坏专业调性。