# ComfyUI 本地出图出视频核查：两款 Apache 2.0 模型能用，最后一节不能碰

> 一篇流传很广的 ComfyUI 本地出图/出视频教程，工具链和模型全都真实存在，两款主力模型还是 Apache 2.0 可商用。但它把 MiniMax H3 的下载体积说成显存，最后一节还在教绕过内容审核——这两处必须点出来。

### TLDR

- **工具链是真的，且没过时**：ComfyUI + Z-Image Turbo（阿里通义，2025-11-27 发布，6B、8 步出图、Apache 2.0）+ Wan 2.2（阿里 2025-07-28 开源，5B/14B、Apache 2.0）。节点名、模型卡、目录结构逐一核对无误。
- **授权是它最大的价值**：两款主力模型都是 Apache 2.0，明确允许商用、可修改、需保留版权声明。这把 AI 视觉纳入商业生产的前提解决了。
- **有一处明确误导**：MiniMax H3 的「显存 123.6GB → 42.5GB、降 66%」是**下载体积**不是显存。本地真跑需 64GB+ 系统内存 + 重度卸载，很慢。
- **最后一节不能碰**：帖子收尾教「替换越狱编码器绕过审核」，举例写「金瓶梅」。在国内生成成人内容涉违法、全平台必封，对专业品牌是毁灭性风险。
- **「8GB 起步」偏乐观**：8GB 出图成立，出视频（Wan 2.2 5B）需卸载、很慢。**能跑不等于跑得动**。
- **对神机百炼的判断**：把它当「本地内容生产工作室」，不要当「AI 短剧副业」。图生视频（i2v）拿实拍机器人图做首帧，才是我们的入口。

### SRC

原帖为 @ai_xiaomu（黄小木，自称 T11 工程师）的 ComfyUI 教程，帖子自注「内容为 codex 创作」；原帖直链未在研究材料中留存，本文以作者账号与下列一手来源交叉核验：HuggingFace / Comfy-Org 模型卡、ComfyUI 官方文档（docs.comfy.org）、ComfyUI Wiki，以及 localaimaster / thundercompute / invidelabs / atlascloud 等第三方实测。事实核查截至 2026-08-28。法律与合规判断为作者观点，不构成法律意见，商用授权请以模型官方许可证原文为准。

### BODY

<div class="sec"><div class="eyebrow"><span class="num">1</span>它讲了什么</div>
<h2>一套从装到出片的完整链路</h2>

<p>这篇教程用 7 章加一个附录，手把手教本地部署 ComfyUI 做 AI 图与视频。ComfyUI 是节点连线式的开源出图工具，图、视频、音频通吃，社区里叫它「AI 绘画界的乐高」。</p>

<p>主线的骨架是这样的：硬件评估（决定性因素是显存）→ 安装（小白用秋叶整合包）→ 出图（默认六节点：提示词 → Checkpoint → KSampler → VAE Decode → Save Image）→ 选模型 → 做视频 → 进阶模型。</p>

<p>其中有一个设计很值得说：<strong>ComfyUI 产出的图自带工作流元数据，把图拖回界面就能复原整套节点连线</strong>。这意味着出图结果本身就是可复现的资产，不是一个黑箱 PNG。对我们做交付的团队，这一条比出图本身更重要——它让「这张图是怎么来的」变成可追溯的东西。</p>

<div class="keypoint">
  <strong>判断：</strong>这篇真正的价值不是「教你怎么调包」，而是给了一套把生成流程显式化的心智模型——<strong>节点是函数，连线是输入输出</strong>。这个模型可以直接教给产教赛训的学员，也可以直接映射到我们自己的内容流水线：检索是节点、写作是节点、排版是节点、校验是节点。
</div>

<div class="sec"><div class="eyebrow"><span class="num">2</span>事实核查</div>
<h2>哪些属实，哪些被说歪了</h2>

<p>把帖子里的关键断言逐条追到一手源，结论是：<strong>工具链与两款主力模型完全属实，MiniMax H3 那一节有明显的口径误导。</strong></p>

<div class="jx">
  <div class="jx-h"><span>关键断言核查结果</span><span class="jx-note">核查截至 2026-08-28</span></div>
  <table class="jx-mx">
    <tr><th>帖子断言</th><th>核查结果</th><th>判定</th></tr>
    <tr><th>Z-Image Turbo：阿里通义 6B、Apache 2.0、8 步出图、FP8 8GB / GGUF 6GB</th><td>属实。2025-11-27 发布，S3-DiT 架构；RTX 4090 约 2.3 秒/1024²，中文渲染约 92%；BF16 14-16GB / FP8 8GB / GGUF 6GB</td><td class="b">属实</td></tr>
    <tr><th>Wan 2.2：Apache 2.0、5B 跑 8GB、720P/24fps、14B 进阶</th><td>属实。2025-07-28 开源，MoE 架构，官方 ComfyUI 模板齐全；TI2V-5B 兼顾文/图生视频，8GB 需卸载；节点名 Wan22ImageToVideoLatent / WanFirstLastFrameToVideo / Ctrl+B 逐一核对无误</td><td class="b">属实</td></tr>
    <tr><th>MiniMax H3：2026-08 开源、ComfyUI 0.30.0+、显存 123.6→42.5GB（降 66%）、编码器 32B</th><td>部分属实但有误导。2026-08-03 开放的只是 <strong>Base 权重</strong>（非全量）；42.5GB 是下载体积不是显存；本地真跑需 64GB+ 内存与重度卸载，很慢。编码器确为 Qwen3-VL-32B</td><td class="c">误导</td></tr>
    <tr><th>秋叶整合包 / 8GB 起步线 / 工作流存 PNG 元数据</th><td>属实，但 8GB 对「出图」成立，对「出视频」偏乐观</td><td class="a">部分</td></tr>
    <tr><th>越狱模型做视频（替换编码器绕过审核）</th><td>作者自行改编码器的非官方玩法，非任何模型官方能力</td><td class="c">高风险</td></tr>
  </table>
  <div class="cap">Z-Image Turbo 与 Wan 2.2 的核查结论最硬——模型卡、Wiki、第三方实测三方对得上，节点名也没写错</div>
</div>

<p>MiniMax H3 这一处要说清楚。帖子把「下载体积从 123.6GB 优化到 42.5GB」讲成了显存优化，降幅 66% 听着很诱人，但<strong>这是两码事</strong>：下载体积是硬盘，显存是能不能跑起来。本地实际运行仍需 64GB 以上系统内存并重度卸载，速度很慢，且只开放 Base 权重，画质不等于官方 2K 托管版。</p>

<p>另外 H3 的社区许可证有地域与营收条款：排除美国、欧盟、英国、韩国的本地部署（我们在中国，不受影响）；商用需在界面显著标注「MiniMax H3」，年营收超 2000 万美元需书面授权。</p>

<div class="sec"><div class="eyebrow"><span class="num">3</span>必须跳过的一节</div>
<h2>越狱附录：不是「敢不敢」的问题</h2>

<p>帖子收尾教「替换越狱编码器，让生视频工作流不抗拒台词」，举例写「金瓶梅也可以」，并自注「越狱模型没有尺度，娱乐为主」。</p>

<p>这一节必须明确说清楚它的性质：<strong>这是作者自行替换编码器的非官方玩法，不是任何模型的官方能力。</strong></p>

<div class="jx">
  <div class="jx-h"><span>为什么这一条是硬红线</span><span class="jx-note">作者判断，非法律意见</span></div>
  <div class="jx-tl">
    <div class="jx-tl-row"><div class="jx-tl-t">法律</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#b85c0a">生成与传播淫秽内容在国内可触《治安管理处罚法》乃至《刑法》<span class="m">不是灰色地带，是明线</span></div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">平台</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#4b5f8a">小红书 / 公众号 / B 站一律封禁<span class="m">账号资产一次性归零</span></div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">品牌</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#6d3fd4">对神机百炼这类做政企与文旅客户的品牌是毁灭性的<span class="m">一次就够，没有第二次机会</span></div></div></div>
  </div>
</div>

<div class="keypoint">
  <strong>判断：</strong>这一节直接跳过，永不尝试。理由不是保守——是收益与风险完全不成比例。绕过审核能带来的只是「台词不被拒」，而代价是法律、账号、品牌三条线同时暴露。同样要警惕的是「AI 短剧副业」这条叙事：viral 短剧是 outlier 不是模板，能赚钱的短剧靠剧本和导演，不靠生成工具。
</div>

<div class="sec"><div class="eyebrow"><span class="num">4</span>硬件现实</div>
<h2>先查自己显卡，再决定跑哪一档</h2>

<p>帖子说「8GB 是 2026 起步线」，这句话对出图成立，对出视频偏乐观。真实情况是分档的。</p>

<div class="jx">
  <div class="jx-h"><span>本地模型 × 显存档位</span><span class="jx-note">✓ 可行 / △ 勉强（慢） / ✗ 不现实</span></div>
  <table class="jx-mx">
    <tr><th>显存档</th><th>Z-Image Turbo（图）</th><th>Wan 2.2（视频）</th><th>MiniMax H3</th></tr>
    <tr><th>6–8GB（3060/4060）</th><td class="b">✓ FP8/GGUF 流畅</td><td class="c">△ 5B 需卸载，慢</td><td class="c">✗</td></tr>
    <tr><th>12–16GB（4070/4080）</th><td class="b">✓ BF16 最佳</td><td class="b">✓ 5B 顺，14B 卸载</td><td class="c">△ 需 64GB 内存</td></tr>
    <tr><th>24GB+（4090）</th><td class="b">✓ 极速</td><td class="b">✓ 14B 原生</td><td class="a">△ 可跑，慢</td></tr>
  </table>
  <div class="cap">H3 还需 64GB+ 系统内存与 NVMe；实际速度取决于分辨率与帧数。磁盘建议预留 100–300GB，且不要放在 C 盘</div>
</div>

<p>一句经验之谈：<strong>先查自己显卡显存再定模型档位，不要反过来。</strong>很多人是看了教程先下模型，下完 40GB 才发现跑不动。「能跑」和「跑得动」之间隔着一个数量级的体验差——前者是能不能出结果，后者是能不能在交稿deadline前出结果。</p>

<div class="sec"><div class="eyebrow"><span class="num">5</span>落地判断</div>
<h2>当内容中台，不要当副业</h2>

<p>剥掉「副业暴富」的壳之后，这套工具链对我们的定位很清晰：<strong>本地内容生产工作室</strong>，而不是接单做 AI 短剧。</p>

<div class="jx">
  <div class="jx-h"><span>四阶段落地路径</span><span class="jx-note">约 4–6 周</span></div>
  <div class="jx-tl">
    <div class="jx-tl-row"><div class="jx-tl-t">Phase 0<br>第 1 周</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#4b5f8a">硬件盘点<span class="m">查显存、定档位、清出 100GB+ 非 C 盘空间</span></div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">Phase 1<br>第 1–2 周</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#2563eb">装好跑通<span class="m">秋叶整合包 → ComfyUI Manager → 中文 → 放对目录，出第一张图</span></div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">Phase 2<br>第 2–4 周</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#0a749a">品牌视觉<span class="m">Z-Image Turbo 出中文海报/社媒卡，建品牌提示词库</span></div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">Phase 3<br>第 4–6 周</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#0d8a5f">机器人视频<span class="m">Wan 2.2 TI2V-5B，实拍图做首帧跑 i2v</span></div></div></div>
  </div>
</div>

<p>最后一个、也是我认为最关键的判断：<strong>图生视频（i2v）才是机器人内容的天然入口。</strong></p>

<p>文生视频的问题是不可控——你描述得再细，出来的运动也不听你的。而 i2v 是把我们已经有的机器人实拍图、渲染图作为首帧，让模型只补中间的运动。做产品能力展示、演示动画，这条路比文生视频稳得多、可控得多，而且素材是我们本来就有的真实资产。</p>

<div class="analogy">
  <div class="h">打个比方</div>
  <p>文生视频像让一个没见过你产品的人凭描述画概念图；图生视频像把实拍照片交给动画师，让他补上中间帧。前者的上限由想象力决定，下限由运气决定；后者的下限由你的素材质量决定，而素材质量是我们能控制的。</p>
</div>

<div class="srcline">
  <div class="h">这份教程核查的边界</div>
  原帖自注「内容为 codex 创作」，属 AI 代写——本次已逐条核对技术细节，基本准确，但版本迭代快（ComfyUI 与各模型更新频繁），<strong>实操前请以 docs.comfy.org 与 HuggingFace 模型卡为准</strong>。<br><br>
  <strong>三条必守：</strong>① 永不碰越狱 / NSFW 工作流；② Apache 2.0 商用需保留原始许可证与版权声明，正式商用前在作品或文档里标注模型来源；③ MiniMax H3 仅 Base 权重、需 64GB 内存、有地域与营收条款，新手先 Wan 2.2。<br><br>
  另需提醒：生成的视觉素材要搭配真人写的工程文案使用，避免「AI 生成感」破坏专业调性。
</div>
</div>
</div>
</div>
</div>
</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/comfyui-local-video-pipeline/*
