几分钟看懂ComfyUI 工作流入门指南
ComfyUI 工作流入门指南看懂核心节点与连接方式本文面向零基础读者用类比帮助你在几分钟内理解 ComfyUI 工作流的结构打开工作流后不再被密密麻麻的管线吓住。为保证可读性文章牺牲了部分严谨性如有错误欢迎指正共同进步。如果你具备简单的 AI 原理背景阅读会更轻松。一、工作流的基础类别ComfyUI 是一个节点式工作流工具主要用于生成图像与视频。按输入输出的不同工作流可分为文字生成图片Text to ImageT2I图片生成图片Image to ImageI2I文字生成视频Text to VideoT2V图片生成视频Image to VideoI2V视频生成视频Video to VideoV2V二、核心节点详解2.1 主要节点先从最基础的 T2I文字生成图片开始理解了它其他工作流很快就能融会贯通。1. Load Checkpoint模型加载器作用加载大模型文件也就是你下载的各种模型。输出提供 3 条管线MODEL模型的大脑负责图像生成的核心计算。CLIP模型的文字翻译官将提示词转换为模型能理解的格式。VAE模型的图片翻译官负责图片在肉眼照片格式与模型内部格式之间的转换。2. CLIP Text Encode文本编码器作用把我们写的提示词如「一个穿着 JK 的少女」翻译成模型能理解的数据。一般会放两个文本编码器节点原因见下面的采样器。输入clip接收模型加载器输出的 CLIP文字翻译官用它来处理输入的提示词信息。输出condition翻译过后、模型看得懂的文本条件。3. KSamplerK 采样器作用生成图像的核心引擎。它配合模型逐轮修改图像可以理解为「模型的手术刀」——模型让它怎么改它就怎么改。输入model接入模型加载器与模型沟通。positive接入文本编码器的 condition输入你希望图片里出现的提示词。negative接入文本编码器的 condition输入你不希望图片里出现的提示词这就是为什么要放两个 CLIP 文本编码器。latent_image接收 Empty Latent Image 输出的 latent作为模型绘图的画布可以先理解为等待画画的白纸。输出LATENT模型能理解的图片内容即潜空间数据。4. Empty Latent Image空白潜空间图片作用生成随机噪声的潜空间图片。输出latent作为给模型修改的空白画布随机噪声。5. VAE DecodeVAE 解码器作用把 KSampler 输出的、肉眼看不懂的潜空间数据LATENT还原成人眼可直接预览的像素图像。输入samples接收 KSampler 输出的 LATENT生成完毕但人类看不懂的潜空间数据。vae接入模型加载器的 VAE图片翻译官。输出IMAGE我们人类能看懂的照片。2.2 节点关键参数节点中有很多需要手动调整的参数它们会直接影响生成效果。KSampler 是扩散模型生成图像的核心它的参数决定了图像从纯噪声演变为清晰画面的过程对整个生成过程至关重要。如果不理解模型生成图片中「噪声」的含义请跳转底部的补充章节。了解这些核心参数能让我们从「靠抽卡」变成「精准控制画面」Seed随机种子决定初始的潜空间随机噪声进而影响画面可能的构图、人物姿态。Steps去噪步数把去噪过程切分为多少个步骤执行。步数太少画面模糊步数过多收益变小且更耗时。CFG Scale提示词引导系数控制模型多严格地听从提示词的指挥。数值越高越贴合提示词但过高会导致色彩过曝、画质劣化。Sampler 与 Scheduler采样方法与调度器决定去噪的数学求解算法以及每一步降噪的速度分配。Denoise去噪强度控制注入多少新的噪声决定对输入 Latent 的重绘与修改幅度。三、扩展其他工作流理解基本工作流后就可以举一反三了。所有工作流都离不开加载图片 / 视频 → 工具 / 模型修改处理 → 整理输出复杂的工作流只是处理的内容更多或者把某个步骤重复了多次、形成循环。3.1 图生图I2I图生图本质上就是把初始的随机噪声替换为「参考图片的噪声」让整个生成从一开始就不随机用加载图片的节点载入参考图再通过 VAE Encode 转换为潜空间数据被压缩后看起来像噪声作为 KSampler 的 latent_image 输入取代原先的随机噪声。3.2 图生视频I2V视频比图片多了一个时间维度帧。目前的视频生成模型大致分两类基于 U-Net 架构的模型如AnimateDiff、SVD基于 DiTDiffusion Transformer架构的模型如Wan万相系列、混元Hunyuan系列。但无论哪种工作流都可以拆成下面五个关键节点和生成图片其实差不多Load Image导入作为起始帧的静态原图。I2V Conditioning / Motion Model注入运动控制信号如动作幅度、运动帧数。Empty Latent Video或 SVD Latent创建包含时间帧数例如 16 帧或 25 帧的视频潜空间。KSampler结合静态图的色彩 / 结构 运动模型的时空注意力机制逐帧进行去噪计算。Video Combine或 VHS_VideoCombine把去噪完成的多帧画面组合拼接导出为.mp4或.gif视频文件。四、其他常用节点4.1 LoRA 节点作用加载通过微调训练得到的模型权重用于改变模型的生成风格可以多个串联叠加生效。输入模型加载器输出的 MODEL。输出修改后的 MODEL。参数要加载的 LoRA 模型文件。4.2 工具类节点种类繁多这里不一一展开有能对图片自动分割做遮罩的有能自动计算长宽高、秒数的计算工具等等。4.3 第三方自定义节点通过 ComfyUI Manager 等工具安装社区开发者封装好的节点如 VideoHelperSuite、AnimateDiff 等可以为 ComfyUI 扩展大量新功能。这类节点默认运行在本地也可以配合云端算力使用。五、动手尝试现在可以自己试试看看能不能理解工作流为什么这么连接、关键节点与数据流向。文生图工作流引用原文链接https://docs.comfy.org/zh/tutorials/basic/text-to-image图生图工作流引用原文链接https://docs.comfy.org/zh/tutorials/basic/image-to-image图生视频工作流引用原文链接https://docs.comfy.org/zh/tutorials/video/wan/wan2_2六、总结本文主要起到简单介绍的作用具体细节还需要大家后续深入了解、多动手实践。可以先导入别人的工作流自己改一下其中一两根线上手实际玩玩很快就能学会。补充1. 什么是噪声训练大模型生成图片就是让模型学习如何从一团看不清的噪声里一步步去掉噪点最终变成想要的图片如下图所示。所以用文字生成图片时通常的做法是先随机生成一堆噪声再通过模型不断去除不需要的噪点最后得到生成的图片。2. 更多及更详细的介绍官方文档推荐优先阅读https://docs.comfy.org/zh节点介绍网站https://comfyui-wiki.com/zh/comfyui-nodes