
1. 项目背景与目标最近几年大语言模型和多模态模型的发展非常快。从最开始的“调用一个模型得到一个结果”到现在的“让 AI 自己理解任务、调用工具并完成复杂流程”智能体Agent逐渐成为 AI 应用落地的重要方向。在传统的 AI 图像生成流程中用户通常需要自己选择模型、编写 Prompt、调整参数。例如想生成一张“自己变成钢铁侠”的图片往往需要了解扩散模型、提示词设计以及各种控制模块的使用方式。对于普通用户来说这个过程并不友好。因此我希望尝试构建一个更加自然的交互方式用户只需要上传一张人物照片并告诉 AI“把我变成钢铁侠同时保持我的身份特征。”剩余的工作交给 Agent 自动完成包括理解用户需求、分析人物信息、生成合适的提示词、调用图像生成模型最终输出一张身份保持的角色转换图片。基于这个目标我利用 NVIDIA DGX Spark 平台搭建了一套本地多模态图像生成 Agent 系统实现从用户输入到最终生成结果的完整闭环。二、整体思路从单模型调用到智能体闭环一开始我的想法其实比较简单就是直接调用图像生成模型用户输入 Prompt把这个人变成钢铁侠。然后交给 FLUX 生成图片。但是实际测试发现这种方式存在几个明显问题第一用户需求比较复杂仅靠一句 Prompt 很难准确表达人物身份、角色风格以及场景要求。第二不同模型负责的任务不同。大语言模型擅长理解任务视觉模型擅长分析图片而扩散模型擅长生成图像。如果把所有任务交给一个模型效果并不理想。因此后续将系统设计成多模型协作的 Agent 架构用户 | OpenClaw Agent | Qwen3.6-35B | Superhero Skill | Qwen2.5-VL | FLUX PuLID | 生成图片整个流程不再是简单的“输入 Prompt → 输出图片”而变成用户提出需求Agent负责规划多模型共同完成任务。三、基于 NVIDIA DGX Spark 搭建本地运行环境本项目选择 NVIDIA DGX Spark 作为主要运行平台。相比传统本地电脑DGX Spark 提供了更强的 AI 推理能力使多个模型能够在本地环境协同运行。整个系统主要运行OpenClaw 智能体框架Ollama模型服务Qwen3.6-35B大语言模型Qwen2.5-VL视觉模型ComfyUI图像生成工作流FLUX.1-dev-fp8扩散模型PuLID-FLUX身份保持模块。在部署过程中最大的优势是所有流程都可以在本地完成不需要依赖云端 API。这意味着用户图片不会上传到第三方服务器模型调用更加灵活可以针对具体任务调整整个工作流。四、OpenClaw让模型真正成为 Agent在整个系统中OpenClaw承担的是智能体调度角色。最开始测试时我尝试让视觉模型直接承担对话和任务规划功能但发现效果并不好。原因是视觉模型主要用于理解图片内容并不适合作为复杂任务调度中心。因此后续进行了模型职责拆分Qwen3.6-35B作为 Agent 大脑Qwen3.6-35B负责理解用户需求判断任务类型调用对应工具管理整个执行流程。例如用户输入“把这个人变成钢铁侠保持身份一致。”Qwen3.6首先理解这是一个人物身份保持的角色转换任务。然后自动调用Superhero Skill进入后续图像处理流程。五、视觉理解利用 Qwen2.5-VL 提取人物身份信息进入图像生成之前需要先理解输入人物。因此增加了视觉分析模块Qwen2.5-VL-3B它负责分析人物外貌提取面部特征描述身份相关信息。例如输入一张人物照片。视觉模型输出发型特点面部结构外观信息人物身份描述。这些信息随后用于 Prompt 构建使生成结果不仅符合目标角色同时尽可能保持原人物特征。六、FLUX PuLID实现身份保持式图像生成图像生成部分采用ComfyUI FLUX.1-dev-fp8 PuLID-FLUX其中ComfyUI负责整个生成工作流管理。FLUX负责场景生成角色设计图像细节生成PuLID-FLUX主要解决生成角色很像目标角色但是不像原人物的问题。通过身份约束使最终结果能够同时满足钢铁侠角色特征电影级视觉效果原人物身份保持。七、完整运行效果最终实现的流程如下用户上传图片并输入“把这个人变成钢铁侠”OpenClaw接收任务→Qwen3.6进行任务规划→调用Superhero Skill→Qwen2.5-VL分析人物→自动生成Prompt→ComfyUI执行FLUXPuLID流程→返回最终图片。如下:整个过程用户不需要了解使用什么模型如何写Prompt如何配置参数。只需要描述自己的需求即可。八、开发过程中的一些问题和优化在开发过程中也遇到了一些问题。1. Agent模型选择问题最开始尝试使用视觉模型作为核心模型但是发现工具调用能力不足复杂任务规划能力有限。因此调整为Qwen3.6-35B负责Agent; Qwen2.5-VL负责视觉分析。模型之间职责更加明确。2. 大模型资源占用问题之前尝试使用其他视觉大模型进行身份分析但是显存压力较大。为了保证图像生成阶段拥有足够资源最终选择Qwen2.5-VL-3B作为轻量视觉分析模型。这样可以让Agent模型视觉模型图像生成模型更加合理地分配计算资源。九、总结通过这次实践我完成了一个从模型调用到智能体闭环的完整多模态 AI 应用。整个系统不再是简单地调用一个生成模型而是形成用户需求↓Agent理解↓工具调用↓多模型协作↓结果生成的完整流程。基于 NVIDIA DGX Spark 平台本项目实现了本地化运行的多模态图像生成 Agent为后续探索更加复杂的智能体应用提供了一次实践经验。未来还可以继续扩展视频角色转换多人物身份保持自动Prompt优化多Agent协作等方向。