如何让我的 DeepSeek 生图最近这段时间我越来越明显地感觉到一件事AI 编程已经很强了但真正做一个完整项目的时候代码反而不一定是最麻烦的。现在不管是 Codex、Claude Code还是各种 AI Agent你让它写个后台、搭个官网、做个管理系统很多时候它都能干得七七八八。但项目做到一半经常会卡在一些非常“低级”的地方。比如首页缺一张 Banner产品介绍需要几张配图Landing Page 需要一个科技感背景项目 README 想加一张宣传图做完网站以后还缺一张 OG 分享图甚至公众号文章写完了还得专门再去做封面。这个时候我们的工作流通常就断了。AI 在终端里写代码。我打开生图网站。复制提示词。生成图片。下载。找到下载目录。把图片拖进项目。再回来告诉 AI图片我放好了你接着改页面吧。看起来每一步都不复杂。但一天干几十次以后真的很烦。所以最近我做了一个很简单的东西Silico Grove Image Skill。它的目的只有一个让 Codex、Claude Code 这类 AI Agent自己去生图。项目地址https://github.com/Rodert/silicogrove-image-skill这个项目目前已经开源仓库里提供了完整的 Skill 文件、脚本、参考文档和 Agent 相关配置。一、以前 AI 写代码现在 AI 连图片也自己做这个 Skill 最简单的理解方式就是给你的 AI 编程助手增加一个“生成图片”的工具。比如我正在让 Codex 做一个 AI 产品官网。以前我可能会这样说帮我做一个 AI 产品官网。 使用 Next.js。 整体使用黑色科技风。 首页需要一个比较有冲击力的 Hero 区域。Codex 很快就可以把页面写出来。但是 Hero 背景怎么办以前可能就是随便放一个渐变背景或者去 Unsplash 找一张图。现在我可以直接告诉它给这个网站生成一张 16:9 的首页 Banner。 深色科技风。 画面中包含 AI 芯片、数据流和未来城市。 不要出现文字。 生成完成以后直接放到项目的 public/images 目录 然后修改首页代码引用这张图片。后面的事情就可以交给 Agent。大概变成理解需求 ↓ 编写页面 ↓ 调用生图 Skill ↓ 生成图片 ↓ 等待图片任务完成 ↓ 下载图片 ↓ 保存到项目目录 ↓ 修改代码引用图片 ↓ 继续完成项目我觉得这个变化其实挺重要的。因为它并不是简单地“AI 又会调用一个图片 API 了。”而是图片生成这件事情终于进入了 Agent 的完整工作流。二、这和直接去 ChatGPT 生一张图有什么区别可能有人会问现在能生图的平台这么多我为什么还需要一个 Skill因为这两种使用方式本质上完全不一样。我自己打开 ChatGPT、生图网站或者其他图片工具通常是这样的我 ↓ 打开生图平台 ↓ 输入提示词 ↓ 生成 ↓ 下载 ↓ 找到图片 ↓ 放进项目 ↓ 继续开发而使用 Skill 以后我 ↓ AI Agent ↓ Silico Grove Image Skill ↓ 图片模型 ↓ 本地项目中间大量操作都可以不需要我参与。这才是我觉得 Skill 最有意思的地方。Skill 不是为了让我少打开一个网站。而是为了尽可能不让我参与这些中间步骤。三、安装甚至可以直接让 AI 自己完成我做这个 Skill 的时候一个很重要的原则就是不要又搞出一堆复杂的安装教程。所以项目 README 最上面直接放了一段可以复制给 AI 的提示词。你甚至可以直接告诉 Codex请安装并使用这个 Silico Grove 生图 Skill https://github.com/Rodert/silicogrove-image-skillREADME 本身就是按照“把这段内容直接交给 AI Agent”这个思路设计的。第一次使用的时候Agent 会检查本地是否已经配置 API Key。如果没有就提示配置。配置完成以后会把 Key 保存到当前用户的本地配置目录里后续正常生图时直接复用不需要每次都重新输入也不要求用户自己去折腾环境变量。这个细节我觉得很重要。因为一个 Skill 如果每次使用之前还需要exportAPI_KEYxxxx再设置一堆环境变量其实使用体验已经开始变差了。四、它不只是文生图还可以直接改图除了最基本的 Text to Image这个 Skill 还支持参考图编辑。项目中的 Skill 定义明确提供了generate和edit两类工作流。比如你已经有一张产品图。直接告诉 Agent把这张产品图背景换成白色摄影棚背景。 产品本身不要改变。 保持真实摄影效果。或者参考这张图。 保留人物和主体 把整体风格调整成赛博朋克 背景换成未来东京街道。再或者做开发的时候这张 Banner 风格和现在的网站不统一。 参考网站目前的 UI 重新调整成黑色、银色、科技感 尺寸保持不变。这样图片修改也可以继续留在开发上下文里面。这对于做网站、App、小程序甚至电商页面我觉得都会比较方便。目前 Skill 对本地参考图支持 PNG、JPG、JPEG 和 WebP并对上传图片大小做了限制。五、我还专门把它设计成了异步任务图片生成和文本生成有一个很大的区别图片往往需要等。有时候几十秒有时候更久。所以这个 Skill 没有把它简单做成一次 HTTP 请求然后傻等而是采用异步任务。Agent 提交图片任务以后会获得对应的任务 ID然后持续查询任务状态。图片完成以后再下载到本地。而且任务 ID 会被记录下来。即便中间出现本地连接中断已经被服务器接受的生图任务也不会因此停止客户端也会避免在状态不明的时候盲目重新提交从而降低重复生成、重复计费的风险。简单来说就是Agent │ ├── 提交生图任务 │ ├── 获得 Task ID │ ├── 等待 / 查询状态 │ ├── 图片完成 │ └── 下载到本地而不是请求失败 ↓ 不知道生成没生成 ↓ 再来一次 ↓ 可能生成两张这个问题平时自己点网页可能感觉不明显。但是一旦进入 Agent 自动化工作流任务状态管理其实非常重要。六、生成的不是一个 URL而是真正的本地文件这也是我特别想做的一点。很多 API 调用完成以后只会返回{url:https://xxxxx/image.png}如果只是聊天这没什么问题。但是对于 Coding Agent 来说不够。因为下一步它很可能需要imgsrc/images/banner.png/所以 Silico Grove Image Skill 默认的思路就是图片生成完成以后直接下载到本地输出目录。于是 Agent 就可以继续干生成 banner.png ↓ 保存到 public/images/ ↓ 修改 index.tsx ↓ 引用 /images/banner.png ↓ 运行项目这一点看起来非常小。但我觉得这是“生图工具”和“Agent Skill”之间一个很明显的区别。七、目前可以接 GPT Image也可以接 Gemini 图片模型Skill 目前的默认模型是gpt-image-2默认尺寸为1024x1024默认质量为high。同时它也对 Gemini 图片工作流进行了适配例如gemini-3.1-flash-image。所以从 Agent 的角度来看不需要特别关心底层到底是哪一家。未来甚至可以继续增加更多图片模型。最终我们想要的体验其实应该是用户 给这个页面做一张科技感 Banner。而不是用户 POST /v1/images/xxx modelxxx qualityxxx sizexxx response_formatxxxAPI 参数应该逐渐退到后面。意图才应该站到前面。八、我觉得 Skill 真正有意思的地方不是“插件越来越多”最近我越来越喜欢研究 Agent 和 Skill。不是因为 Skill 这个名字有多新。实际上很多 Skill 的底层就是提示词 脚本 API 工具 一些规则真正让我觉得有意思的是我们正在一点点把原来需要“人操作软件”的能力交给 Agent。比如以前搜索资料需要打开浏览器。做图需要打开生图平台。部署需要打开服务器。操作数据库需要打开客户端。发邮件需要打开邮箱。现在这些东西都正在慢慢变成Search Skill Image Skill Deploy Skill Database Skill Email Skill ...然后交给 Agent 调用。最后可能会变成你 ↓ Agent ├── Coding ├── Search ├── Browser ├── Image ├── Video ├── Database ├── Deploy └── ...这时候 AI 编程真正改变的就不只是“程序员写代码更快了。”而是一个人能够控制的工具越来越多了。九、以后做一个网站可能真的只需要说一句话比如以后我希望能直接给 Codex 一句话帮我做一个 AI 图片生成产品官网。 要求 1. Next.js 2. 首页深色科技风 3. 自己生成 Hero Banner 4. 自己生成三张产品功能配图 5. 自己生成 Logo 占位图 6. 所有图片放到 public/images 7. 页面完成以后运行测试 8. 有问题自己修改然后去干别的。Agent 自己开始写代码 ↓ 生图 ↓ 改图 ↓ 保存图片 ↓ 引用图片 ↓ 运行 ↓ 发现问题 ↓ 继续修改我觉得这才是 Coding Agent 接下来真正有意思的地方。不是让 AI 帮我们操作更多软件。而是逐渐让我们不用再操作这些软件。最后Silico Grove Image Skill 目前已经放到 GitHubhttps://github.com/Rodert/silicogrove-image-skill使用方式也非常简单。甚至不用认真研究安装教程。把仓库地址直接丢给你的 Codex、Claude Code 或其他支持 Skill 的 Agent让它自己看。然后告诉它给我生成一张图。就可以开始了。我一直觉得现在可能真的是技术人非常好的一个时代。大模型以前所未有的速度发展中国又有极其成熟、性价比非常高的制造业再加上今天发达的互联网、支付和全球物流体系。以前很多事情需要一个团队才能做。现在一个程序员加上一堆 Agent就已经可以干很多以前想都不敢想的事情。所以我现在越来越关注的也不只是AI 能不能帮我们把代码写得更快。而是当代码、图片、视频、搜索、部署、运营这些能力全部变成 Skill 以后一个人到底能做多大的事情这个问题可能比单纯讨论哪个大模型跑分更高有意思得多。