大家好我是专注于AI应用实战的技术博主。最近AI短剧、漫剧的创作热潮席卷而来许多开发者、内容创作者都想抓住这波流量红利但往往卡在从“想法”到“成品”的落地环节。剧本怎么写AI资产怎么生成提示词Prompt如何设计才能稳定出片网上的资料要么过于零散要么只讲理论缺乏一套可闭环执行的实操方案。本文将为你彻底拆解利用AI工具链制作“小甜剧”的全流程。我们将从最基础的剧本结构开始一步步走过角色与场景资产生成、分镜提示词设计直到最终视频合成。文章不仅包含完整的操作步骤和可复制的代码/提示词模板更会深入讲解每个环节的“为什么”帮你避开新手常见的坑。无论你是想入门AI内容创作的开发者还是寻求效率提升的短视频创作者都能从零开始跟着本文做出你的第一个AI爆款小甜剧Demo。1. 背景与核心概念什么是AI小甜剧在深入实战之前我们有必要厘清几个核心概念这能帮助我们在后续步骤中做出更明智的技术选型和内容规划。AI小甜剧通常指利用人工智能技术辅助或完全生成的一种短篇视频内容其核心特点是时长简短通常在1-3分钟符合短视频平台的传播特性。剧情高甜聚焦男女主角之间的甜蜜互动、误会与和解情感浓度高节奏明快。AI生成剧中的人物形象、场景、甚至部分台词和表演由AI文生图、图生视频等工具生成。它的生产链条融合了传统编剧、AI绘画、AI视频生成等多个领域。对于技术开发者而言这是一个绝佳的“AI应用落地”场景你能在其中实践提示词工程、多模态模型调用、工作流自动化等一系列技能。核心工具链与概念区分文生图模型如 Stable Diffusion、Midjourney、DALL-E 3。负责根据文本描述生成高质量的静态图片用于创建角色定妆照、场景图。图生视频模型如 Runway Gen-2、Pika Labs、Stable Video Diffusion。负责将静态图片转化为动态视频片段是让角色“动起来”的关键。提示词工程这不是简单的“关键词堆砌”而是一门通过结构化、精细化的语言描述精准控制AI模型输出结果的技术。它是连接人类创意与AI能力的桥梁。工作流指将剧本拆解为分镜为每个分镜生成对应图片再将图片串联并生成视频的自动化或半自动化过程。理解了这些我们就知道制作AI小甜剧并非依赖某个单一“魔法按钮”而是需要一套组合拳。接下来我们从源头——剧本开始。2. 环境准备与工具选型工欲善其事必先利其器。由于AI视频生成领域工具迭代极快本文不会绑定某个特定版本软件而是提供工具类型选择和通用的配置思路。你可以根据自身硬件条件和访问权限灵活搭配。2.1 硬件与基础环境操作系统Windows 10/11 macOS 或 Linux 均可。部分工具对平台有特定要求需注意。显卡强烈推荐使用NVIDIA显卡。本地运行Stable Diffusion等模型需要较大的显存建议8GB以上如RTX 3060 12G、RTX 4070等。显存越大生成图片的速度越快、分辨率越高。存储空间准备至少50GB的可用硬盘空间用于安装工具、模型和存储生成的图片、视频素材。网络环境部分在线工具如某些AI视频生成平台需要稳定的网络连接。2.2 核心软件工具选型我们将工具链分为“本地部署”和“在线服务”两类你可以混合使用。环节本地部署方案在线服务方案说明文生图Stable Diffusion WebUIMidjourney, Leonardo.aiSD WebUI免费、开源、定制性强但需本地硬件。在线服务简单易用有生成次数限制。图生视频Stable Video DiffusionRunway ML, Pika Labs, Haiper本地SVD仍处早期效果和稳定性不及成熟的在线服务。Runway和Pika是目前主流选择。视频剪辑DaVinci Resolve, Premiere ProClipchamp, Canva用于将AI生成的视频片段、配音、字幕进行最终合成。达芬奇有免费版功能强大。配音Edge浏览器“大声朗读”ElevenLabs, Microsoft Azure TTS利用Edge TTS可免费获得高质量中文配音。ElevenLabs的语音情感更丰富但付费。本文实战将以“Stable Diffusion WebUI Runway ML DaVinci Resolve Edge TTS”这套混合方案为例因为它兼顾了成本、效果和学习价值。SD WebUI用于生成高质量、风格统一的角色与场景Runway用于获得目前最稳定的视频动态化效果达芬奇用于专业级合成Edge TTS解决配音问题。2.3 Stable Diffusion WebUI 基础配置如果你选择本地部署方案这是最关键的一步。安装建议使用一键安装包如sd-webui-aki或Stable Diffusion整合包它们集成了Python、Git和基础环境避免繁琐配置。下载模型安装完成后需要下载大模型和LoRA模型。大模型决定整体画风。推荐用于真人风格的ChilloutMix、MajicMix或用于动漫风格的AnythingV5。LoRA模型用于固定角色特征。你可以在C站Civitai上搜索“Korean Doll”、“Chinese Beauty”等关键词下载喜欢的角色LoRA。放置模型将下载的.safetensors格式的大模型文件放入stable-diffusion-webui/models/Stable-diffusion目录将LoRA模型放入stable-diffusion-webui/models/Lora目录。启动运行webui-user.bat(Windows) 启动程序在浏览器中打开http://127.0.0.1:7860即可访问。3. 从零开始创作你的小甜剧剧本AI生成不是魔法它需要清晰、结构化的输入。一个优秀的微型剧本是成功的一半。3.1 小甜剧剧本核心结构一个1-2分钟的小甜剧可以采用经典的“起-承-转-合”四段式起相遇/开场0-30秒介绍场景和人物关系制造初始吸引力。例如“图书馆里女生不小心撞到男生书散落一地。”承互动/发展30-60秒关系推进甜蜜互动或微小误会。例如“男生帮她捡书发现两人选修同一门课相约一起复习。”转转折/危机60-90秒一个小矛盾或误会制造情感波动。例如“女生看到男生和另一个女生说笑心生误会黯然离开。”合和解/高甜90-120秒误会解除关系升华留下甜蜜结尾。例如“男生追来解释那是他表妹并送上精心准备的礼物两人相视而笑。”3.2 剧本格式与要素为方便后续拆解为AI分镜请用以下格式撰写剧本剧名咖啡店的偶然 时长120秒 风格现代都市、温暖、日系滤镜 核心梗概社恐插画师与阳光咖啡师因一杯画错的咖啡拉花而结缘。 【角色设定】 1. 林薇女主25岁自由插画师性格内向安静喜欢在角落观察人群。 2. 陈阳男主27岁咖啡店店主开朗细心热爱咖啡艺术。 【分镜列表】 SCENE 01 时长25秒 场景城市街角咖啡店室内午后阳光透过窗户 画面林薇坐在靠窗位置专注地在平板电脑上绘画。陈阳在吧台后忙碌。 动作林薇抬手示意点单陈阳点头微笑。 台词林薇“一杯拿铁谢谢。”陈阳“好的请稍等。” SCENE 02 时长30秒 场景咖啡店吧台 画面陈阳正在制作拉花特写咖啡杯。 动作陈阳不小心将拉花做成了一个小兔子的形状而林薇画的是小猫。 台词陈阳自语“啊走神了...” ... 后续分镜依此类推关键点每一个SCENE都应描述场景、人物、动作和镜头感觉这直接对应了文生图提示词的编写。4. 核心技能提示词工程深度拆解提示词是操控AI的“咒语”。编写优秀的提示词需要遵循一定的结构和技巧。4.1 文生图提示词通用公式一个高效的提示词通常包含以下几个部分按优先级排列[画面质量词] [主体描述] [细节修饰] [场景环境] [构图光影] [风格参考]画面质量词放在最前面强调画质。如masterpiece, best quality, ultra-detailed, 8k。主体描述谁在干什么穿着什么。要具体。如a beautiful Chinese young woman (林薇), long black hair, wearing a beige sweater, drawing on a tablet, smiling softly。细节修饰五官、表情、神态。如detailed eyes, delicate nose, blush on cheeks。场景环境在哪里。如in a cozy coffee shop, afternoon sunlight, wooden table, cup of coffee on table。构图光影镜头语言。如medium shot, from side view, cinematic lighting, soft shadows。风格参考想要的整体感觉。如Studio Ghibli style, warm color palette, film grain。负面提示词同样重要用于排除不想要的元素(worst quality, low quality:1.4), deformed, blurry, bad anatomy, disfigured, poorly drawn face, mutation, mutated, extra limb, ugly, poorly drawn hands, missing limb, floating limbs, disconnected limbs, malformed hands, out of focus, long neck, long body, text, watermark, signature4.2 小甜剧专属提示词模板结合小甜剧特点我们可以提炼出一些固定模块。模板一角色定妆照提示词用于生成统一风格的角色正面照方便后续多角度、多表情复用。正向提示词 (masterpiece, best quality, ultra-detailed, 8k), 1girl, (character name:林薇), beautiful detailed eyes, delicate face, long black hair, (wearing a beige knit sweater:1.2), looking at viewer, gentle smile, soft blush, pure white background, studio lighting, sharp focus, lora:koreanDollLikeness_v10:0.6, Negative prompt: (worst quality, low quality:1.4), background, nude, (bra:1.2), (panties:1.2), Steps: 25, Sampler: DPM 2M Karras, CFG scale: 7, Seed: [固定一个种子], Size: 512x768关键解析1girl明确主体数量。(character name:林薇)括号和权重1.2强调这是角色名辅助AI识别。pure white background纯白背景便于后期抠图合成。lora:koreanDollLikeness_v10:0.6调用LoRA模型0.6是强度权重可调整。固定种子生成满意图片后固定种子值可以微调其他参数如换衣服而保持脸部一致。模板二双人互动场景提示词正向提示词 (masterpiece, best quality, ultra-detailed), two people, a handsome Chinese young man (陈阳) and a beautiful Chinese young woman (林薇) sitting at a coffee shop table, the man is handing a cup of coffee to the woman, she is looking at the coffee with a surprised and happy expression, medium shot, over the shoulder view from behind the man, in a cozy modern coffee shop, large window, sunlight streaming in, bokeh lights, warm atmosphere, film still, cinematic, shallow depth of field, lora:koreanDollLikeness_v10:0.5, Negative prompt: ...同上 Steps: 30, Sampler: Euler a, CFG scale: 7.5, Size: 768x512 (横构图)关键解析two people明确人物数量。关系描述handing a cup of coffee to the woman描述具体互动动作。镜头语言over the shoulder view过肩镜头是影视剧常用构图能增强代入感。构图比例根据场景需要选择竖屏(512x768)或横屏(768x512)。4.3 使用图生视频提示词当你在Runway ML或Pika中将静态图片生成视频时也需要提示词来指导运动。Runway Gen-2 提示词示例Image Prompt: [上传生成的咖啡店场景图] Text Prompt: The girl looks at the coffee cup, then looks up at the boy and smiles softly. The boy nods slightly. The sunlight slowly moves across the table. Cinematic, smooth motion, subtle camera pan.核心要点描述动态重点描述你想看到的动作变化looks at... then looks up... smiles和镜头运动subtle camera pan。保持简单图生视频的文本提示词应简洁侧重于驱动已存在画面中的元素动起来而非添加新元素。运动修饰使用smooth motion,slow motion,cinematic等词提升视频质感。5. 完整实战制作《咖啡店的偶然》第一幕现在我们将理论付诸实践完成剧本中第一个场景SCENE 01的完整AI制作流程。5.1 第一步生成角色与场景资产根据剧本我们需要1. 女主林薇的定妆照2. 咖啡店室内场景图3. 男主陈阳的定妆照。操作1在SD WebUI中生成女主林薇将4.2节中的角色定妆照提示词模板复制到SD WebUI的正面提示词框。负面提示词使用通用模板。选择你下载的真人风格大模型如chilloutmix_NiPrunedFp32Fix.safetensors。在“Lora”标签页选择你下载的韩国风LoRA模型并设置权重为0.6。点击“生成”。如果对结果不满意可以调整“种子”为随机微调提示词如将gentle smile改为neutral expression或调整CFG Scale7-10之间。生成一张满意的正面照后记录下使用的种子数。操作2生成咖啡店场景正向提示词 (masterpiece, best quality, ultra-detailed, 8k), interior of a cozy and modern coffee shop, afternoon, sunlight streaming through a large window, light and shadow, wooden floor, comfortable armchairs, small round tables, one table near the window with a cup of coffee and a tablet on it, bookshelf in background, plants, warm lighting, wide shot, empty, no people, clean and tidy, film still, cinematic, Negative prompt: ...加入 people, human, crowd Steps: 28, Sampler: DPM 2M Karras, CFG scale: 8, Size: 768x512生成一张空场景图用于后续合成或作为图生视频的背景。操作3生成男主陈阳方法同女主修改提示词中的角色描述1boy, (character name:陈阳), handsome Chinese young man, short black hair, wearing a white barista apron over a casual shirt, friendly smile...5.2 第二步生成分镜静态图现在生成SCENE 01的完整画面“林薇坐在靠窗位置画画陈阳在吧台后忙碌”。我们需要一个双人同框的画面。这里有两种方法方法A直接生成使用类似4.2模板二的提示词但描述更具体“a girl sitting by the window drawing on a tablet, a male barista standing behind the counter in the background”。这种方法对模型构图能力要求高可能需要多次抽卡。方法BAI绘图后期合成这是更可控的方法。分别生成林薇坐在窗边画画的单人图使用固定好的女主脸新姿势。陈阳在吧台忙碌的单人图使用固定好的男主脸新姿势。利用Photoshop或GIMP等软件将抠出的人物图层合成到之前生成的空场景图中。方法B详解生成固定角色的新姿势这需要用到“角色复用”技巧。在SD WebUI中将生成好的林薇定妆照拖拽到“图生图”标签页的图片区域。在提示词中描述新姿势和场景(masterpiece...), 1girl, (林薇), sitting by a window, holding a tablet with a stylus, looking down at the tablet, drawing, focused expression, in a coffee shop...关键设置重绘幅度设置为0.4-0.6。太低没变化太高脸会崩。ControlNet开启一个ControlNet单元将同一张定妆照再次拖入预处理器选openpose或depth模型对应选择control_v11p_sd15_openpose或control_v11f1p_sd15_depth。这能更好地保持人物体型和姿势结构。种子可以固定也可以随机。点击生成直到得到一张姿势符合要求且脸部特征稳定的图片。5.3 第三步静态图转视频将上一步得到的分镜静态图无论是直接生成的还是合成的导入Runway Gen-2。访问Runway ML官网进入Gen-2工具。上传你的静态图。在文本提示词框中输入动作描述例如The girls hand moves slightly as she draws on the tablet. The barista wipes the counter in the background. Gentle camera zoom in.描述要基于你的画面内容。选择视频时长通常3-4秒对应一个分镜。点击生成。你可以多次生成选择动态最自然的一版。下载生成的短视频片段MP4格式。重复此过程为剧本中的每一个关键分镜生成视频片段。5.4 第四步视频剪辑、配音与合成将所有AI生成的视频片段、配音、字幕在DaVinci Resolve中合成。导入素材将视频片段、背景音乐、音效导入媒体池。粗剪在时间线上按剧本顺序排列视频片段。配音将剧本台词整理成文本。使用Edge浏览器“大声朗读”功能选择优质中文语音如“云希”录制每一句台词为音频文件。将配音音频拖到时间线的对应位置。字幕在达芬奇的“字幕”工作区根据配音添加字幕。可以统一字体、大小和位置。调色与转场为所有片段应用一个统一的“电影感”或“日系小清新”调色LUT。在片段之间添加简单的交叉溶解转场。背景音乐添加合适的轻柔背景音乐在调音台中调整配音和背景音乐的音量平衡确保人声清晰。导出选择H.264格式分辨率1080p帧率25或30导出成片。6. 常见问题与排查思路在AI创作过程中你一定会遇到各种问题。下表汇总了高频问题及解决方案问题现象可能原因排查与解决思路生成的人物脸部崩坏1. 提示词描述冲突。2. CFG Scale过高或过低。3. 采样步数不足。4. 模型本身问题。1. 检查提示词避免“微笑”与“张嘴”等冲突描述。2. 将CFG Scale调整到7-9之间。3. 增加采样步数至25-30。4. 尝试更换不同的大模型或LoRA模型。角色特征无法固定1. LoRA权重太低或太高。2. 提示词中角色描述权重不够。3. 图生图时重绘幅度太大。1. 调整LoRA权重通常0.5-0.8。2. 用括号和权重强调角色名如(林薇:1.3)。3. 降低图生图的重绘幅度至0.5以下并配合ControlNet。生成的视频动态诡异1. 图生视频提示词描述的运动过于复杂。2. 原始图片构图不适合运动。3. 模型本身限制。1. 简化提示词只描述1-2个简单的动作如“微微转头”、“轻轻眨眼”。2. 选择主体突出、背景相对简单的图片进行生成。3. 尝试Runway的不同运动强度Motion Brush或换用Pika Labs。多人物同框时相互污染1. 模型难以理解复杂空间关系。2. 提示词描述不清。1. 采用“分别生成后期合成”的方案这是最稳妥的。2. 如果必须直出使用更详细的方位描述如on the left, a girl... on the right, a boy...并启用Compositional Layout等高级控制插件。画面中出现不想要的元素负面提示词不够强力或具体。在负面提示词中明确加入该元素的描述如ugly, extra fingers, more than 5 fingers, bad hands。对于场景可以加入text, watermark, signature, logo。7. 最佳实践与进阶工程建议当你掌握了基础流程后以下建议能帮助你提升效率、稳定性和作品质量。7.1 工作流优化建立你的资产库角色库为每个主要角色生成一套“表情包”和“姿势集”正面、侧面、微笑、惊讶等并统一命名归档如林薇_正面微笑.png。这能极大提升后续分镜制作效率。场景库根据剧本类型预先生成一批常用场景咖啡店、图书馆、公园、客厅等的空镜并标注风格和光照条件。提示词库将验证过好用的提示词片段如高质量前缀、特定风格后缀、负面提示词保存成文本文件或SD WebUI的“风格”模板。7.2 提示词工程进阶技巧权重控制使用()增加权重默认1.1倍[]降低权重默认0.9倍(word:1.5)精确设定权重。例如(crystal clear eyes:1.3)。交替渲染使用[A|B]语法让AI在A和B概念之间混合可以产生有趣效果如[sunlight|moonlight]可能产生黄昏感。分步渲染使用BREAK指令或一些扩展插件可以指定在生成的某些步骤后侧重某些提示词用于控制构图和细节的生成顺序。7.3 视频制作的专业化技巧镜头语言在生成分镜图时有意识地设计镜头。特写表达情感、中景描述动作、全景展现环境交替使用能让视频更有节奏感。运动设计在图生视频步骤不要只让人物动。可以描述“镜头缓慢推进”、“背景灯光闪烁”、“树叶微微摇动”等环境微动增加画面呼吸感。音画同步剪辑时让动作的转折点如抬头、递东西与配音的重音或背景音乐的节拍点对齐能极大增强观感。7.4 合法合规与版权意识人物肖像避免生成与真实明星高度相似的脸部用于商业项目时尤其要注意。背景元素注意生成的场景中是否包含可能侵权的品牌Logo、特定建筑外观。音乐音效使用无版权或已购买版权的背景音乐和音效。许多平台提供免费的创作共用音乐。平台规则了解你计划发布视频的平台如抖音、B站、YouTube对于AI生成内容的标注要求。制作AI小甜剧是一个创意与技术结合的过程。它没有唯一的标准答案核心在于不断实验、迭代和优化你的工作流。从模仿一个简单的场景开始逐步尝试更复杂的剧情和镜头。当你成功产出第一个完整的短片时你会发现最大的收获不仅是掌握了一套工具更是获得了一种用AI表达故事的新能力。这套方法论同样适用于其他类型的短剧、产品介绍、概念演示等领域。