不用剪辑,我用 Codex 做了个手绘风视频Skill,让长文一键转视频! 最近我们在研究 HyperFrames 在 Codex 中的高阶玩法。想法其实很简单把一篇深度技术文章变成一段手绘白板风格的讲解视频。我们写了不少 AI 工具教程和行业分析有些文章信息密度比较高大家在手机上看长文容易走神。所以我们就想着做一些有讲解感、有画面推演的知识视频想着先用Codex试一下。传统做法是写脚本、做分镜动画、配音、剪辑。一篇文章变成视频快的要两三天慢的可能要拖一周。我们开源的手绘风视频skill无需额外的 API在 Codex 中使用内置的生图技能就可以完成一整条视频生成在 Codex 里几十分钟就可以完成01 先看一段Skill做出来的视频先看视频效果声音后续可替换为自己的声音手绘风视频Skill我们把一篇关于Skill的文章丢进去Codex自己拆出镜头学习误区、Skill 定义、案例、以及一个完整的上手路径等等。每个镜头都是白底黑线的线稿风格。画面里没有花哨的动画和背景音乐只有手绘线条、知识标注、关系箭头一支笔随着旁白逐步揭示画面内容。配音是使用的Mac电脑内置的语音节奏偏快。整个视频两分多钟从文章到成品加上中间检查调整不到半小时。02 手绘风视频Skill工作流程先来简单介绍一下这个 Skill 用到插件HyperFrames by HeyGen它是用 HTML CSS GSAP 动画来制作视频画面。它可以跑在 Codex、WorkBuddy、Claude Code 等等任何一个智能体的工作流中然后把写脚本、画线稿、配音、时间轴拼接这些步骤都串在一起。步骤大概是这样拆文章。 先把原文拆成 2 到 6 个镜头每个镜头只讲一个核心观点。这一步由Skill 自动完成不需要人手动分镜。画线稿。 每个镜头生成一张 16:9 的纯白底黑线条手绘稿。关键规则是图上不出现任何文字。所有标题、标签、字幕都通过 HTML 叠加渲染确保中文显示准确不会出现 AI 生图的乱码。配标注。每张线稿上标注 3 到 5 个知识标签箭头和关系线指向对应的图形区域。AI 概念有固定的视觉语言青绿表示数据与检索紫色表示模型与推理橙黄表示成本红色仅用于风险警告。配音。使用 Mac 电脑自带的Tingting 语音我设置的语音速度约 1.3 倍速。每句旁白单独生成音频文件构建脚本读取真实时长来驱动镜头切换。旁白讲完才转场不和画面脱节。渲染。 一支虚拟马克笔随着旁白逐步画出画面内容模块按顺序揭示镜头之间用交叉淡入过渡。最后输出就是一段完整的视频。03 它特别适合哪类内容我们试了几种类型的文章结论是信息密度高、逻辑链条清晰的内容生成效果更好。AI 技术科普和教程。比如解释 Skill 怎么工作、Hermes 和 Harness 的区别。HyperFrames 会把抽象概念翻译成可视化的图形关系比纯文字直观很多。知识密度高的分析文章。比如行业拆解、方法论总结。拆成镜头后每个镜头承载一个逻辑节点读者不用在大段文字里自己梳理结构。还有一种用法我们觉得挺实用把已有的文章快速转成视频版做内容分发。同一份内容多一个触达渠道不用额外投入制作时间。不适合的情况也很明显叙事性强、靠画面本身讲故事的内容比如产品评测、Vlog线稿风格反而限制了表现力。这类还是用传统拍摄或剪辑更合适。04 怎么安装把压缩包丢给 Codex、 Work Buddy 或者其他任何 AI Agent 工具安装就是一句帮我安装这个 Skill并设置为全局级skill。装完后在 Codex 里调用把要转换的文章发给它然后调用这个技能即可剩下的拆镜、线稿、配音、渲染全部自动跑。我们的经验是第一次跑建议先用一篇 1000 字左右的短文试水。跑通整个流程、确认配音正常、检查一遍线稿标注有没有越界再上长文。高密度镜头至少要有 6 个以上的模块和 3 个以上的标注少了说明拆镜不够细。有一点要注意HyperFrames 依赖 macOS 的 say 命令做语音合成Windows 用户需要额外配置 TTS。05 最 后当然这个 Skill 也不是最终版大家后续可以按照自己的风格优化配音也可以修改为自己的音色形成自己专属的 Skill。另外不要把HyperFrames 想象成那种一键生成完美视频的魔法工具。它更像一条把写稿、画图、配音、剪辑串起来的自动化流水线。帮你把写好的内容转成容易让人理解的科普视频让更多人、用更短的时间看完并看懂。如果你也有几篇压箱底的文章想试试效果推荐装一个。欢迎大家关注万象AI实验室帮你把AI工具真正用起来。