AI数字人 1、数字人效果介绍HeyGem要花钱前期用点数。这个对电脑性能要求高且租4090的服务器费用较高。后面介绍第一款。推荐配置CPU第13代英特尔酷睿 i5 - 13400F内存32GB显卡RTX 4070注确保你拥有NVIDIA显卡并且驱动程序已正确安装。NVIDIA驱动程序下载链接https://www.nvidia.cn/drivers/lookup/这是wsl安装的Linux虚拟环境这是在Ubuntu上安装docker如下图所示5090经过验证其他的需要进行测试。最后进入的页面展示2、介绍EchoMimic V3输入图片和讲话的语音就可以生成数字人以及文本提示词来控制人的手的动作身体的姿态。3、部署EchoMimic V3在算力云租算力不等同于租云服务器。两者本质方案大白话定义核心卖点GPU 算力租赁租「高端显卡集群」整个机器就是为了跑计算重活设计的CPU、内存都是给显卡 “打下手” 的显卡算力强、显存大、多卡能合力干活通用云服务器租「云端普通电脑主机」核心靠 CPU 干活显卡是可选的附加配件主要跑日常业务通用能力强、配套运维工具全、便宜核心差异对比对比维度GPU 算力租赁专用算力通用云服务器ECS定价逻辑以GPU 显卡型号 / 数量为定价核心CPU、内存为配套附属资源以CPU 核数为定价核心GPU 属于高价选配配件计费方式小时级按量计费、包年包月折扣力度大支持闲置分时低价算力秒级按量计费、包年包月预留实例小幅优惠无分时算力硬件性能标配高端显卡4090/A100/H100 等、大显存支持多卡 NVLink 高速互联可合力跑大任务多为整机物理独占默认无 GPU选配多为中低端卡无多卡高速互联能力普通机型为多租户共享物理资源适用场景大模型训练、深度学习微调、3D 渲染、大规模并行计算、高显存 AI 推理网站 / 小程序后端、业务管理系统、数据库、轻量推理、开发测试、通用计算环境灵活性预装 PyTorch/TensorFlow/CUDA 全套 AI 环境开箱即用原生支持分布式训练框架仅提供基础操作系统AI 环境需手动搭建CPU / 内存 / 带宽可自由升降配网络与存储内网支持 RDMA 高速互联多机训练延迟低配套高速本地 SSD数据集读写速度快普通千兆内网不适合分布式训练标配云硬盘满足通用业务读写需求适配人群AI 算法团队、高校科研课题组、渲染工作室、深度学习竞赛队伍中小企业运维开发、个人开发者、网站 / 小程序运营方快速选型规则1、核心任务是 AI 训练、大模型微调、批量渲染、大规模并行计算→ 直接选 GPU 算力租赁2、核心任务是搭网站、跑业务、存数据、日常开发、低并发轻量推理→ 直接选通用云服务器3、两类需求同时存在→ 混合搭配性价比最高云服务器承接业务接口与日常服务算力集群专职负责训练与重度推理总结GPU 算力租赁是「专门干重计算活的显卡集群」通用云服务器是「处理日常业务的云端主机」。按需匹配场景避免算力冗余或性能不足。这里选择的算力4090就行比正常的服务器便宜服务器4-6块/时。CPU16核GPU24GB至少24GB以上系统盘30G就够用内存120GB租完后进入控制台进入云容器要求GPU 4090 显存24G (跑同样500kb的图片GTX 1060Ti 1070Ti只能跑起来5kb像素会特别低A100 显存80G的服务器可以跑5M的)python环境3.10/3.11都可以服务器默认安装了conda如果没有的话自行安装一下输入的指令大致如下cd envs/cd 你的环境名/ # 创建目录 mkdir temp cd temp/ # 进入项目文件夹名 # 创建一个新的环境 conda config --show envs_dirs # 未指明默认安装在系统盘里 # 安装在指定的路径下 conda config --add envs_dirs /root/autodl-tmp/envs/你的名字/temp/ # 查看所有的环境 conda envs list # 创建python环境 conda create -n python_echomimic_v3 python3.10 # 删掉目录 conda config --remove envs_dirs /你要删除的目录 # 查看安装的python目录 conda env list # 切换到python的环境 conda activate python_echomimic_v3 # Linux 的移动也可用来重命名命令 mv /root/autodl-tmp/echomimic_v3-main.zip ./ # 解压 unzip echomimic_v3-main.zip # cd echomimic_v3-main # ll # ll等价于完整命令ls -l4、模型准备命令整体cat ../../download.py1、catLinux 文本命令在终端输出目标文件里的完整文字用来快速查阅代码内容2、路径规则../回到上一级文件夹../../连续向上回溯两层文件夹最终锁定两层上级目录里的download.py脚本3、执行效果读取外层目录的 Python 脚本把代码打印到终端做内容核验下载在models的目录里如上图所示指令1. vim 工具定位Linux 内置终端代码文本编辑器不靠图形界面在黑框终端里完成代码查看、代码修改、内容保存。2. 整条命令作用打开当前目录下名叫app_mm.py的 Python 源码文件进入 vim 编辑界面可查阅、修改项目代码。3. 基础操作刚需容器改代码必用按i进入编辑模式能打字修改代码按Esc退出编辑模式切回指令模式输入:wq回车保存改动、关闭 vim 退回终端输入:q!回车放弃本次修改直接强制退出4. 和之前 cat 做区分cat仅只读打印代码不能编辑改动内容vim支持编辑、保存代码用来调整项目配置、修改业务逻辑进入后模型下载的位置命令 tree ./ 结构化解析1. 整体功能以树形层级结构递归展示当前目录下所有子文件夹、文件的嵌套关系直观呈现完整目录架构。2. 命令拆分treeLinux 目录查看工具负责把目录文件按树状分支、缩进层级排版输出./代表「当前终端所在的工作目录」表示从当前目录开始遍历生成树结构3. 执行效果对应截图一次性列出 models 目录下 3 个主文件夹BadToBest/PAI/facebook以及所有子文件夹、模型权重、配置文件的层级关系不需要逐个进入文件夹查看。4. 核心用途快速校验模型文件是否下载完整、目录结构是否符合项目要求排查路径配置错误。补充和 ll 的区别ll仅展示当前一层的文件 / 文件夹tree递归展示所有层级的完整目录树下图为目录结果pwd 用来输出你当前终端所在文件夹的完整绝对路径。原有一秒生成160张图片1s 160FPS现在经过量化处理1s生成24张图片减少显存的应用如上图所示无法继续进行原因是缺少包下图是安装对应的依赖包python -m pip install -r ./requirements.txt如果安装的这个包爆红了可能的原因是根据时间的推移运行对应的python版本发生了变化算力云官方提供的工具AutoDL进来之后通过隧道工具将服务器端口7891映射到本地端口5、EchoMimic V3效果展示图片尽量要小一点如果放大看起来比较模糊放小后会好一些显卡性能高会画质更好一些。免费的文字转语音网址Luvvoice: Free Convert Text to Speech Online, No Word Limithttps://luvvoice.com/注提示词不会写用AI生成或者找到prompt目录cd prompts/里面有许多图片你可以打开源码把01.txt里面的提示词拿出来看一看图片看怎么写的提示词交给AI上传其他图片。6、部署Sonic数字人效果腾讯*浙大Sonichttps://github.com/jixiaozhong/Sonic细节和动作会特别精准具体步骤可以看github的介绍这里就不讲了为什么强调「两个环境不要一致」这是 AI 项目部署的核心准则不是多此一举避免版本冲突不同 AI 项目对 Python、PyTorch、CUDA 版本要求差异极大共用环境极易出现依赖报错导致项目无法运行故障隔离单个环境配置出错直接删除重建即可不会影响其他已跑通的项目保护基础环境防止依赖堆砌污染 base 环境避免全局环境彻底混乱进入sonic下载相关包huggingface_hub下载到相应的目录里面下面要安装Ffpeg工具安装教程略FFmpeg 是什么FFmpeg 是一款开源免费、跨平台的专业音视频处理工具集是音视频领域的事实标准工具被几乎所有视频软件、AI 音视频项目作为底层依赖调用被称为 “音视频界的瑞士军刀”。 它本身是纯命令行工具没有图形界面既可以手动输指令操作也可以被 Python 程序自动调用是你部署数字人、视频生成类 AI 项目的必备依赖。核心能力数字人项目高频用到格式与编码转换支持几乎所有音视频格式mp4、avi、mov、mkv、mp3、wav 等和编码格式互转是解决 “视频无法播放、编码不兼容” 最常用的手段。帧处理与视频合成既可以把视频拆成一张张图片抽帧喂给 AI 模型也可以把 AI 生成的图片序列合成为连贯的视频是 AI 视频生成的必经环节。音轨处理与音画同步从视频中提取音频、给视频替换 / 添加音轨、对齐音画时间轴 —— 数字人口型视频的最终合成基本都靠它把 AI 语音和驱动画面合并。剪辑与参数调整截取片段、合并视频、调整分辨率 / 帧率 / 码率在不明显损失画质的前提下压缩视频体积。在你的数字人项目里的具体作用以 EchoMimic 这类口型驱动项目为例输入的驱动视频 / 人物素材需要先用 FFmpeg 抽帧、转成模型能读取的图片序列模型生成的原始画面需要用 FFmpeg 合成为完整视频生成的 AI 语音需要用 FFmpeg 与画面做音画对齐、合并成最终的带声视频输出视频的分辨率、帧率、体积优化全部由 FFmpeg 完成 缺少它会直接报ffmpeg not found类错误项目完全无法运行。生成速度相比上一个会很快生成的效果相对于上一个模型也会相对比较好。7、总结我说一下我的情况我首先本着不花钱的原则想着在自己电脑上跑一下最后能出来那个网页但是上传图片和音频无法合成视频后面我会把复盘放在最后因为我做了大概160轮的调试但是均以失败告终后面就放弃了也怕误导大家就不给大家展开说具体的步骤了感兴趣的可以按照上面的步骤租算力试一试。我的电脑是RTX5060按照AI给我提供的网址来下载的这三个安装包链接如下及各个包解释如下download.pytorch.org/whl/cu128/torch/https://download.pytorch.org/whl/cu128/torch/download.pytorch.org/whl/cu128/torchvision/https://download.pytorch.org/whl/cu128/torchvision/download.pytorch.org/whl/cu128/torchaudio/https://download.pytorch.org/whl/cu128/torchaudio/这三个包下完能干什么 torch — 大脑全称PyTorch 核心库干啥的所有 AI 计算的基础引擎张量运算、自动微分、神经网络层CNN/RNN/Transformer、GPU 调度、模型保存/加载类比汽车的发动机 底盘。没有它其他两个根本跑不起来你的项目里谁在用它所有代码都在用——模型加载、推理计算、音频编码、图像处理、视频生成每一步都依赖 torch torchvision — 眼睛全称PyTorch 视觉工具包干啥的图像/视频处理的专用工具预训练模型ResNet/ViT 等、图像变换裁剪/缩放/增强、数据加载器、视频编解码、CLIP 图像编码器类比汽车的摄像头和视觉系统。负责看图片和视频你的项目里谁在用它EchoMimicV3 的CLIPModel提取参考图特征→src/wan_image_encoder.pySonic 的CLIPVisionModelWithProjectionSVD 管线里的图像嵌入 torchaudio — 耳朵全称PyTorch 音频工具包干啥的音频/语音处理的专用工具音频加载、波形变换、MFCC 特征提取、预训练音频模型接口Whisper/Wav2Vec2类比汽车的麦克风和听觉系统。负责听声音你的项目里谁在用它EchoMimicV3 的 Wav2Vec2 音频编码器把你的音频转成模型能理解的向量→app.py里的Wav2Vec2ModelSonic 的 Whisper 音频特征提取 →sonic.py里的WhisperModel我第一个torch版本下好了花了40多分钟后面两个包因为体积大会导致网络中断下载特别慢目前清华镜像源等众多平台还没有将国外的同步到这个版本不能全部下载好全部内容所以建议直接在anaconda prompt里面下载这个下载速度快。注意要选对文件名。每个文件的文件名必须同时包含这 3 个词关键词含义你的值cp310Python 版本3.10win_amd64操作系统Windows 64位cu128CUDA 版本12.8兼容你的 RTX 5060缺任何一个都不行。因为我的电脑是RTX5060安装的python版本是3.10比如看到cp313/cp314→ 跳过那是 Python 3.13/3.14 的看到manylinux/aarch64→ 跳过那是 Linux / ARM 的要根据自己的电脑性能选择对应的文件名。后面的三条命令是验证是否已经安装成功。安装过程也是蛮费劲的因为直接下载太慢了后面在anaconda prompt上面下载快一些全部下载好后我就运行以下三条指令。数字人资料 — 代码完整性分析报告EchoMimicV3 本地部署收尾总结