把腾讯混元3D打成便携包12G显存跑图生3D,从40分钟一个模型到一分半 把腾讯混元3D打成便携包3060 12G 跑图生3D从40分钟一个模型到一分半事情的起因很简单。我想在本地跑腾讯的 Hunyuan3D-2丢张照片进去出个能进 Blender 的 3D 模型。官方仓库 clone 下来环境折腾了两天终于跑通了。然后第一个白模生成了 40 分钟。我显卡是 RTX 3060 12G按官方说法这个配置是够的。盯着进度条看了半天发现采样速度是 20~25 秒一步而正常应该是 0.4 秒一步。慢了 50 倍不是显卡不行是哪里不对劲。坑在哪查了一晚上原因说起来就一句话官方版启动时把所有模型一次性全塞进显存。形状模型占一份纹理模型paint全驻留又占约 11 G两个加上采样激活12 G 直接爆了。Windows 的 WDDM 驱动不会报错它会悄悄把放不下的部分挪到内存里共享显存计算照常进行但速度崩了。不报错只变慢所以特别难察觉。知道病根就好办了。我做了三件事纹理模型懒加载。启动时不碰 paint只在硬盘上确认权重文件在。第一次点生成纹理才加载它。光这一步启动就省下 11 G。错峰。要做纹理了先把形状模型整个搬到 CPU 内存里给 paint 腾地方纹理做完再把形状模型搬回显卡。两个模型永远不同时满负荷占卡。截肢式释放。这个最有意思。纹理用完我本以为del gc.collect()就能释放显存实测没用显存还挂着 7.17 G。折腾三轮才发现是 Gradio 的请求上下文里存了对管线的 C 级引用Python 的垃圾回收根本看不见它。最后的办法比较暴力手动把管线里的子模型一个个弹出来、把内部引用全断掉让 CUDA 张量没人引用自然死亡。释放完显存从 7 G 多直接掉到 0.01 G。改完之后的实测同一台 3060 12G改完以后的数字单张照片出白模7~15 秒三张视角图出白模18.5 秒涂纹理1024 快速档50~60 秒从照片到带纹理的完整模型一分半左右纹理烘焙那一瞬间显存预留峰值能冲到 18 G超过物理显存的部分还是靠共享显存分页但因为形状模型已经搬走了不打架速度一点不掉。顺手把启动体验也改了。bat 双击后会先检测空闲显存给个建议问你要不要开低显存模式直接按回车就是按建议来。不需要懂显存是怎么回事。便携包既然坑都踩完了就把整个东西打了个包免得别人再装两天环境内置 Python 3.11 嵌入式环境不用装任何东西模型全部离线单图 mini-turbo0.6B3.6 G、多视图 mv-turbo4.6 G、纹理 paint-turbo6.1 G delight 打光4.1 G两个启动器run_gradio_auto.bat单照片版浏览器开 127.0.0.1:7860run_gradio_mv_auto.bat多照片版7861整个文件夹拷走就能用换电脑不用重配下载夸克网盘https://pan.quark.cn/s/945c9349e433备用https://yunyingmenghai.feishu.cn/wiki/CGYLwLQkYipA5uknCyIcM5Yin3x要求Windows 10/11NVIDIA 显卡 8 G 显存3060 12G 实测流畅硬盘留出 30 G。显存更小的卡也能跑白模阶段别开太多吃显存的程序就行。最后说两句如果你之前也试过 Hunyuan3D 并且卡在能跑但慢得离谱那一步大概率是同一个坑看一眼采样速度如果是 20 秒一步而不是 0.4 秒一步就是共享显存兜底的典型症状。把纹理模型从启动流程里摘出去立竿见影。包里的模型权重都是腾讯官方开源的我只做了便携化和显存调度优化。有问题评论区聊。