无审查多模态模型如何本地部署Qwen3-VL-32B 无审查版 ComfyUI 快速上手【免费下载链接】Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot项目地址: https://ai.gitcode.com/hf_mirrors/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot深夜两点插画师小林盯着屏幕叹气。她想要一组带点叛逆感的概念图可提示词改了三版模型每次都礼貌地拒绝我无法生成此类内容。AI 像被套上了紧箍咒。做创意的人都懂工具的限制往往比灵感枯竭更让人抓狂。Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot 这个无审查多模态模型就是来给创作者松绑的——过滤机制被大幅削弱INT8 量化又把硬件门槛压到一张 32GB 显卡就能跑。下面这篇文章就用讲故事的方式带你把它跑起来。⏱️ 30 秒速览卡它到底是个啥如果你赶时间先看这张表足够你判断要不要继续读下去条目一句话说明项目全名Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot一句话定义面向 ComfyUI 的无审查多模态模型包既能看图也能处理文本提示出身基于 Qwen3-VL-32B-Instruct经 Heretic v1.2.0 ARA 编辑大幅削弱拒答交付形式两个 safetensors 权重文件非完整推理框架使用位置ComfyUI 的 text_encoders 目录配合 CLIPLoader类型 minimax硬件门槛实测 32GB 显存RTX 5090流畅运行适合谁数字艺术家、内容创作者、需要不受限思考工具的研究者信息有点密别急下面逐层拆开讲。⚖️ 有它和没它创作体验差在哪与其背概念定义不如看对照。同样是让 AI 做点大胆表达这件事场景没有它原版 Qwen3-VL-32B有了它本项目提出 100 个敏感问题约 99 次被拒答约 4 次被拒答加载完整 BF16 权重超 51GB32GB 显卡装不下INT8 编码器仅 24.55GiB编码后显存占用约 51GB 起步约 24.7GiB接入 ComfyUI需自己折腾格式与量化开箱即用的 ComfyUI checkpoint一句话总结它做的事是在说话自由度和跑得起来之间找平衡——既不像原版那样动不动拒绝也不像其他大模型那样对硬件挑三拣四。✨ 三个值得记住的亮点亮点一解开紧箍咒但没拆掉大脑Heretic 编辑技术针对语言层 31–40 的注意力输出投影attn.o_proj做了定向调整。可以把这些层想象成 AI 内部的审查办公室——普通模型在这里决定这句话该不该说。这个版本相当于换掉了办公室的钥匙让模型想好了再说而不是看到敏感词就闭嘴。更难得的是这种削弱不是蛮干。上游给出的评估数据很能说明问题指标数值怎么理解拒答率4/100原版 99/100拒绝行为大幅下降KL 散度0.0421与原始输出分布的偏差很小PIQA92.87%物理常识推理几乎不受影响MMLU79.87%综合知识能力保持在线翻译成人话嘴上没了封条脑子还是那个脑子。亮点二51GB 缩到 24.55GB 的行李箱压缩术完整 BF16 版本超过 51GB对 32GB 显存的显卡来说根本塞不进去。这个项目的解法是 INT8 ConvRot 量化——你可以把它理解成给权重打包时的压缩行李箱既要让体积降下来又不能让里面的衣服压坏。具体手法有三层讲究350 个语言矩阵全部使用学习型行级 INT8 ConvRot组大小 256不是简单四舍五入而是经过 AdamW AdaRound 优化逐步迭代出来的压法视觉塔和所有归一化层保留 BF16 精度共 551 个张量因为图片理解这部分最怕精度损失词嵌入层单独用 tensorwise INT8用来兼容 ComfyUI 的查找逻辑。最终效果体积降到 24.55GiB编码后显存占用约 24.7GiB一张 RTX 5090 就能安稳坐下。亮点三主厨团队 临时外援的两段式架构这个包拆成两个文件像一家餐厅的人员配置条件编码器24.55GiB含语言层 0–49、词嵌入和完整视觉塔负责日常的图文条件编码实测输出形状(1, 12, 5120)可选生成尾层7.09GiB含语言层 50–63、最终归一化和 LM 头负责提示词增强相当于加班时才请来的外援。重点是可选二字平时只用编码器尾层在需要增强提示时临时加载用完自动卸载基础 CLIP 功能完全不受影响。实测它能生成通过全部 64 层产出的 token同时把 CLIP 原样归还还能继续正常输出(1, 4, 5120)的条件编码整套随用随取的设计是通的。️ 它适合放在工作流的哪些位置放手去用的场景艺术概念探索前卫视觉、实验性风格、打破套路的构图尝试叙事与剧本创作涉及复杂主题或成人向内容的本地化创作调研与模拟对敏感历史事件、社会议题做不受限的分析推演务必遵守当地法律法规。需要留神的边界别把它当绝对自由的许愿池。Abliteration 只是大幅降低拒答并不能保证移除所有安全机制少数拒绝行为依然存在别拿它做违法内容。输出可能不适合所有受众公开发布前请自行把关别指望它当通用对话框架。它是 ComfyUI 条件编码用途的权重包不是完整推理服务。 动手之前环境准备清单先把家当清点一遍缺什么补什么一台带 NVIDIA 显卡的电脑显存 32GB 起步RTX 5090 是官方实测环境硬盘预留约 35GB两个权重文件合计约 32GB再留点缓存余量最新版 ComfyUI官方实测基于 commit14b05228cef依赖comfy-kitchen0.2.26与comfy-aimdo0.4.11PyTorch 2.8.0cu128CUDA 13.0 为推荐组合12.8 也能跑通小提示comfy-kitchen的优化内核推荐 CUDA 13.0。用 12.8 会走回退运算结果依然正确但追求性能建议升级。 分步上手从克隆仓库到跑出第一张图第 1 步拿到权重文件克隆仓库确认两个 safetensors 文件完整下载git clone https://gitcode.com/hf_mirrors/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot第 2 步校验文件完整性仓库里的 SHA256SUMS 提供了两份校验值建议复制对应哈希自行核对d84547412144b7c50a6ec77437a889b869d3ace88da77ef1775d3d2a4901c192 qwen3vl_32b_minimax_h3_ultra_uncensored_heretic_int8_convrot.safetensors b5bb9bb8dc87cf11cbee241a2d95d6d42fe52cf695ed26c093ac321f31160b20 qwen3vl_32b_minimax_h3_generation_tail_50_63_int8_convrot.safetensors第 3 步放进 ComfyUI 模型目录把两个文件复制到或软链接到ComfyUI/models/text_encoders/MiniMax-H3/第 4 步配置加载节点在CLIPLoader节点中把类型选为minimax加载 0–49 层条件编码器。此时节点应识别出恰好 50 个语言层、无最终归一化和 LM 头说明加载正确。第 5 步可选接入提示词增强想让提示词更有表现力可以再接MiniMax H3 Prompt Enhancer节点用标准CLIPLoader类型minimax加载 0–49 层编码器把该 CLIP 连到增强节点在节点的clip_tail下拉框选择 50–63 尾层文件把返回的enhanced_prompt和原样返回的clip一起接回 MiniMax-H3 guide 节点。跑一次工作流看到有限的输出张量就算部署成功了。如果连接的 CLIP 本身已是完整生成模型把clip_tail留在默认的无即可增强节点会直接走普通生成路径。❓ 你可能想问的 5 个问题Q1无审查模型是不是什么都能生成不是。Abliteration 只是大幅降低拒答率不能保证移除所有安全行为也可能轻微影响生成质量。建议在可控环境中使用公开内容请遵守当地法规与伦理准则。Q2显卡只有 16GB 或 24GB 能跑吗官方实测是 32GB 的 RTX 5090编码后显存约 24.7GiB。24GB 已经非常紧张16GB 基本没有余量不建议抱太高期望。Q3为什么拆成两个文件只放一个行不行编码器负责日常图文条件编码尾层只服务提示词增强。只用基础功能的话放编码器一个文件就够想增强提示再加尾层。尾层不是独立模型单独放它没有意义。Q4INT8 量化之后效果会明显变差吗视觉塔和归一化层保留 BF16语言层用学习型 INT8 优化综合指标损失很小KL 0.0421、PIQA 92.87%。但量化终究有取舍对精度极敏感的极端场景建议对比上游 BF16 版本。Q5这个包能当普通的大模型推理框架用吗不能。它是 ComfyUI 专用的 checkpoint 权重不是完整的 Transformers 推理仓库需要配合 ComfyUI 及其对应节点使用。 写在最后如果你常被 AI 的礼貌拒绝打断创作又希望模型老老实实跑在自己的电脑上那么这份无审查多模态模型的 ComfyUI 本地部署方案值得一试。花一个下午按上面的清单走一遍你就能拥有一个说话不设限、硬件不挑食的本地图文模型。最后致敬背后的贡献者无审查源模型与评估来自 llmfan46原始模型出自 Qwen 团队量化工具用的是 silveroxides/convert_to_quant——正是这三环扣在一起才有了这个开箱即用的项目。下一步很简单打开你的 ComfyUI从第 1 步开始——剩下的交给显卡。【免费下载链接】Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot项目地址: https://ai.gitcode.com/hf_mirrors/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考