llm参考表 一、基础换算每 1B 参数精度位宽每参数字节1B 参数占用FP32单精度32bit4 Byte≈ 4.0 GBFP16/BF16半精度16bit2 Byte≈ 2.0 GBINT8 / FP88bit8bit1 Byte≈ 1.0 GBINT4 / FP44bit4bit0.5 Byte≈ 0.5 GB二、常见规模 × 精度 对照表理论值模型规模FP32(GB)FP16/BF16(GB)INT8(GB)INT4(GB)1B4.02.01.00.53B12.06.03.01.57B28.014.07.03.58B32.016.08.04.014B56.028.014.07.027B/32B112.056.028.014.070B280.0140.070.035.0三、实际部署的额外开销重要推理inference加KV Cache4k 上下文通常再增加13GB7B 为例。框架/激活临时一般再加10%30%。训练/微调优化器状态如 AdamFP16 下通常是2×4×参数量显存。梯度、激活、中间张量远大于推理。梯队层级所属代际/系列具体型号参数规格架构类型核心性能定位技术亮点标准上下文窗口典型部署环境推荐适用业务场景开源/闭源属性FP16显存预估FP8显存预估INT8显存预估INT4显存预估旗舰性能梯队Qwen3.6 闭源商用线云端Plus、Max自研混合架构全系代际性能天花板支持百万级超长上下文、多模态深度融合最高1M Token阿里云API云端调用顶级科研、超长篇文献分析、政企复杂决策系统、超大智能体集群完全闭源无本地权重不开放本地部署不开放本地部署不开放本地部署不开放本地部署旗舰性能梯队Qwen3 开源旗舰稠密Qwen3-32BDense稠密Qwen3-32B稠密版综合能力跨级超越Qwen2.5-72B推理稳定性强128K~256K Token多卡GPU集群、企业私有云大型项目开发、百万字长文档精读、复杂逻辑推理、专业代码工程Apache2.0开源64~72GB32~38GB34~40GB22~28GB旗舰性能梯队Qwen3 开源MoE混合专家Qwen3-235B(推理仅激活22B)MoE混合专家总参数量超大推理仅激活少量专家兼顾强能力与推理成本可控128K~256K Token多卡GPU集群、批量离线任务集群海量文档批量处理、多语种大规模翻译、数据集自动化标注Apache2.0开源50~60GB25~30GB26~32GB18~24GB高性能/生产力梯队Qwen2.5 稠密主力Qwen2.5-72BDense稠密曾登顶全球开源大模型榜单知识储备极丰富公文/文书能力成熟128K Token多卡高性能服务器、本地私有化集群企业全域知识库、公文批量编审、大型代码仓库解析、专业跨境翻译Apache2.0开源140~160GB70~80GB75~90GB45~55GB高性能/生产力梯队Qwen2.5 稠密主力Qwen2.5-32BDense稠密老牌开源性价比标杆生态插件与微调方案极完善128K Token多卡服务器、私有云部署中型企业知识库、合同/标书撰写、批量内容生产、本地化API服务Apache2.0开源64~72GB32~38GB34~40GB22~28GB高性能/生产力梯队Qwen2.5 稠密主力Qwen2.5-14BDense稠密上一代中端主力成熟稳定适配各类传统微调场景128K Token单卡24G显卡、轻量集群客服中台、内容批量改写、中小型知识库、低并发私有化接口Apache2.0开源28~32GB14~17GB16~20GB10~14GB高性价比/均衡梯队Qwen2.5 轻量主力Qwen2.5-7BDense稠密10B参数以内综合能力标杆轻量化微调成本极低128K Token单张24G消费级GPU、个人本地部署个人AI助手、本地RAG知识库、短视频文案、小体量客服机器人Apache2.0开源14~18GB7~9GB8~11GB5~8GB高性价比/均衡梯队Qwen3 甜点均衡型号Qwen3-14BDense稠密支持快慢双思考模式14B参数对标前代30B效果单卡可跑128K Token单24G消费级显卡、轻量云主机高频并发对话API、工具调用Agent、个人本地私有化、创业项目轻量化落地Apache2.0开源28~32GB14~17GB16~20GB10~14GB轻量级/端侧纯文本梯队Qwen2.5 端侧文本Qwen2.5-2B / 3B / 4B / 8BDense稠密极致轻量化支持CPU无显卡离线推理功耗极低32K~128K Token笔记本CPU、嵌入式主板、老旧电脑离线运行物联网文本解析、离线翻译、本地简易摘要、硬件内置AI模块Apache2.0开源2B58GBbr3B710GB4B912GBbr8B1824GB2B2.54GBbr3B3.55GB4B4.56GBbr8B912GB2B35GBbr3B46GB4B57GBbr8B1013GB2B1.53GBbr3B24GB4B2.55GBbr8B47GB轻量级/端侧多模态VL梯队Qwen3-VL 图文多模态Qwen3-VL-2B文本基座专用视觉编码器原生支持图片输入、OCR识别、画面内容理解、简单图文问答32K~128K Token手机端、边缘工控机、笔记本离线识图拍照文档扫描识别、商品图文质检、移动端识图助手、离线图文翻译全系开源10~16GB5~8GB6~9GB3~5GB轻量级/端侧多模态VL梯队Qwen3-VL 图文多模态Qwen3-VL-32B稠密大参数量多模态复杂图表解析、PDF图文混排文档理解、长图文多轮分析128K Token多卡GPU、云端图文解析服务财报图表提取、论文插图解读、档案图文批量归档全系开源同Qwen3-32B稠密同Qwen3-32B稠密同Qwen3-32B稠密同Qwen3-32B稠密