
MiniCPM-o-4_5-GPTQ vs 同类模型9B参数如何实现77.6分OpenCompass视觉能力超越30B大模型【免费下载链接】MiniCPM-o-4_5-GPTQ项目地址: https://ai.gitcode.com/OpenBMB/MiniCPM-o-4_5-GPTQMiniCPM-o-4_5-GPTQ是OpenBMB开源社区推出的量化版本多模态大模型基于MiniCPM-o 4.5进行GPTQW4A16量化在仅9B参数的情况下实现了77.6分的OpenCompass视觉能力评分超越了部分30B参数的大模型为开发者和普通用户提供了高效且强大的本地部署解决方案。 惊人突破小参数大能力的秘密 OpenCompass 77.6分的实力验证MiniCPM-o 4.5在OpenCompass综合评测中以77.6分的成绩展现了卓越的视觉能力。这一分数不仅超越了Qwen3-Omni-30B-A3B-Instruct75.7分等30B参数模型更是接近了Gemini 2.5 Flash78.5分的水平。在具体单项上其MMBench EN v1.1得分87.6MMBench CN v1.1得分87.2MathVista得分80.1均处于同类模型前列充分证明了其在视觉理解任务上的强大实力。 量化技术带来的效率提升作为GPTQ量化版本MiniCPM-o-4_5-GPTQ将GPU内存 usage从BF16格式的约19GB大幅降低至INT4格式的约11GB同时保持了出色的性能。在解码速度方面INT4格式下可达212.3 tokens/sTime to First Token仅需0.6秒实现了高效的推理体验让普通用户也能在本地设备上流畅运行。️ 核心功能与技术亮点 全模态能力覆盖MiniCPM-o-4_5-GPTQ具备强大的多模态处理能力支持视觉、语音等多种输入输出方式。其视觉能力不仅支持高分辨率图像可达180万像素和高帧率视频可达10fps处理还在OCR、文档解析等任务上表现出色在OmniDocBench评测中整体Edit指标达到0.109Read OrderEdit指标低至0.037超越了DeepSeek-OCR 2等专业工具。 端到端架构设计模型采用端到端的架构设计基于SigLip2、Whisper-medium、CosyVoice2和Qwen3-8B构建实现了视觉、语音等模态的深度融合。这种架构不仅保证了模型的性能还为全双工多模态实时流交互等创新功能提供了基础使模型能够同时处理实时的视频和音频输入流并生成并发的文本和语音输出流。 与同类模型的全面对比 视觉能力对比在视觉理解能力上MiniCPM-o 4.5-Instruct在多个评测指标上表现优异。例如在HallusionBench评测中得分63.2超过了Gemini2.5-Flash-Nonthinking59.1分和Qwen3-VL-8B-Instruct61.1分在AI2D评测中得分87.6接近Gemini2.5-Flash-Nonthinking的87.7分。这些成绩充分说明了MiniCPM-o 4.5在视觉理解的准确性和鲁棒性上的优势。⚡ 效率与性能平衡与30B参数的Qwen3-Omni-30B-A3B-Instruct相比MiniCPM-o-4_5-GPTQ在保持相近甚至更优性能的同时具有明显的效率优势。Qwen3-Omni-30B-A3B-Instruct在int4格式下GPU内存 usage为20.3GB而MiniCPM-o-4_5-GPTQ仅需11.0GB解码速度也更快为212.3 tokens/s远超Qwen3-Omni-30B-A3B-Instruct的147.8 tokens/s。 快速上手与应用场景 简单安装步骤要使用MiniCPM-o-4_5-GPTQ只需通过以下命令安装所需依赖pip install transformers4.51.0 accelerate torch2.3.0,2.8.0 torchaudio2.8.0 minicpmo-utils[all]1.0.2 auto-gptq然后通过简单的Python代码即可加载模型import torch from transformers import AutoModel model AutoModel.from_pretrained( openbmb/MiniCPM-o-4_5-gptq, trust_remote_codeTrue, attn_implementationsdpa, torch_dtypetorch.bfloat16, device_mapauto, init_visionTrue, init_audioTrue, init_ttsTrue, ) model.eval() 广泛应用场景MiniCPM-o-4_5-GPTQ的应用场景十分广泛包括但不限于视觉问答能够准确理解图像内容并回答相关问题。文档解析高效处理各种格式的文档提取文本、表格等信息。语音交互支持双语实时语音对话可进行语音克隆和角色扮演。实时流交互实现全双工多模态实时流交互为视频会议、直播等场景提供智能支持。 总结MiniCPM-o-4_5-GPTQ以9B参数实现77.6分OpenCompass视觉能力超越30B大模型是多模态大模型领域的一项重要突破。其出色的性能、高效的量化技术和丰富的功能为开发者和普通用户提供了强大且易用的工具。无论是进行学术研究还是实际应用开发MiniCPM-o-4_5-GPTQ都是一个值得尝试的选择。如果你对该模型感兴趣可以通过克隆仓库获取更多信息和资源https://gitcode.com/OpenBMB/MiniCPM-o-4_5-GPTQ。【免费下载链接】MiniCPM-o-4_5-GPTQ项目地址: https://ai.gitcode.com/OpenBMB/MiniCPM-o-4_5-GPTQ创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考