智谱开源模型GLM-4-9B-Chat有多强一文读懂9B对话大模型的6大核心能力【免费下载链接】glm-4-9b-chatGLM-4-9B-Chat 是一款强大的开源对话模型拥有多轮对话、网页浏览、代码执行和长文本推理等高级功能支持包括日语、韩语、德语在内的26种语言。在多语言处理、数学推理和工具调用等任务中表现出色是自然语言处理领域的突破性成果。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/ai-gitcode/glm-4-9b-chatGLM-4-9B-Chat 是智谱 AI 推出的90 亿参数开源对话大模型支持 128K 长上下文、26 种语言还具备网页浏览、代码执行和工具调用等全能技能。本文将带你一文读懂这个 9B 对话大模型的 6 大核心能力并附上本地部署方法新手也能快速上手。先认识一下GLM-4-9B-Chat 是什么一句话概括GLM-4-9B-Chat 是 GLM-4 系列中面向个人开发者和中小团队的轻量全能选手。核心参数说明参数量9B约 90 亿参数架构40 层 Transformer隐藏层 409632 个注意力头精度bfloat16权重总大小约 18.8GB分 10 个文件存储上下文长度128K另有 1M 超长上下文版本多语言支持日语、韩语、德语等26 种语言特色能力网页浏览、代码执行、Function Call 工具调用 从仓库中的 [config.json] 可以看到seq_length为 131072即 128K 上下文而模型结构定义在 [modeling_chatglm.py] 中分词器则位于 [tokenization_chatglm.py] 与 [tokenizer.model]。基准跑分小身材如何打大拳官方在多个经典任务上对 GLM-4-9B-Chat 进行了评测与同量级的 Llama-3-8B-Instruct 及上一代 ChatGLM3-6B 对比如下模型AlignBench-v2MT-BenchMMLUC-EvalGSM8KMATHHumanEvalLlama-3-8B-Instruct5.128.0068.451.379.630.062.2ChatGLM3-6B3.975.5066.469.072.325.758.5GLM-4-9B-Chat6.618.3572.475.679.650.671.8几个值得注意的亮点中文能力显著领先C-Eval 达 75.6 分几乎翻倍于 Llama-3-8B 的 51.3 分非常适合中文场景数学推理大幅跃升MATH 从上一代的 25.7 提升到 50.6代码生成更强HumanEval 71.8 分领先同级别模型近 10 分。6大核心能力逐个拆解 能力一人类对齐的多轮对话GLM-4-9B-Chat 是针对Chat对话做了深度人类偏好对齐的版本多轮对话自然流畅、指令遵循能力强。IFEval 得分 69.0与 Llama-3-8B 基本持平说明它能准确理解并执行各种格式要求比如用三句话总结以 JSON 输出。能力二128K 长文本推理这是本仓库版本的最大卖点——支持最大 128K 上下文。官方在 1M 长度下做大海捞针测试时表现稳定在 LongBench-Chat 长文本基准上也名列前茅。实际场景包括 一次性读完几十页的 PDF 报告并总结 对整本技术书籍做问答检索 分析超长代码仓库的关键逻辑。如果你需要处理约200 万中文字符的超大规模文档可以关注官方推出的 1M 上下文版本GLM-4-9B-Chat-1M。能力三26 种语言的多语言支持本代模型新增了多语言能力覆盖包括日语、韩语、德语在内的 26 种语言。在多语言数据集 M-MMLU 上得分 56.6明显领先 Llama-3-8B 的 49.6MGSM 多语言数学题上以 65.3 对 54.0 同样胜出。跨语言翻译、外文资料阅读、多语言客服都是它的主场。能力四网页浏览 在对话模板中内置了simple_browser工具模型可以主动发起搜索、打开网页、抓取页面内容并用规范的引用格式标注信息来源。也就是说你可以问它今天某款手机降价了吗这类需要实时信息的问题它会像人一样先查资料再回答。能力五代码执行 对话模板同样内置了python工具你发给它的 Python 代码会在有状态的 Jupyter 环境中执行模型可以读取执行结果、基于结果继续推理。这让算数、数据分析和代码调试类任务的可靠性大幅提升——它不是猜计算结果而是真的把代码跑了一遍。能力六Function Call 自定义工具调用 除了官方内置的浏览器和 Python 工具GLM-4-9B-Chat 还支持自定义 Function Call你可以把自己的 API查天气、查库存、下订单……以 JSON 格式描述给它模型能自主判断何时调用、并正确填写参数。在权威的 Berkeley Function Calling Leaderboard 上它的综合准确率达到81.00 分与 gpt-4-turbo81.24 分几乎打平远超同级别开源模型约 58 分——这是9B 打 9B之外最亮眼的数字。本地部署GLM-4-9B-Chat 怎么跑起来硬件参考原始 bfloat16 精度下权重约 18.8GB一张 24GB 显存的显卡如 RTX 3090/4090即可完整运行显存有限时建议使用 4bit 量化版本8GB 级消费级显卡也有机会。第一步获取模型仓库git clone https://gitcode.com/hf_mirrors/ai-gitcode/glm-4-9b-chat第二步确认依赖。官方建议使用transformers4.44.0并严格按照官方依赖清单安装否则可能无法正常运行。第三步加载模型并对话核心代码非常短from transformers import AutoModelForCausalLM, AutoTokenizer import torch tokenizer AutoTokenizer.from_pretrained(glm-4-9b-chat, trust_remote_codeTrue) model AutoModelForCausalLM.from_pretrained( glm-4-9b-chat, torch_dtypetorch.bfloat16, low_cpu_mem_usageTrue, trust_remote_codeTrue ).to(cuda).eval() query 你好 inputs tokenizer.apply_chat_template( [{role: user, content: query}], add_generation_promptTrue, tokenizeTrue, return_tensorspt ).to(cuda) outputs model.generate(**inputs, max_length2500, do_sampleTrue, top_k1) print(tokenizer.decode(outputs[0], skip_special_tokensTrue))追求更高吞吐的生产部署可以用 vLLM 后端设置max_model_len131072即可启用 128K 上下文遇到 OOM 时调小该值或增加tensor_parallel_size即可。仓库文件速览每个文件是干什么的文件作用[model-00001-of-00010.safetensors] ~ [model-00010-of-00010.safetensors]模型权重分 10 个文件存储合计约 18.8GB[model.safetensors.index.json]权重索引告诉加载器每个参数在哪个分片里[config.json]模型结构配置层数、维度、128K 序列长度等[generation_config.json]默认生成参数temperature 0.8、top_p 0.8[modeling_chatglm.py]模型前向计算的核心实现[configuration_chatglm.py]模型配置类的自定义实现[tokenization_chatglm.py] / [tokenizer.model]分词器代码与词表[tokenizer_config.json]分词器配置内置对话模板含浏览器、python 工具说明[LICENSE]模型权重使用协议商用前请仔细阅读总结谁适合用 GLM-4-9B-Chat✅个人开发者单张 24GB 显卡即可本地跑起一个会查网页、能跑代码的助手中文业务场景中文理解与长文档处理能力在 10B 以内开源模型中属于第一梯队工具型 Agent 开发Function Call 准确率接近 GPT-4 级别适合做智能体大脑多语言团队26 种语言开箱即用省去多模型切换的麻烦。9B 参数量 128K 上下文 全套工具能力GLM-4-9B-Chat 用小车拉大货的方式证明了开源对话大模型的天花板已经被不断抬高。【免费下载链接】glm-4-9b-chatGLM-4-9B-Chat 是一款强大的开源对话模型拥有多轮对话、网页浏览、代码执行和长文本推理等高级功能支持包括日语、韩语、德语在内的26种语言。在多语言处理、数学推理和工具调用等任务中表现出色是自然语言处理领域的突破性成果。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/ai-gitcode/glm-4-9b-chat创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考