)
文章目录1. Ollama 简介2. v0.32.1 版本亮点模型推理增强Bug 修复开发体验优化3. 获取安装包附录快速开始运行模型启动编程集成调用 REST API1. Ollama 简介Ollama 是目前最流行的本地大语言模型LLM运行工具在 GitHub 上已获得超过130,000 颗星标Stars是 AI 开发者社区中最受关注的开源项目之一。Ollama 于 2023 年 7 月首次发布由一支专注于让 AI 技术变得简单易用的团队创建。它的核心理念是让任何人都能在一分钟内在自己的电脑上运行最先进的开源 AI 模型。Ollama 的核心优势一键运行大模型无需配置 Python 环境、CUDA 驱动一条命令即可下载并运行 Llama、Gemma、Mistral、Qwen 等数百个开源模型跨平台支持同时支持 Windows、macOS含 Apple Silicon 原生加速和 Linux在 NVIDIA GPU 和 Apple Metal 上自动硬件加速REST API 内置自带兼容 OpenAI API 格式的 HTTP 接口默认localhost:11434任何支持 OpenAI 的客户端都能直接接入丰富的集成生态与 Claude Code、Continue、Cline 等主流 AI 编程工具有深度集成支持 Open WebUI、Dify、LangChain、LlamaIndex 等数百个社区项目模型管理便捷支持模型的下载、运行、自定义 Modelfile、量化、导入 GGUF 格式模型等全生命周期管理轻量高效资源占用低支持多模型并发内置 GPU 层数自动优化和并发请求队列管理隐私优先所有模型和数据完全运行在本地不会上传到任何云端服务器2. v0.32.1 版本亮点此版本为增量更新聚焦于工具调用增强、内存管理修复和开发体验优化。模型推理增强Gemma 4 工具调用改进增强了 Gemma 4 模型的工具调用tool calling和多轮推理multi-turn reasoning能力包括更可靠的 tool-response 续写机制Bug 修复MLX 缓存泄漏修复修复了一个反复出现的 MLX 模型缓存泄漏问题该问题可能导致跨请求内存占用持续增长同时改进了缓存快照性能MLX 超时配置MLX 文本模型加载现在正确遵循OLLAMA_LOAD_TIMEOUT环境变量模型选择器修复修复了ollama launch命令中当通过--model参数传入已弃用模型时选择Pick another model无法打开模型选择器的问题开发体验优化智能体 Web 工具当需要认证时智能体的 web search 和 fetch 功能现在会提示用户运行ollama signin智能体工作目录交互式智能体现在能接收当前工作目录为项目上下文提供更好的感知能力VS Code 文档更新更新了面向官方 Ollama 扩展的 VS Code 安装配置文档3. 获取安装包如果访问 GitHub 不便安装包及中文文档https://hanshuixin.org/go/2235内含 OllamaSetup.exe、README 中英对照、发布说明中英对照和 LICENSE。Windows安装ollama-v0.32.1OllamaSetup.zip ├── OllamaSetup.exe ├── 说明文档.pdf ├── README/ │ ├── README.md │ └── README-中文版.md ├── 发布说明/ │ ├── RELEASE-NOTES.md │ └── RELEASE-NOTES-中文版.md └── LICENSE附录快速开始双击整合包根目录中的OllamaSetup.exe按向导完成安装。安装完成后打开终端PowerShell 或命令提示符即可使用运行模型# 运行 Gemma 4 模型ollama run gemma4# 运行 Llama 模型ollama run llama3.2启动编程集成# 启动 Claude Code 集成ollama launch claude调用 REST APIcurlhttp://localhost:11434/api/chat-d{ model: gemma4, messages: [{role: user, content: 你好请介绍一下自己}], stream: false }