Ollama 2026 零基础上手指南——3条命令跑起本地大模型
想本地跑大模型打开搜索引擎一搜全是各种框架的安装文档CUDA 驱动、PyTorch 版本冲突、HuggingFace 模型格式转换……还没开始就已经放弃了。Ollama 解决的就是这个问题——把复杂的模型加载、推理环境、API 封装全部打包成一个命令。你不需要关心 CUDA 版本不需要写 Python 代码加载模型甚至不需要懂 GPU 编程。这篇文章不会跟你讲 Ollama 的架构设计你也用不上只讲一件事3 条命令跑起来然后做点有用的事。一、Ollama 是什么一句话定义本地大模型运行工具不需要 API Key不需要云端本地跑。Ollama 把模型下载、量化、推理引擎、REST API 封装成一整套工具链。你只需要执行ollama run 模型名它自动完成剩下的所有事。跟其他方案对比一下方案优点缺点适合谁Ollama安装简单、内置 API、模型管理方便定制化程度有限、性能不是最优想快速跑起来的人OpenAI API无需本地硬件、模型强大按次付费、数据要传到云端、需要 API Key不想折腾硬件的人vLLM性能极高、生产级吞吐安装复杂、需要懂 CUDA、配置多有大规模推理需求的工程师Text Generation WebUI图形界面、功能全面安装依赖多、启动慢、资源占用大喜欢图形界面的玩家Ollama 的定位很清晰让你以最低成本在本地跑起来一个大模型然后决定要不要继续深入。它不是性能最优的也不是功能最全的但它是上手成本最低的。二、安装Windows访问 ollama.com点击 Download for Windows下载OllamaSetup.exe双击安装全程下一步打开命令行验证安装ollama--version看到版本号输出就说明安装成功。重要提醒C 盘空间问题Ollama 默认把模型下载到C:\Users\你的用户名\.ollama\models。大模型动辄 4GB~40GBC 盘很容易爆。解决方法设置环境变量OLLAMA_MODELS指定模型存储路径。步骤右键此电脑 → “属性” → “高级系统设置” → “环境变量”在用户变量中点击新建变量名OLLAMA_MODELS变量值D:\ollama-models换成你想存的路径确定保存重启命令行之后所有模型都会下载到D:\ollama-models。注意设置环境变量后需要重启命令行窗口才能生效。如果你是在 PowerShell 中运行需要完全关闭再重新打开。macOS两种安装方式方式一官网下载访问 ollama.com下载.dmg文件拖到 Applications。方式二Homebrewbrewinstallollama验证ollama--versionmacOS 默认模型存储路径~/.ollama/models。如果需要修改同样设置环境变量OLLAMA_MODELS# 临时设置当前终端会话exportOLLAMA_MODELS/Volumes/External/ollama-models# 永久设置写入 shell 配置文件echoexport OLLAMA_MODELS/Volumes/External/ollama-models~/.zshrcsource~/.zshrcLinux一条命令curl-fsSLhttps://ollama.com/install.sh|sh安装完成后验证ollama--versionLinux 默认模型存储路径/usr/share/ollama/.ollama/models。修改路径# 为 ollama 服务设置环境变量sudosystemctl edit ollama.service在打开的编辑器中添加[Service] EnvironmentOLLAMA_MODELS/data/ollama-models保存后重启服务sudosystemctl daemon-reloadsudosystemctl restart ollama三、跑起来下载第一个模型安装完成后第一条命令ollama run qwen2.5这条命令会从 Ollama 官方仓库下载qwen2.5模型约 4.7GB自动加载到内存进入交互式对话界面你会看到类似这样的输出pulling manifest pulling 6e1f4c5b9ab3... 100% ▕████████████████████▏ 4.7 GB/4.7 GB pulling ab32f0c19c7e... 100% ▕████████████████████▏ 12 KB/12 KB pulling 4c61b0c20b4a... 100% ▕████████████████████▏ 24 B/24 B verifying sha256 digest writing manifest removing any unused layers success下载完成后自动进入对话模式 你好介绍一下你自己 你好我是通义千问Qwen系列大语言模型...输入/bye退出交互模式。常用命令# 查看已下载的模型列表ollama list# 后台下载模型不进入交互模式ollama pull llama3.2# 删除模型ollamarmllama3.2# 查看模型详情ollama show qwen2.5# 启动 API 服务后台运行ollama serve支持的主流开源模型模型参数量模型大小特点Llama 3.21B / 3B1.3GB / 2.0GBMeta 出品综合能力强Qwen2.50.5B ~ 72B0.5GB ~ 40GB阿里出品中文能力强DeepSeek-R11.5B ~ 671B1.5GB ~ 400GB深度思考模型推理能力强Mistral7B4.1GB欧洲开源模型效率高Phi-33.8B2.3GB微软出品小而精Gemma 22B ~ 27B1.6GB ~ 16GBGoogle 出品多语言支持好建议从小模型开始。3B 参数的模型在 8GB 内存机器上就能跑先试phi3:3.8b或qwen2.5:3b。四、进阶玩法命令行交互模式直接运行ollama run qwen2.5进入交互模式后可以调整参数ollama run qwen2.5--temperature0.7--top-p0.9常用参数--temperature随机性控制0~2默认 1。值越低输出越确定值越高越随机--top-p核采样参数0~1默认 0.9--num-ctx上下文长度默认 2048--num-predict生成 token 数上限-1 表示无限制在交互模式中可以用快捷命令/set parameter temperature 0.5— 临时修改参数/set system 你是一个专业的Python程序员— 设置系统提示词/save my-model— 保存当前配置为新模型/clear— 清空上下文/bye— 退出API 方式调用Ollama 内置 REST API默认监听http://localhost:11434。验证服务状态curlhttp://localhost:11434返回Ollama is running说明服务正常。生成文本一次性curlhttp://localhost:11434/api/generate-d{ model: qwen2.5, prompt: 用Python写一个快速排序算法, stream: false }返回 JSON 格式的结果。对话模式多轮curlhttp://localhost:11434/api/chat-d{ model: qwen2.5, messages: [ {role: system, content: 你是一个编程助手}, {role: user, content: Python中list和tuple有什么区别} ], stream: false }流式输出把stream设为trueAPI 会逐步返回 token适合长文本生成curlhttp://localhost:11434/api/generate-d{ model: qwen2.5, prompt: 写一篇关于大语言模型的文章, stream: true }Python SDK安装pipinstallollama示例代码importollama# 一次性生成responseollama.generate(modelqwen2.5,prompt用Python实现二分查找)print(response[response])# 流式生成forchunkinollama.generate(modelqwen2.5,prompt写一个冒泡排序,streamTrue):print(chunk[response],end,flushTrue)# 多轮对话messages[{role:user,content:什么是RESTful API}]responseollama.chat(modelqwen2.5,messagesmessages)print(response[message][content])# 继续对话messages.append(response[message])messages.append({role:user,content:给我一个Python示例})responseollama.chat(modelqwen2.5,messagesmessages)print(response[message][content])修改模型存储路径的完整步骤Windows很多人装完 Ollama 后发现 C 盘红了。这里详细说明如何迁移第一步停止 Ollama 服务任务栏右下角找到 Ollama 图标右键 → Quit。或者任务管理器结束进程。第二步移动已有模型数据如果已经下载了模型把C:\Users\你的用户名\.ollama\models整个文件夹移动到目标位置比如D:\ollama-models。第三步设置环境变量按照前面安装一节的方法设置OLLAMA_MODELS环境变量。第四步验证重启命令行运行ollama list如果能列出已下载的模型说明迁移成功。五、桌面 GUIOllama 现在有原生桌面应用不用命令行也能用。下载地址Windowsollama.com/downloadmacOSApp Store 搜索 “Ollama”或官网下载安装后打开应用会自动启动后台服务。界面说明桌面应用提供模型管理查看已下载模型、下载新模型、删除模型对话界面直接在窗口中与模型对话设置面板调整模型参数、查看系统资源占用命令行 vs GUI场景推荐方式写脚本、自动化调用命令行快速测试模型效果GUI集成到应用中API SDK日常使用、非程序员GUI命令行和 GUI 共享同一套模型数据。你在命令行下载的模型GUI 中可以直接用。六、踩坑实录模型下载太慢Ollama 官方服务器在国外国内下载经常只有几十 KB/s。解决方案换镜像源如果有可用的国内镜像代理设置 HTTP 代理# Windows PowerShell$env:HTTP_PROXYhttp://127.0.0.1:7890$env:HTTPS_PROXYhttp://127.0.0.1:7890ollama pull qwen2.5# Linux/macOSexporthttp_proxyhttp://127.0.0.1:7890exporthttps_proxyhttp://127.0.0.1:7890 ollama pull qwen2.5手动下载 GGUF 文件从 HuggingFace 下载量化后的 GGUF 模型然后用ollama create导入显存/内存不够跑大模型报错类似CUDA error: out of memory或直接卡死。解决方案从小模型开始ollama run phi3:3.8b或ollama run qwen2.5:1.5b使用量化版本Ollama 默认使用 4-bit 量化如果还不够可以找更低量化版本纯 CPU 运行Ollama 会自动检测没有 GPU 就用 CPU只是速度慢一些显存估算参考模型参数量4-bit 量化后大小建议显存3B~2GB4GB7B~4GB8GB14B~8GB12GB32B~18GB24GB70B~40GB48GB (或多卡)ollama serve没有自动启动正常情况下安装后 Ollama 服务会在后台自动运行。但有时需要手动启动。Linuxsudosystemctl start ollamasudosystemctlenableollama# 开机自启Windows/macOS打开 Ollama 应用即可启动服务。如果应用没有运行在命令行执行ollama serveAPI 连不上curl http://localhost:11434报错 “Connection refused”。排查步骤确认服务在运行ollama list或ps aux | grep ollama确认端口默认 11434检查是否被占用检查防火墙本地调用一般不受影响但如果设置过严格规则可能有影响检查环境变量OLLAMA_HOST默认127.0.0.1:11434如果改过需要确认Windows 下命令行找不到 ollama安装完成后 PowerShell 提示ollama : 无法将ollama项识别为 cmdlet、函数、脚本文件或可运行程序的名称。原因安装后 PATH 没有立即生效。解决方案完全关闭 PowerShell 窗口重新打开如果还不行重启电脑确认安装路径默认是C:\Users\用户名\AppData\Local\Programs\Ollama检查这个路径是否在 PATH 中七、性能参考不同硬件能跑什么模型这里给出一个参考表假设使用 4-bit 量化模型硬件配置CPU 推理GPU 推理建议模型8GB RAM无独显3B 及以下—phi3:3.8b,qwen2.5:3b16GB RAM无独显7B—llama3.2:3b,mistral:7b16GB RAMRTX 3060 (12GB)—7B~14Bqwen2.5:14b,gemma2:9b32GB RAMRTX 4070 (12GB)14B7B~14Bqwen2.5:14b,deepseek-r1:14b32GB RAMRTX 4090 (24GB)—32Bqwen2.5:32b,deepseek-r1:32b64GB RAM无独显32B—qwen2.5:32b(慢)多卡 2×RTX 4090—70Bllama3.1:70b,qwen2.5:72b几点说明CPU 推理速度慢生成速度通常只有 2~10 tokens/s但能跑起来GPU 推理速度快得多4090 跑 7B 模型可以到 100 tokens/s内存/显存不够时系统会使用交换空间速度会骤降实际性能受量化精度、上下文长度、batch size 等因素影响建议先用小模型跑通流程再根据硬件条件尝试更大的模型。结尾Ollama 最大的价值不是性能是让你以最低成本试错。你想本地跑大模型可能是为了隐私保护数据不出本地节省 API 费用开发测试不用每次都调云端 API学习大模型原理无论哪个目的Ollama 都能让你在 10 分钟内跑起来一个能用的模型然后你再决定要不要深入。它不适合大规模商用场景——那种情况你应该看 vLLM、TensorRT-LLM或者直接用云服务。但对于开发测试、学习实验、小规模内部工具Ollama 是目前最省心的选择。别纠结了先跑起来再说。