
2026 本地 LLM 完全入手指南:用 Ollama 在个人电脑上跑大模型
从零开始的 Ollama 折腾教程:安装、模型管理、Python API 集成、Docker 部署,以及怎么把本地模型接入开发工作流
原文来源:SitePoint - How to Run Local LLMs in 2026 — 面向开发者的本地 LLM 部署完整指南,覆盖 Ollama 安装配置到生产级集成
在云端跑 AI 很方便,但私密性差、有延迟、还得看 API 配额脸色。如果你的数据不想出本地,或者你只是不想每个月交 GPT 订阅费,在本地跑大模型是一个越来越可行的选择。
2026 年的本地 LLM 工具链已经相当成熟。Ollama 是目前最简单、最流行的方案——一条命令装模型,一条命令跑推理,还内置了 OpenAI 兼容的 API。
准备工作
需要的硬件:
- macOS 13+ 或 Linux(Ubuntu 20.04+ 测试通过)
- Windows 用户需要从 ollama.com/download 下载安装器
- 8GB 以上内存(推荐 16GB)
- 基本的命令行经验
软件要求:
- Python 3.8+
- curl
- 约 10GB 磁盘空间(用于模型文件)
—— 广告 ——
安装 Ollama
# macOS 和 Linux
curl -fsSL https://ollama.com/install.sh | sh
# 验证安装
ollama --version安全提示:如果你对管道安装脚本不放心,可以先用 curl -fsSL https://ollama.com/install.sh -o install.sh && less install.sh 查看脚本内容,确认没问题再执行。
Windows 直接去官网下安装包,装完自动加到系统 PATH。
拉取并运行你的第一个模型
Ollama 的工作流和 Docker 非常像——需要先 pull,再 run。
# 2026 年推荐的入门模型
ollama pull gemma3:4b-q5_K_M
# 直接交互式聊天
ollama run gemma3:4b-q5_K_M启动后会进入一个交互式聊天界面,直接打字就行。退出用 /bye。
选模型的思路
到 ollama.com/library 可以看到所有可用模型。2026 年比较热门的本地模型选择:
- Qwen 3 8B(阿里):多语言能力强、推理质量好,适合日常使用
- Gemma 3 4B(Google):轻量级,在 4B 参数级别上表现惊艳,适合 8GB 内存的笔记本
- Llama 4 Scout 8B(Meta):通用能力强,工具调用表现好
- DeepSeek R1 7B:推理和代码能力突出
量化标签说明:
q4_K_M:4-bit 量化,质量/体积最佳平衡,最推荐q5_K_M:质量略高,但体积大约多 20%q8_0:接近无损,适合内存充裕的场景
注意:Ollama 仓库的模型标签可能会更新。如果某个标签下载失败了,去 ollama.com/library 查一下最新的标签名。
从代码中调用 Ollama
Ollama 会在本地自动启动一个 HTTP 服务(端口 11434),并且提供了 OpenAI 兼容的 API。这意味着你现有的 OpenAI SDK 代码,把 base_url 改一下就能直接用。
用 OpenAI SDK 调用
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="not-needed" # Ollama 不验证 key,但字段必须填
)
response = client.chat.completions.create(
model="gemma3:4b-q5_K_M",
messages=[
{"role": "user", "content": "用中文解释一下什么是 RAG"}
],
temperature=0.7,
max_tokens=500
)
print(response.choices[0].message.content)用 Ollama 原生 Python 库
pip install ollamaimport ollama
response = ollama.chat(
model="gemma3:4b-q5_K_M",
messages=[
{"role": "user", "content": "帮我写一个 Python 斐波那契数列函数"}
]
)
print(response["message"]["content"])流式输出的场景
from openai import OpenAI
client = OpenAI(base_url="http://localhost:11434/v1", api_key="not-needed")
stream = client.chat.completions.create(
model="gemma3:4b-q5_K_M",
messages=[{"role": "user", "content": "Write a haiku about AI"}],
stream=True
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)进阶:用 Docker 部署 Ollama
version: "3.8"
services:
ollama:
image: ollama/ollama:latest
container_name: ollama
ports:
- "11434:11434"
volumes:
- ollama_data:/root/.ollama
restart: unless-stopped
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: all
capabilities: [gpu]
open-webui:
image: ghcr.io/open-webui/open-webui:main
container_name: open-webui
ports:
- "3000:8080"
volumes:
- open-webui_data:/app/backend/data
depends_on:
- ollama
restart: unless-stopped
volumes:
ollama_data:
open-webui_data:运行:docker compose up -d
这会在本地启动一个 ChatGPT 风格的 Web 界面(Open WebUI),支持多模型切换、对话历史、文件上传和用户管理。团队内部搭建 AI 服务的话,这是最省事的方案。
与开发工具集成
VS Code + Continue
{
"models": [
{
"title": "Ollama Local",
"provider": "ollama",
"model": "gemma3:4b-q5_K_M",
"apiBase": "http://localhost:11434"
}
],
"tabAutocompleteModel": {
"title": "Qwen 3 8B",
"provider": "ollama",
"model": "qwen3:8b"
}
}Cursor / Windsurf
这两个 IDE 都支持自定义 API 端点,填入 http://localhost:11434/v1 就能把本地模型当做 AI 助手使用。
常见问题
Ollama 服务无法访问
# 检查进程是否运行
ps aux | grep ollama
# 手动启动服务
ollama serve
# macOS 上 ollama 会自动管理后台进程,不需要手动启动模型下载一半断开了
重新执行 ollama pull 会从断点续传,不需要重新下载。
推理太慢
- 换小模型(从 8B 降到 4B)
- 用更高量化(从 q4 降到 q3)
- 确认 GPU 加速是否生效(Mac 的 Metal、Linux 的 CUDA)
# Mac 上确认 Metal 加速
ollama run gemma3:4b-q5_K_M --verbose
# 输出中会显示 "gpu" 字段内存不足
# 查看已缓存的模型
ollama list
# 卸载不需要的模型释放磁盘空间
ollama rm 模型名
# 用模型时限制并发数
ollama run --num-gpu 1 模型名从本地到生产
完成本地部署后,下一步可以尝试:
- 构建 RAG 管道:用 ChromaDB 做向量存储,让本地模型能回答你的私有文档
- 做结构化输出:用 Pydantic 定义输出 Schema,让本地 LLM 输出的 JSON 格式正确
- 做模型微调:用 Unsloth 或 Axolotl 在本地数据集上微调模型
- 部署成团队服务:把 Ollama 放到反向代理后面,加上 TLS 和基本认证
小结
2026 年的本地 LLM 部署已经不是"可以玩"的阶段了,它已经足够成熟到值得放进你的日常工具链。Ollama 把最复杂的部分全部封装好了——模型管理、GPU 加速、API 服务——整个过程和 Docker 一样直觉化。
如果你还没有试过在本地跑大模型,今天就是一个不错的开始。拉一个 4B 模型下来,十几分钟后你就能在不联网的情况下有一个能用的 AI 助手。这种"断网也能跑 AI"的安全感,试过就知道了。
© 2026 四月
原文链接:https://www.aprilzz.com/tutorials/ollama-local-llm-developer-guide
相关文章
用自托管 Umami 给 iOS App 加分析——轻量、隐私友好的方案
独立开发者如何用自托管的 Umami 分析服务给自己的 iOS App 加使用统计,避免使用 Google Analytics 等重量级 SDK。含完整集成代码。
用 Arch Linux 复活一台 15 年的上网本:从零开始的完整指南
手把手教你用 Arch Linux 32 位版复活一台 ASUS Eee PC 1000HE 上古上网本,把它变成一台可用的服务器或轻量工作站
在 13 年前的 Xeon 服务器上跑 Gemma 4 26B:一份实操指南
用不到 300 美元的老旧服务器跑谷歌 Gemma 4 26B 大模型,详细记录从硬件选型、编译修复到性能调优的全过程