教程·阅读约 3 分钟·
2026 本地 LLM 完全入手指南:用 Ollama 在个人电脑上跑大模型

2026 本地 LLM 完全入手指南:用 Ollama 在个人电脑上跑大模型

从零开始的 Ollama 折腾教程:安装、模型管理、Python API 集成、Docker 部署,以及怎么把本地模型接入开发工作流

原文来源:SitePoint - How to Run Local LLMs in 2026 — 面向开发者的本地 LLM 部署完整指南,覆盖 Ollama 安装配置到生产级集成

在云端跑 AI 很方便,但私密性差、有延迟、还得看 API 配额脸色。如果你的数据不想出本地,或者你只是不想每个月交 GPT 订阅费,在本地跑大模型是一个越来越可行的选择。

2026 年的本地 LLM 工具链已经相当成熟。Ollama 是目前最简单、最流行的方案——一条命令装模型,一条命令跑推理,还内置了 OpenAI 兼容的 API。

准备工作

需要的硬件:

  • macOS 13+ 或 Linux(Ubuntu 20.04+ 测试通过)
  • Windows 用户需要从 ollama.com/download 下载安装器
  • 8GB 以上内存(推荐 16GB)
  • 基本的命令行经验

软件要求:

  • Python 3.8+
  • curl
  • 约 10GB 磁盘空间(用于模型文件)

—— 广告 ——

安装 Ollama

code
# macOS 和 Linux
curl -fsSL https://ollama.com/install.sh | sh
 
# 验证安装
ollama --version

安全提示:如果你对管道安装脚本不放心,可以先用 curl -fsSL https://ollama.com/install.sh -o install.sh && less install.sh 查看脚本内容,确认没问题再执行。

Windows 直接去官网下安装包,装完自动加到系统 PATH。

拉取并运行你的第一个模型

Ollama 的工作流和 Docker 非常像——需要先 pull,再 run。

code
# 2026 年推荐的入门模型
ollama pull gemma3:4b-q5_K_M
 
# 直接交互式聊天
ollama run gemma3:4b-q5_K_M

启动后会进入一个交互式聊天界面,直接打字就行。退出用 /bye

选模型的思路

ollama.com/library 可以看到所有可用模型。2026 年比较热门的本地模型选择:

  • Qwen 3 8B(阿里):多语言能力强、推理质量好,适合日常使用
  • Gemma 3 4B(Google):轻量级,在 4B 参数级别上表现惊艳,适合 8GB 内存的笔记本
  • Llama 4 Scout 8B(Meta):通用能力强,工具调用表现好
  • DeepSeek R1 7B:推理和代码能力突出

量化标签说明:

  • q4_K_M:4-bit 量化,质量/体积最佳平衡,最推荐
  • q5_K_M:质量略高,但体积大约多 20%
  • q8_0:接近无损,适合内存充裕的场景

注意:Ollama 仓库的模型标签可能会更新。如果某个标签下载失败了,去 ollama.com/library 查一下最新的标签名。

从代码中调用 Ollama

Ollama 会在本地自动启动一个 HTTP 服务(端口 11434),并且提供了 OpenAI 兼容的 API。这意味着你现有的 OpenAI SDK 代码,把 base_url 改一下就能直接用。

用 OpenAI SDK 调用

code
from openai import OpenAI
 
client = OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="not-needed"  # Ollama 不验证 key,但字段必须填
)
 
response = client.chat.completions.create(
    model="gemma3:4b-q5_K_M",
    messages=[
        {"role": "user", "content": "用中文解释一下什么是 RAG"}
    ],
    temperature=0.7,
    max_tokens=500
)
 
print(response.choices[0].message.content)

用 Ollama 原生 Python 库

code
pip install ollama
code
import ollama
 
response = ollama.chat(
    model="gemma3:4b-q5_K_M",
    messages=[
        {"role": "user", "content": "帮我写一个 Python 斐波那契数列函数"}
    ]
)
print(response["message"]["content"])

流式输出的场景

code
from openai import OpenAI
 
client = OpenAI(base_url="http://localhost:11434/v1", api_key="not-needed")
stream = client.chat.completions.create(
    model="gemma3:4b-q5_K_M",
    messages=[{"role": "user", "content": "Write a haiku about AI"}],
    stream=True
)
 
for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

进阶:用 Docker 部署 Ollama

code
version: "3.8"
services:
  ollama:
    image: ollama/ollama:latest
    container_name: ollama
    ports:
      - "11434:11434"
    volumes:
      - ollama_data:/root/.ollama
    restart: unless-stopped
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
 
  open-webui:
    image: ghcr.io/open-webui/open-webui:main
    container_name: open-webui
    ports:
      - "3000:8080"
    volumes:
      - open-webui_data:/app/backend/data
    depends_on:
      - ollama
    restart: unless-stopped
 
volumes:
  ollama_data:
  open-webui_data:

运行:docker compose up -d

这会在本地启动一个 ChatGPT 风格的 Web 界面(Open WebUI),支持多模型切换、对话历史、文件上传和用户管理。团队内部搭建 AI 服务的话,这是最省事的方案。

与开发工具集成

VS Code + Continue

code
{
  "models": [
    {
      "title": "Ollama Local",
      "provider": "ollama",
      "model": "gemma3:4b-q5_K_M",
      "apiBase": "http://localhost:11434"
    }
  ],
  "tabAutocompleteModel": {
    "title": "Qwen 3 8B",
    "provider": "ollama",
    "model": "qwen3:8b"
  }
}

Cursor / Windsurf

这两个 IDE 都支持自定义 API 端点,填入 http://localhost:11434/v1 就能把本地模型当做 AI 助手使用。

常见问题

Ollama 服务无法访问

code
# 检查进程是否运行
ps aux | grep ollama
 
# 手动启动服务
ollama serve
 
# macOS 上 ollama 会自动管理后台进程,不需要手动启动

模型下载一半断开了

重新执行 ollama pull 会从断点续传,不需要重新下载。

推理太慢

  • 换小模型(从 8B 降到 4B)
  • 用更高量化(从 q4 降到 q3)
  • 确认 GPU 加速是否生效(Mac 的 Metal、Linux 的 CUDA)
code
# Mac 上确认 Metal 加速
ollama run gemma3:4b-q5_K_M --verbose
# 输出中会显示 "gpu" 字段

内存不足

code
# 查看已缓存的模型
ollama list
 
# 卸载不需要的模型释放磁盘空间
ollama rm 模型名
 
# 用模型时限制并发数
ollama run --num-gpu 1 模型名

从本地到生产

完成本地部署后,下一步可以尝试:

  • 构建 RAG 管道:用 ChromaDB 做向量存储,让本地模型能回答你的私有文档
  • 做结构化输出:用 Pydantic 定义输出 Schema,让本地 LLM 输出的 JSON 格式正确
  • 做模型微调:用 Unsloth 或 Axolotl 在本地数据集上微调模型
  • 部署成团队服务:把 Ollama 放到反向代理后面,加上 TLS 和基本认证

小结

2026 年的本地 LLM 部署已经不是"可以玩"的阶段了,它已经足够成熟到值得放进你的日常工具链。Ollama 把最复杂的部分全部封装好了——模型管理、GPU 加速、API 服务——整个过程和 Docker 一样直觉化。

如果你还没有试过在本地跑大模型,今天就是一个不错的开始。拉一个 4B 模型下来,十几分钟后你就能在不联网的情况下有一个能用的 AI 助手。这种"断网也能跑 AI"的安全感,试过就知道了。

分享到
微博Twitter

© 2026 四月

原文链接:https://www.aprilzz.com/tutorials/ollama-local-llm-developer-guide