教程·阅读约 2 分钟·
2 千美元到 4 万美元:本地跑 SOTA 大模型的完整硬件指南

2 千美元到 4 万美元:本地跑 SOTA 大模型的完整硬件指南

jamesob 公开了他本地运行顶级大模型的全部经验:2 千美元预算用双 RTX 3090 跑 Qwen3.6-27B,4 万美元上 4×RTX 6000 Pro 跑 GLM-5.2-594B。包含完整的配置命令:BIOS 分叉、ACS 关闭、功率限制、vLLM 部署。

原文来源:GitHub — jamesob/local-llm — 一份从 2 千美元到 4 万美元预算、在本地运行 SOTA 大模型的完整实战指南:硬件清单、BIOS 配置、内核参数、vLLM 部署全流程。

如果不想把代码和数据交给 Anthropic 或 OpenAI,又想用上接近 Opus 级别的模型,怎么办?答案是自己买硬件。但"自己跑大模型"到底要花多少钱、买什么、怎么配?jamesob 的这份 local-llm 指南是目前网上最完整的实战答案——从 2000 美元到 40000 美元两档预算,到每一行需要执行的配置命令,全部公开。它在 Hacker News 上获得了 400+ 点赞。

两档预算,两种人生

约 2000 美元档:双 RTX 3090

两张二手 RTX 3090 共 48GB 显存,可以运行 Qwen3.6-27B——一个非常出色的模型。同时还能跑 SOTA 级别的语音转文字(STT):cohere-transcribe(作者之前用 whisper-large-v3),只需约 11GB 显存,还附带了可直接运行的配置。

作者特别强调本地 STT 的实用价值:完全离线、隐私安全,用起来比云端版本放心得多。

约 40000 美元档:4×RTX 6000 Pro

四张 RTX 6000 Pro 共 384GB 显存,模型智能水平上一个台阶——"相当接近 Claude Opus"。作者实测的最佳模型是 GLM-5.2-Int8Mix-NVFP4-REAP-594B,vLLM 部署后约 80 tokens/s @ 460k 上下文,用上了 DCP4+MTP5 技术。

—— 广告 ——

硬件清单:钱都花在显存上

作者的整机方案非常反直觉:用上一代 EPYC 平台 + eBay 二手件,把钱全部砸在显存上

组件规格价格
主板ASRock Rack ROMED8-2T(SP3,7× PCIe 4.0 x16,双 10GbE)$715
CPUAMD EPYC Milan 7313P(16 核 3.0GHz)$504
内存8×16GB DDR4 ECC RDIMM(128GB,eBay)$642
PCIe 交换机c-payne Switchtec PM40100 Gen4~$1,330
电源2× Super Flower 1700W$750
合计(不含 GPU)~$5,600

为什么用上一代平台?因为 2026 年 7 月的内存价格已经涨疯了,PCIe5/DDR5 平台成本极高。用 Gen4 老平台省下约 1 万美元,而性能瓶颈在显存而非主机——"溢出到系统内存会让 Agent 工作负载慢到没法用"。

最容易踩的坑:四个关键配置

1. 内核参数:iommu=off

多 GPU 张量并行跑 NCCL 时,不关 IOMMU 会直接挂起。需要在 GRUB 配置里加上 iommu=off,然后 sudo update-initramfs -u

2. ACS 关闭:PCIe 交换机的命门

启用 ACS(默认开启)时,P2P 流量会被弹回 CPU 根端口,交换机完全失效。pcie_acs_override 需要打补丁内核,所以作者用 setpci 在运行时关闭:

code
for BDF in $(lspci -d "*:*:*" | awk '{print $1}'); do
  setpci -v -s ${BDF} ECAP_ACS+0x6.w > /dev/null 2>&1
  if [ $? -ne 0 ]; then continue; fi
  setpci -v -s ${BDF} ECAP_ACS+0x6.w=0000
done

用 systemd oneshot 服务每次开机执行。验证方法:nvidia-smi topo -m 显示四卡之间都是 PIX(而非 PHB/NODE)即为成功。

3. GPU 功率限制:110V 电路跑 46K 美元硬件

作者(可能不太明智地)在普通 110V 电路上跑这套设备,解决办法是限功率:nvidia-smi -pl 350(默认 600W)。四卡 350W = 1400W 负载,正好在电源预算内。

4. PCIe 交换机:让 GPU 直连

作者用的 c-payne PCIe Gen4 交换机让四张卡以线速 P2P 通信,张量并行 allreduce 阶段不需要绕道 CPU 根端口。实测结果:27.5 GB/s 单向 / 50.4 GB/s 双向,0.37–0.45 µs 延迟,达到 Gen4 线速。

部署:vLLM docker-compose 开箱即用

仓库里带好了可直接运行的 serving 配置(runners/ 目录):

code
# GLM-5.2-594B 的 vLLM docker-compose 配置(含 DCP4+MTP5 优化)
# 约 80 t/s @ 460k 上下文
cd runners/GLM-5.2-594B
docker compose up -d
 
# 语音转文字(cohere-transcribe,11GB 显存即可)
cd runners/stt
docker compose up -d

还有工具脚本 tools/measure-gpu-speed.sh 可以测量 P2P 带宽和延迟。

值得记住的三条经验

第一,显存就是一切。 "我花钱买的是显存(该花的地方),而不是 PCIe5/DDR5 基础系统(贵得要死的地方)。" 溢出到系统内存的 LLM 推理,对 Agent 工作负载来说慢得没法用——这就是为什么显存容量比主机平台新不新更重要。

第二,二手市场 + 上一代平台是省钱正道。 作者明确说这套方案省下的 1 万美元主机成本,性能几乎无损。内存暴涨的时代,DDR4 ECC 二手条子远比 DDR5 新内存划算。

第三,认真对待每一个"玄学问题"。 IOMMU 挂起、ACS 反弹、链路降速——这些坑都有明确的技术成因和验证方法,指南里全部给出了排查思路(比如 lspci -vvv | grep ACSCtl 检查 ACS 是否全关、空闲时链路显示 2.5GT/s 是 ASPM 的正常现象)。

这份指南的价值在于:它把"本地跑 SOTA"从玄学变成了清单。每个预算档位、每块硬件、每条命令都写清楚了。对想摆脱 API 依赖、把数据留在本地的开发者来说,这是目前最完整的路线图。

分享到
微博Twitter

© 2026 四月

原文链接:https://www.aprilzz.com/tutorials/local-sota-llm-hardware-guide