教程·阅读约 3 分钟·
一台 GPU 能塞下多少个开发者?自托管 LLM 的实测数据与成本账

一台 GPU 能塞下多少个开发者?自托管 LLM 的实测数据与成本账

imec 团队用 64 个真实编程任务测试了 4 套自托管方案:DGX Spark 只够 1 个人用,单张 H200 能带 32 个并发会话,8 张 B200 才能跑近前沿模型但并发反而更少。买 GPU 到底划不划算?答案取决于你的利用率。

原文来源:aistack — How many devs can you fit on a GPU? Self-hosting explained — 比利时研究机构 imec 对自托管 LLM 推理栈做了 100 轮实测,用 64 个真实编码任务对比了买 GPU、租 GPU 和直接用 API 的成本与性能。

你的 token 账单是怎么爆炸的?上半年到处是预警信号:GitHub Copilot 改成按 token 计费、Uber 四个月烧光全年 AI 工具预算、有开发者报告月度成本从 29 美元跳到 750 美元。社区甚至造了新词:"tokenmaxxing"、"token panic"、"token budget"。

普通员工每年在 AI API 上花约 140 美元,听着无害;但看长尾:第 90 百分位逼近每年 7300 美元,第 99 百分位接近 9 万美元。而且大部分组织的 agentic AI 采用才刚起步。为什么账单波动这么大?因为 AI Agent 的用法:主流模型厂商超过 70% 的 ARR 来自编码场景——你把越多工作流交给 Agent,token 账单就越失控。

这时候很多人开始想:要不自己买 GPU 搭一套?比利时研究机构 imec 的 aistack 团队做了件实在事——用 64 个来自 SWEBench Pro 的真实编码任务,在几套典型硬件上跑了约 100 轮,把自托管、租 GPU、买 token 这三条路彻底比了一遍。结论很有价值,也有些反直觉。

四套参赛配置

团队按质量排名给每档硬件配了最合适的开源模型:

  • NVIDIA DGX Spark(桌面小主机):跑 Qwen3.6-35B-A3B。这机器价格比一次差旅费还便宜,128GB 统一内存,适合想试试水又不想走采购流程的团队。
  • 单张 H200:141GB 显存。能跑的模型和 Spark 差不多,但 token 池大得多。
  • HGX 4×H200:可以跑 DeepSeek-V4-Flash,速度、并发、质量比较均衡。
  • HGX 8×B200:参考级配置,能服务 GLM-5.2 这种最接近前沿模型的开源模型。

后来又补了一组:Kimi K3 跑在 8×B300 上(1.4TB 权重塞不进 B200 节点,B300 单卡 288GB、整节点 2.3TB),用 SGLang 服务。

—— 广告 ——

一个 GPU 能带多少并发?

看"任务完成时间"而不是裸 token 每秒——毕竟你可以烧几千 token 得不到任何结果,也可以换个更小的模型多花 10 倍 token。团队用"任务成功完成"作为价值单位。

各配置的舒适并发量:

配置舒适并发数
Qwen3.6(DGX Spark)就 1 个,还慢——比 Claude Code 慢约 3 倍
Qwen3.6(单 H200)32 个没问题,48 个时比 Claude Code 慢 2 倍
DeepSeek-V4-Flash(4×H200)32 个没问题,48 个时慢 2 倍
GLM-5.2(8×B200)8 个就到顶了——已经比 Claude Code 慢 3 倍

反直觉的地方在这:越强的模型,能带的并发越少。GLM-5.2 跑在全场最贵硬件上,token 池反而最小——16 个并发会话基本就把 GPU 榨干了,总吞吐只有约 175 token/s。更强模型 = 更小 token 池,硬件贵也补不回来。

有个更吓人的现象:Qwen3.6 和 DeepSeek-V4-Flash 的吞吐曲线在并发 48-64 时不是趋于饱和,而是直接崩塌。原因是 vLLM 的默认参数在 prefill 和 decode 之间分配资源的方式,以及有效 KV 缓存大小。GLM-5.2 的并发上限则可能和 speculative decoding(投机解码)有关——低并发时加速 token 生成,高并发时反而拖累。

成本:买、租还是用 API?

这才是大多数读者最关心的。团队用"跑完 64 个任务要多少钱"来算(买/租按 5 年折旧,不含电费和维护):

系统API 成本购买成本购买(30% 利用率)租用成本
Qwen3.6(1×H200,28 分钟)$57.67*$0.43$1.43$1.62
DeepSeek-V4-Flash(4×H200,31 分钟)$2.13$1.90$6.33$7.19
GLM-5.2(8×B200,101 分钟)$92$13.84$46.12$71.23
Anthropic API(Opus 4.8)$98

*Qwen 是阿里云标价(无缓存)。

几个扎心的数字:

  • 4×H200 必须保持 89% 的占用率(5 年 24/7 不间断),买下来才比 DeepSeek 自家 API 的 $2.13 便宜。对绝大多数团队来说,这是不可能的。
  • 8×B200 只要 15% 利用率就能打过前沿 API,租用成本下每个任务只要 $1.11,比任何 API 都便宜。
  • 租 GPU 是不是省钱,完全看模型:Qwen 租卡比 API 便宜 35 倍,GLM-5.2 便宜 23%,但 DeepSeek 反过来——不做优化的话,租卡比自己调 API 贵得多。

原因在于:编码 Agent 的输入 token 高达 98% 被缓存命中,DeepSeek 的 API 定价在这种场景下便宜得离谱,连更小的 Qwen3.6 都被它按在地上摩擦。

所以结论是:不存在统一赢家。按真实利用率算,买硬件只有在机器保持繁忙时才划算——4×H200 要 89% 占用,B200 机架只要 15%。低于这个阈值,租卡或便宜的开放权重 API 往往更优。买 GPU 的理由应该是账单算不出来的东西:数据控制权、隐私、低延迟——而不是省钱本身。

质量:开放权重追上前沿了吗?

以 Claude Code 为 harness,64 个 SWEBench Pro 任务的解决率:

模型解决率
Kimi K386.4%
GLM-5.262.5%
Anthropic Opus 4.8(API)62.5%
DeepSeek-V4-Flash39.1%
Qwen3.635.4%

Kimi K3 的 86.4% 比 GLM-5.2 和 Opus 4.8 高出 24 个百分点——不过团队提醒,SWEBench Pro 的任务可能进了 K3 的训练数据,这个数字要打点折扣。质量上开放权重和闭源模型的差距确实在快速收窄,GLM-5.2、Kimi K3 这类新模型已经相当能打,但你要为此准备 8×B200 起步的硬件。

给你的决策清单

  1. DGX Spark 真的只适合单人。一个开发者、一个小模型、中等 token 池,做个好用的个人工作台没问题,想要规模别指望它。
  2. 单张 H200 带 Qwen3.6 能轻松扛 32 个并发会话,4×H200 带 DeepSeek-V4-Flash 同并发质量更高;但 8 张 B200 上跑 GLM-5.2,8 个开发者就能让任务执行开始爬行。
  3. 租卡省不省钱取决于模型:实测最高便宜 35 倍,也可能比 API 更贵。选型对了是省钱利器,错了是冤枉钱。
  4. 利用率不到阈值别自托管。能让租来的 B200 机架保持 15% 忙碌,你已经在用接近前沿的质量打败前沿 API 的价格了;达不到,闲置的 GPU 机架比你的 API 账单更贵。

最后,自己动手量一量。拿你自己的真实工作负载测峰值、测利用率,几个月后再看一次——你的组织还在向 Agent 化演进,今天算下来该用 API 的,半年后可能就是另一番光景。

分享到
微博Twitter

© 2026 四月

原文链接:https://www.aprilzz.com/tutorials/gpu-self-hosting-devs-per-gpu