
一台 GPU 能塞下多少个开发者?自托管 LLM 的实测数据与成本账
imec 团队用 64 个真实编程任务测试了 4 套自托管方案:DGX Spark 只够 1 个人用,单张 H200 能带 32 个并发会话,8 张 B200 才能跑近前沿模型但并发反而更少。买 GPU 到底划不划算?答案取决于你的利用率。
原文来源:aistack — How many devs can you fit on a GPU? Self-hosting explained — 比利时研究机构 imec 对自托管 LLM 推理栈做了 100 轮实测,用 64 个真实编码任务对比了买 GPU、租 GPU 和直接用 API 的成本与性能。
你的 token 账单是怎么爆炸的?上半年到处是预警信号:GitHub Copilot 改成按 token 计费、Uber 四个月烧光全年 AI 工具预算、有开发者报告月度成本从 29 美元跳到 750 美元。社区甚至造了新词:"tokenmaxxing"、"token panic"、"token budget"。
普通员工每年在 AI API 上花约 140 美元,听着无害;但看长尾:第 90 百分位逼近每年 7300 美元,第 99 百分位接近 9 万美元。而且大部分组织的 agentic AI 采用才刚起步。为什么账单波动这么大?因为 AI Agent 的用法:主流模型厂商超过 70% 的 ARR 来自编码场景——你把越多工作流交给 Agent,token 账单就越失控。
这时候很多人开始想:要不自己买 GPU 搭一套?比利时研究机构 imec 的 aistack 团队做了件实在事——用 64 个来自 SWEBench Pro 的真实编码任务,在几套典型硬件上跑了约 100 轮,把自托管、租 GPU、买 token 这三条路彻底比了一遍。结论很有价值,也有些反直觉。
四套参赛配置
团队按质量排名给每档硬件配了最合适的开源模型:
- NVIDIA DGX Spark(桌面小主机):跑 Qwen3.6-35B-A3B。这机器价格比一次差旅费还便宜,128GB 统一内存,适合想试试水又不想走采购流程的团队。
- 单张 H200:141GB 显存。能跑的模型和 Spark 差不多,但 token 池大得多。
- HGX 4×H200:可以跑 DeepSeek-V4-Flash,速度、并发、质量比较均衡。
- HGX 8×B200:参考级配置,能服务 GLM-5.2 这种最接近前沿模型的开源模型。
后来又补了一组:Kimi K3 跑在 8×B300 上(1.4TB 权重塞不进 B200 节点,B300 单卡 288GB、整节点 2.3TB),用 SGLang 服务。
—— 广告 ——
一个 GPU 能带多少并发?
看"任务完成时间"而不是裸 token 每秒——毕竟你可以烧几千 token 得不到任何结果,也可以换个更小的模型多花 10 倍 token。团队用"任务成功完成"作为价值单位。
各配置的舒适并发量:
| 配置 | 舒适并发数 |
|---|---|
| Qwen3.6(DGX Spark) | 就 1 个,还慢——比 Claude Code 慢约 3 倍 |
| Qwen3.6(单 H200) | 32 个没问题,48 个时比 Claude Code 慢 2 倍 |
| DeepSeek-V4-Flash(4×H200) | 32 个没问题,48 个时慢 2 倍 |
| GLM-5.2(8×B200) | 8 个就到顶了——已经比 Claude Code 慢 3 倍 |
反直觉的地方在这:越强的模型,能带的并发越少。GLM-5.2 跑在全场最贵硬件上,token 池反而最小——16 个并发会话基本就把 GPU 榨干了,总吞吐只有约 175 token/s。更强模型 = 更小 token 池,硬件贵也补不回来。
有个更吓人的现象:Qwen3.6 和 DeepSeek-V4-Flash 的吞吐曲线在并发 48-64 时不是趋于饱和,而是直接崩塌。原因是 vLLM 的默认参数在 prefill 和 decode 之间分配资源的方式,以及有效 KV 缓存大小。GLM-5.2 的并发上限则可能和 speculative decoding(投机解码)有关——低并发时加速 token 生成,高并发时反而拖累。
成本:买、租还是用 API?
这才是大多数读者最关心的。团队用"跑完 64 个任务要多少钱"来算(买/租按 5 年折旧,不含电费和维护):
| 系统 | API 成本 | 购买成本 | 购买(30% 利用率) | 租用成本 |
|---|---|---|---|---|
| Qwen3.6(1×H200,28 分钟) | $57.67* | $0.43 | $1.43 | $1.62 |
| DeepSeek-V4-Flash(4×H200,31 分钟) | $2.13 | $1.90 | $6.33 | $7.19 |
| GLM-5.2(8×B200,101 分钟) | $92 | $13.84 | $46.12 | $71.23 |
| Anthropic API(Opus 4.8) | $98 | — | — | — |
*Qwen 是阿里云标价(无缓存)。
几个扎心的数字:
- 4×H200 必须保持 89% 的占用率(5 年 24/7 不间断),买下来才比 DeepSeek 自家 API 的 $2.13 便宜。对绝大多数团队来说,这是不可能的。
- 8×B200 只要 15% 利用率就能打过前沿 API,租用成本下每个任务只要 $1.11,比任何 API 都便宜。
- 租 GPU 是不是省钱,完全看模型:Qwen 租卡比 API 便宜 35 倍,GLM-5.2 便宜 23%,但 DeepSeek 反过来——不做优化的话,租卡比自己调 API 贵得多。
原因在于:编码 Agent 的输入 token 高达 98% 被缓存命中,DeepSeek 的 API 定价在这种场景下便宜得离谱,连更小的 Qwen3.6 都被它按在地上摩擦。
所以结论是:不存在统一赢家。按真实利用率算,买硬件只有在机器保持繁忙时才划算——4×H200 要 89% 占用,B200 机架只要 15%。低于这个阈值,租卡或便宜的开放权重 API 往往更优。买 GPU 的理由应该是账单算不出来的东西:数据控制权、隐私、低延迟——而不是省钱本身。
质量:开放权重追上前沿了吗?
以 Claude Code 为 harness,64 个 SWEBench Pro 任务的解决率:
| 模型 | 解决率 |
|---|---|
| Kimi K3 | 86.4% |
| GLM-5.2 | 62.5% |
| Anthropic Opus 4.8(API) | 62.5% |
| DeepSeek-V4-Flash | 39.1% |
| Qwen3.6 | 35.4% |
Kimi K3 的 86.4% 比 GLM-5.2 和 Opus 4.8 高出 24 个百分点——不过团队提醒,SWEBench Pro 的任务可能进了 K3 的训练数据,这个数字要打点折扣。质量上开放权重和闭源模型的差距确实在快速收窄,GLM-5.2、Kimi K3 这类新模型已经相当能打,但你要为此准备 8×B200 起步的硬件。
给你的决策清单
- DGX Spark 真的只适合单人。一个开发者、一个小模型、中等 token 池,做个好用的个人工作台没问题,想要规模别指望它。
- 单张 H200 带 Qwen3.6 能轻松扛 32 个并发会话,4×H200 带 DeepSeek-V4-Flash 同并发质量更高;但 8 张 B200 上跑 GLM-5.2,8 个开发者就能让任务执行开始爬行。
- 租卡省不省钱取决于模型:实测最高便宜 35 倍,也可能比 API 更贵。选型对了是省钱利器,错了是冤枉钱。
- 利用率不到阈值别自托管。能让租来的 B200 机架保持 15% 忙碌,你已经在用接近前沿的质量打败前沿 API 的价格了;达不到,闲置的 GPU 机架比你的 API 账单更贵。
最后,自己动手量一量。拿你自己的真实工作负载测峰值、测利用率,几个月后再看一次——你的组织还在向 Agent 化演进,今天算下来该用 API 的,半年后可能就是另一番光景。
© 2026 四月
原文链接:https://www.aprilzz.com/tutorials/gpu-self-hosting-devs-per-gpu
相关文章
单张 AMD MI300X 跑 DeepSeek V4 Flash:一份可直接抄的生产部署方案
304B 参数模型、无需量化、168.6 tok/s 单流解码:一个开源仓库把 DeepSeek V4 Flash 在单张 MI300X 上的生产级部署配置全部开源,含镜像锁定、补丁和调优表
vLLM 生产部署完整指南:从 Docker 到 K8s 的每一步
把 vLLM 从演示级推到生产级:镜像版本锁定、GPU 内存调优、前缀缓存、KEDA 自动扩缩、监控告警,一套可以直接抄的完整配置
Self-Hosting 入门指南:2026 年为什么你应该自托管(以及如何开始)
从 Nextcloud 到 n8n,从 Vaultwarden 到 Uptime Kuma——自托管替代 SaaS 的完整路线图:为什么值得做、需要多少钱、如何一步步开始