
推理成为主角:2026 年 AI 硬件厂商在赌什么
训练退居幕后,推理成了数据中心里唯一的话题。H100 跑开源模型时有 50% 到 80% 的时间在空转,等待内存喂数据——这个瓶颈逼出了两条完全不同的技术路线。
原文来源:IEEE Spectrum — 2026 年 AI 硬件的主战场从训练转向推理,内存带宽成了唯一瓶颈,芯片厂商因此分成了几条互不相同的技术路线。
数据中心里没人再聊训练了
从 2020 年开始,AI 的故事一直是"把模型做大"。GPT-3 在 2020 年发布时,在一项知识推理基准上只答对 43.9% 的题;四年后 GPT-4o 在同一份考卷上拿到 88.7%,基本追平人类专家。参数量从百万级一路涨到万亿级。
但到了 2026 年,训练这件事退到了背景里。Moor Insights & Strategy 的首席数据中心分析师 Matt Kimball 说得很直白:"训练已经像昨天的新闻了,现在每个 CIO 想聊的都是推理。" 英伟达 CEO 黄仁勋在 GTC 2026 上把这次转变称为"推理的拐点"。
需求爆发的理由不复杂。第一,大模型开始真的能用了,用的人自然变多。第二,市面上的主流模型换成了推理模型——它回答一个问题不是跑一次推理,而是自己反问自己好几轮(也就是常说的思维链)。高推理强度的模型吐出的文本量,可以达到低强度或不带推理的模型的 20 倍。第三是 agent:推理不再只在用户提问时发生,而是全天候跑着,自己朝用户设定的目标推进。
一个工作负载从"一次问答"变成"24 小时不停自己问自己",对硬件的需求性质就完全变了。
—— 广告 ——
训练和推理,到底差在哪
一个没训练过的模型就像桌上散落的拼字游戏牌:每张牌上是词片段,也就是 token。写东西要用的零件都在,但什么都不是。训练的过程,是拿真实文本遮住下一个 token 让模型去猜,猜完公布答案、算出误差,再用反向传播反复调整几百亿到几万亿个参数。这个过程算力密集,所以科技巨头要盖越来越大的数据中心。
训练结束,参数冻结,模型部署上线,接下来才是推理。
这里有个容易搞错的地方:推理的计算量并不因为省掉了反向传播就变轻。d-Matrix 创始人兼 CTO Sudeep Bhoja 的解释是,模型是"自回归"的——下一个输出依赖上一个输出。"所以每生成一个 token,你都得把全部权重、以及上一个 token 带来的全部上下文读一遍。"上下文包括你的所有提示、模型的全部回复、你上传的所有文件。
推理分两个阶段。Prefill 是模型读提示,把所有 token 一次性并行处理,算出每个 token 与其他 token 的关系,这个操作叫 attention。它天然适合并行,这正是 GPU 成为 AI 主力加速器、取代其他方案的原因——图形光栅化也是大规模并行。attention 的中间产物是 key 和 value 两组向量,通常存进 KV cache;几乎所有大模型都用 KV cache 来省算力,但它的体积可以从很小一路涨到几十 GB。
Decode 就麻烦了。模型一次只生成一个 token:取最近一个 token,跟 KV cache 里所有内容比对,预测下一个 token,再把新 token 的 key 和 value 塞回缓存,如此循环。每预测一个 token,都要把整个模型从内存里读一遍,而模型本身可能是几十到几百 GB,叠加上 KV cache 就更夸张。结果是数据搬运需要的带宽经常超过硬件能提供的带宽,计算单元只能空等。
研究者的实测数据是:用英伟达 H100 跑开源模型时,GPU 有 50% 到 80% 的时间在空转。
路线一:把内存和算力拉近,或者把接口拉长
空转直接解释了为什么一堆公司死盯着内存。Majestic Labs 联合创始人、前 Meta 硅工程负责人 Shahriar Rabii 说得很干脆:"GPU 路线的问题是你把算力严重过量配置,却卡在内存上。这就是大规模扩内存的驱动力。"
同样是解决内存瓶颈,两家公司给出了相反的答案。
d-Matrix 的路线是缩短距离。目前主流做法是把高带宽内存(HBM)摆在 GPU 四周,每颗 HBM 是一摞 DRAM 芯片通过超高速接口连到 GPU。这对训练很合适,但推理要的内存容量和带宽都不够。d-Matrix 的第二代加速器 Raptor 反过来做:把逻辑芯片直接叠在 DRAM 上,让数据要走的距离从"毫米级"压缩到"微米级"。像盖楼一样,向上去要空间。
Majestic Labs 的路线是延长接口。Rabii 指出 HBM 的内存接口物理距离只有 2 到 3 毫米,而 GPU 四周那圈"海岸线"是唯一能放 HBM 的地方,容量因此被锁死。Majestic 声称自家的内存接口可以把比特送到大约一米之外,靠的是自研铜连接和一颗内存聚合芯片。结果就是,单个机架可以挂到 128 TB DRAM,而英伟达 GB300 NVL72 机架大约只有 20 TB 的 HBM3E。
两家选了同一个替代品:普通 DRAM,也就是手机、汽车里到处都在用的那种内存。内存分析师 Jim Handy 给出的价差是,HBM 比 DRAM 贵 2 到 3 倍。
HBM 阵营也没闲着。HBM4 已经量产,将用在预计 2026 年下半年出货的英伟达 Vera Rubin GPU 上。SK 海力士内存系统研究负责人 Hoshik Kim 称 HBM4 会让最大带宽翻倍、单堆容量提升。
路线二:一颗芯片干一半活
大厂的思路是"什么芯片都上"。英伟达和亚马逊的共识是:训练芯片在 prefill 阶段仍然很好用,但 decode 得靠新架构。
英伟达的解法来自 Groq。2025 年底,英伟达在一笔有争议的、价值 200 亿美元的交易中买下了 Groq 的关键人才与知识产权;三个月后的 GTC 2026 上,Groq 3 LPU 亮相。LPU 的路线是用片上 SRAM:它算力远不如标准 GPU,但拥有 500 MB 片上 SRAM 直接连到浮点运算单元。英伟达超大规模与高性能计算副总裁 Ian Buck 说:"好处是内存带宽——LPU 的内存带宽是 GPU 的 7 倍。" 分工是:attention 计算和上下文处理交给 Vera Rubin GPU 机架,矩阵乘法这类专家计算交给 LPU。
一个 Groq 3 LPX 系统塞进 256 颗 LPU,体积有一个机架那么大。
亚马逊则找了 Cerebras 合作,把 Trainium 和晶圆级引擎 WSE-3 配对。思路接近 Groq,但尺度完全不同:WSE-3 把整片硅晶圆做成一颗芯片,超过 4 万亿晶体管,不做外接内存,而是在每片晶圆里刻出 44 GB SRAM。"模型权重就存在 SRAM 里,"前 Cerebras 产品市场总监、现任 SpaceXAI 的 James Wang 说,"单颗芯片能支持 400 亿到 800 亿参数。" Cerebras 也可以独立承担 prefill:把多片 WSE-3 联网组成单一内存池,商业上已经做到 5000 亿参数。
OpenAI 用 WSE-3 撑起了 GPT-5.3-Codex-Spark 变体,输出速度超过每秒 1000 token;相比之下,标准的 GPT-5.4 部署速度是每秒 50 到 125 token。
Buck 的总结是:"要做现代 AI 推理,你需要所有芯片。"
路线三:少用几个比特
不是所有解法都在硬件上。研究人员同时在软硬件协同层面想办法——最典型的就是量化:把模型从 32 位或 64 位精度压到更低位宽。
Tensordyne 联合创始人 Gilles Backhus 把权衡说得很清楚:"你更愿意要一个规模为 x、跑 8 位的模型,还是一个规模翻倍、跑 4 位的模型?" 两者占用的内存和算力差不多,"但 4 位方案给你的突触数量翻了一倍,而大家正在意识到 4 位更值。"
英伟达为量化专门做了一套 4 位格式 NVFP4,AMD、Intel、高通则站到了另一套 4 位格式 MXFP4 那边(英伟达也参与了 MXFP4 的制定)。英伟达的说法是,把 DeepSeek-R1 从 FP8 量化到 NVFP4,七个主要基准的分数下降不到 1%,性能提升 3 倍。Buck 管这叫"AI 的黑魔法"。
再往前一步,是改数字表示方式本身。Tensordyne 的 Napier 用对数系统:因为 log(A×B) = log(A) + log(B),把数存成指数形式,芯片就能用加法替代乘法——乘法器在硅上更费电、更占面积。Tensordyne 称 Napier 能跑到每用户每秒 1300 token,功耗不到同类英伟达硬件的十分之一。
Etched 则更极端:把 Transformer 架构直接刻进硅,用通用性换效率。它的第一款加速器 Sohu 号称能以每秒 50 万 token 跑 Llama 70B,代价是换架构就没法跑。Sohu 首台机架 2026 年 8 月刚出货,Tensordyne 的首款硬件预计 2027 年上市。
谁赢谁输可能是个错问题
堆叠、拉长接口、整片晶圆做 SRAM、压到 4 位——路线多到让人本能地想问"哪条会赢"。
但受访者认为这不是对的问题。AI 需求目前仍然称得上无底洞,泡沫的担忧还没真正拖慢增长。Kimball 甚至认为推理会带来长期而强烈的硬件需求,因为看不到终点:"你可以在组织里塞进一百万个 agent,它们 24 小时上班,不会下午五点下班回家。"
如果这个判断成立,推理硬件的演进会更像 CPU 的历史:不是在单一维度上往前推,而是多条战线同时铺开。当晶体管微缩的红利吃完之后,芯片与系统架构上的各种创新才真正开始井喷。几十年后回看 AI 推理的创新史,大概率也是同样的密度。
© 2026 四月
原文链接:https://www.aprilzz.com/ai/inference-hardware-revolution-2026
相关文章
K2 Horizon:一口气开源 6 个模型,从 0.9B 到 375B 全尺寸覆盖,训练配方也全部公开
IFM 发布 K2 Horizon 开源模型家族:6 个尺寸从 0.9B 到 375B-A23B,小模型在同尺寸中刷新 SOTA,0.9B 在 AIME 2026 拿 48+ 分。Apache 2.0 开源,中间 checkpoint、训练数据配方、代码日志全部公开,还自带对 reward hacking 的审计。
英伟达 129 亿美元收购 Hugging Face:开源 AI 的心脏要换主人了
据 The Information 报道,英伟达已同意以 129 亿美元收购开源模型平台 Hugging Face。这是英伟达史上最大并购之一,也把开源 AI 生态的中立性问题摆上了台面。
小模型的时代来了:一次深度 AI 调研只要几毛钱,消费级 AI 产品第一次算得过账
Segment 联创实测 gpt-5.6-luna:速度快、便宜到夸张。当推理成本从 1 美元降到 0.1 美元,AI 消费级产品的经济模型第一次成立,'快、便宜、够用'的模型需求即将起飞。