AI 前沿·阅读约 2 分钟·
AMD 收购 Taalas:把模型权重蚀刻进硅片,推理速度是 GPU 的 48 倍

AMD 收购 Taalas:把模型权重蚀刻进硅片,推理速度是 GPU 的 48 倍

AMD 收购了把模型权重直接蚀刻进晶体管的初创公司 Taalas。它的测试芯片跑 Llama 3.1 8B 达到每秒 16960 token,比 Nvidia GPU 快 48 倍。代价是一旦部署就被锁死在某一个模型上。

原文来源:The Register — AMD acquires AI chip startup Taalas to boost inference performance by etching models into silicon — AMD 收购了把模型权重蚀刻进硅片的芯片公司 Taalas,推理性能有望提升一个数量级以上。

AMD 一直在找机会撼动 Nvidia 在 AI 硬件上的统治地位,这次它直接买了一家公司。8 月 6 日收盘后,AMD 宣布收购 AI 芯片初创公司 Taalas——一家把模型权重直接"烧"进硅片里的公司。

这个收购的逻辑,和去年 12 月 Nvidia 花 200 亿美元跟 Groq 签授权协议如出一辙:让面向 AI Agent 的"高端推理服务"(比如代码助手)跑得更快、更便宜。AMD 没有披露交易金额,但据 The Register 了解,这是一次真正的收购,不是"收购式招聘"。

模型专用集成电路(MSIC)

Taalas 成立于 2023 年,总部在多伦多。它的推理思路和传统 GPU 完全不同,甚至和 Groq LPU、Cerebras 晶圆级加速器那套 dataflow 架构也不是一路人。

这家公司的芯片不靠 HBM 存模型权重,而是直接把权重蚀刻进硅片。从某种意义上说,Taalas 的芯片是"模型专用集成电路"(Model-Specific Integrated Circuit,MSIC)——为某个特定模型量身定制的硅片。

关键的是,这不是 PPT 上的概念。今年 2 月,Taalas 公布了第一颗测试芯片 HC1,用台积电 6nm 工艺流片。初期基准测试里,这颗芯片跑 Meta 的 Llama 3.1 8B 达到了惊人的每秒 16960 token——2026 年 2 月公布时,这比 Nvidia 的 GPU 快 48 倍,比 Cerebras 的加速器快 8.5 倍。

当然,Llama 3.1 放在今天已经是"上古模型"了(2024 年中期发布),那颗晶圆级芯片主要目的是证明概念可行。

Taalas 对自家芯片的工作方式讳莫如深,但已知的是它的处理器由两大区域组成:

  • mask-ROM 回忆阵列(mask-ROM recall fabric):模型权重蚀刻在这里
  • SRAM 回忆阵列(SRAM recall fabric):存放 KV 缓存和微调适配器(LoRA)

第二代芯片 HC2 计划今年夏天推出,目标是把单颗芯片的参数容量提到 200 亿。单看数字不大,但和 GPU 跑大模型的思路一样:权重可以靠流水线并行分布到多颗加速器上。如果每颗芯片承载 200 亿参数,支撑一个万亿参数模型只需要 50 颗加速器——而 AMD 恰好有机架级计算平台和自研系统设计团队来容纳这套东西。

相比之下,Nvidia 最近发布的 LPX 系统要服务同样的模型,需要几十颗 GPU 外加至少 2000 颗 Groq LPU。Taalas 的方案在空间和功耗上都省得多。

—— 广告 ——

AMD 打算怎么用

据 The Register 了解,AMD 计划把自家 Instinct 驱动的 Helios 机架和 Taalas 技术的芯片配对,这暗示了一种解耦架构:计算密集的 prompt 预处理(prefill)交给 GPU,token 生成(decode)则卸载到 Taalas 加速器上。

另一种可能是 AMD 采用类似"tick-tock"的节奏:客户先在 Instinct 加速器上部署和验证模型,满意后再迁移到 Taalas 加速器。AMD AI 部门 SVP Vamsi Boppana 的官方说法是:"AMD 正在构建一个全栈 AI 平台,让客户能够灵活地为每个 AI 工作负载部署合适的计算方案。"

代价:你得真爱那个模型

技术确实快到离谱,但有个相当大的副作用:芯片一旦部署,就被锁死在那一个模型上。任何比 LoRA 适配器更大的改动,都得重新流片——又贵又耗时。

AI 热潮快四年了,新模型几乎按月发布。想从 Taalas 技术中受益,AMD 的客户必须对自己的模型选择非常笃定。对某些客户容易,对另一些就难了。

不过按这家初创公司的说法,情况没听起来那么糟:换新模型确实要重新流片,但不需要从头再来,只需要改两层金属层,成本和周期都小得多。

The Register 的猜测是,这项技术大概率会被模型开发商、基础设施提供商和少数推理服务商采用。今年 2 月 Taalas 接受 The Next Platform 采访时表示,把模型权重蚀刻进硅片的成本,比训练一个前沿模型便宜 100 倍。

AMD 在谈这类交易上是有筹码的——OpenAI、Anthropic 和 Meta 都是 Instinct 的重要客户。模型厂商和芯片设计商关系这么近,哪天看到 GPT 或 Claude 跑在 Taalas + Instinct 的组合上,一点不奇怪。

对模型开发的影响:更长的思考时间

这项技术对模型开发方式也有潜在影响。开发者降低幻觉的一个办法是用"时间换准确率"——测试时扩展(test-time scaling),说白了就是让模型在回答前多"想"一会儿。

它的缺点很明显:消耗更多 token,更贵,用户等得更久。如果 AMD 的 Taalas 收购能把每 token 成本打下来、输出速度提升 10 倍 20 倍,模型开发者可能就更愿意延长推理时间——成本不再是拦路虎。

这笔交易预计在获得监管批准后于第四季度完成。不用等太久,就能看到 Taalas 在 AMD 版图里到底扮演什么角色了。

分享到
微博Twitter

© 2026 四月

原文链接:https://www.aprilzz.com/ai/amd-taalas-silicon-inference