AMD 收购 Taalas:推理芯片开始把模型权重刻进硅片

CN
56 分鐘前
代价是这颗芯片只能跑一个模型,收益是速度和能效的数量级跃升。

撰文:小饼

8月 6 日,AMD 宣布收购多伦多芯片公司 Taalas,交易价格未披露。这家成立于 2023 年、累计融资 2.19 亿美元的初创公司,做了一件听起来有点疯狂的事:把 AI 模型的权重直接烧进芯片的金属层,造出只能跑一个模型的专用芯片。

GPU 的工作方式是把模型参数存在高带宽显存(HBM)里,推理时反复搬运数据进出计算单元。这个"搬运"过程消耗了大量能耗和时间,被业界称为"内存墙"。Taalas 的做法是彻底取消搬运,把权重固化在芯片的晶体管里,存储和计算合为一体。

代价是这颗芯片只能跑一个模型,收益是速度和能效的数量级跃升。

17000 token/秒意味着什么?

Taalas 的技术验证芯片 HC1 基于台积电 6nm 工艺,815 平方毫米芯面,530 亿晶体管,它内置的模型是 Meta的 Llama 3.1 8B。

HC1 的跑分数据:单用户约 17000 token/秒。作为对比,Nvidia H200 在同一模型上约 230 token/秒,H100约 150 token/秒。73 倍的速度差距,功耗只有后者的十分之一。

更直观的经济账:Taalas 自报的推理成本约为每百万 Token 0.75 美分(Llama 8B),GPU 方案在 20到 49 美分之间。每张 HC1 卡功耗 250W,一个标准风冷机架装 10 张卡只需要 12-15 KW,不需要液冷,而 GPU 机架动辄 120-600 KW。

Forbes 分析师 Karl Freund 在2 月评测时的评价是:“比最快的推理平台(Cerebras 晶圆级引擎)还快 10 倍,比 GPU 快两个数量级。”

但有几个重要的限定条件。HC1 使用的是 Taalas 自研的 3-bit 数据格式配合 6-bit 参数,量化非常激烈,在复杂推理任务上的质量损失是确定性存在的。17000 token/秒的数据来自 1K 输入/1K 输出的厂商基准测试,不代表生产环境的真实表现。而且 Llama 3.1 8B 是2024 年中发布的模型,8B 参数量的量化版本甚至能在树莓派 5 上跑。HC1 展示的是架构的潜力,而非成熟产品的竞争力。

模型换代怎么办?

把模型烧进芯片,最直觉的问题是:模型迭代了怎么办?芯片就废了?

Taalas 的回答是:不会废。传统 ASIC 设计周期要两年以上。Taalas 开发了一套自动化设计流程,只需要修改芯片顶层的少量金属掩膜,就可以把新模型编译成新芯片,周期约 8 周。公司在成本模型中预设了 4 年生命周期内 3 次芯片更新的费用。

这个回答能解决一部分焦虑,但不能完全消除。

GPU 的灵活性在于同一块卡今天跑 Llama,明天跑 Claude,后天跑一个还没发布的新模型。Taalas 的芯片做不到这一点。如果一个客户同时需要多个模型服务(这在生产环境中极为常见),就需要为每个模型配备不同的芯片,库存管理和运维复杂度会上升。

HC2 已经在开发中,目标是约 200 亿参数量级的模型,采用 4-bit 浮点提升精度。Taalas 原计划 2026 年底前实现前沿级模型的支持。

AMD 的收购让这条路径有了 Instinct GPU 产品线和 Helios 机架系统的协同,客户可以用 GPU 处理灵活多变的工作负载,用 Taalas 芯片处理稳定高频的单模型推理。

推理芯片的军备竞赛

AMD 收购 Taalas,放在行业背景下看,是过去 8 个月推理芯片收购潮的最新一笔。

2025年 12 月,Nvidia 以200 亿美元收购 Groq,拿下了基于 SRAM 的低延迟推理架构。

2026年 5 月,Cerebras 以约 560 亿美元市值 IPO,成为 2020年 Snowflake 以来最大的科技 IPO。

6 月,Etched 结束两年多的隐身期,宣布首颗 Transformer 专用芯片在台积电 N4P 工艺上完成流片,手握超过 10 亿美元客户合同。Intel 据报和 SambaNova 签署了收购意向书,Qualcomm 在接触 Tenstorrent。

这些交易指向同一个判断:推理正在成为 AI 算力支出的主战场。

行业预测 2026 年推理将占 AI 计算支出的三分之二,到 2030 年专用推理 ASIC 可能拿下 45%的推理市场。Nvidia的 GPU 仍然统治训练端,但在推理端,它的通用架构正面临来自各个方向的专用芯片挑战。

Taalas 处于这个光谱的最极端位置:它连"一类模型"的通用性都放弃了,直接做"一个模型"的专用芯片。

Groq用 SRAM 替代 HBM 来绕过内存墙,Cerebras 用晶圆级面积来暴力突破,Etched 只为 Transformer 架构优化,而 Taalas 的赌注更激进:它赌的是 AI 模型会逐渐稳定下来,就像通信协议最终会收敛到少数标准。当模型不再每月换代,为最热门的几个模型各造一颗专用芯片,在经济上就是划算的。

赌模型会“凝固”

AMD 高级副总裁 Vamsi Boppana 在公告中说,收购的目的是给客户"每种 AI 工作负载都有对应的最优计算方案"。这句话翻译成竞争策略就是:GPU 负责灵活性,Taalas 芯片负责极致效率,客户按需组合。

这个组合逻辑能否成立,取决于一个核心假设:AI 模型的更新周期是否会放缓。

如果大模型持续每隔几个月就有架构级更新,那把权重烧进硅片的做法就像在流沙上浇混凝土,芯片还没回本,模型已经过时了。但如果模型能力趋于收敛,头部模型稳定服务一两年成为常态,那 Taalas 式的专用芯片就会像通信行业的基带芯片一样,从疯狂的实验变成理所当然的选择。

回看过去 12 个月,模型更新的节奏确实在出现微妙变化。Llama 系列从 3.1到 3.2到 4 的间隔在拉长,GPT 从4到 4o 到5 的架构变动幅度在收窄。更多的新模型是在既有架构上做蒸馏、量化和微调,基座模型的迭代正在放缓。

如果这个趋势继续,Taalas 赌对了。

免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下載

X

Telegram

Facebook

Reddit

複製鏈接