撰文:Techub News 整理
导语
在2025 年 9 月举行的全球顶尖芯片会议 Hot Chips 2025 上,Transformer 论文《Attention Is All You Need》的联合作者之一、Google DeepMind 研究副总裁 Noam Shazeer(诺姆·沙泽尔)发表了主题为「AI 下一阶段预测」的开场演讲。作为深度参与了从早期语言模型研究到现代大规模 AI 系统构建全过程的先驱人物,Shazeer 的视角兼具历史纵深与前沿洞察。他不仅回顾了自己从 Google Brain 到创办 Character.ai,再回归 Google 领导 Gemini 项目的历程,更系统性地剖析了驱动大语言模型(LLM)智能进步的核心要素,并对未来 AI 硬件的发展方向提出了恳切建议。这场演讲是理解当前 AI 浪潮技术根源和未来演变趋势的宝贵窗口。
摘要
- 大语言模型的智能提升依赖于计算量、参数规模、模型深度、训练数据量与信息流动效率等多个因素的协同增长,每一项的边际提升都可能对数地提高模型「智商」。
- 硬件创新是 AI 革命的关键驱动力,未来硬件应在保持确定性的前提下,提供更多的计算能力(FLOPS)、更高的内存容量与带宽,以及更快的网络互连。
- 低精度计算(如 FP8)在深度学习中日益普及且有效,但硬件与软件生态需要协同突破才能充分发挥其潜力。
- 模型推理(尤其是长链思维)和训练后优化(如 RLHF)所需的计算量将大幅增长,可能成为未来 AI 计算负载的重心。
- 尽管 Transformer 架构取得了巨大成功,但探索更有机、更具「神经状态」记忆能力的新架构,可能是进一步提升模型能力与效率的方向。
大语言模型想要什么?
Noam Shazeer(诺姆·沙泽尔)开篇便提出了一个核心问题:是什么让大语言模型变得更聪明?他将其归纳为几个关键因素的组合,每一项的提升都能对数地提高模型的「智商」。首要因素是计算量,即能够执行更多的浮点运算。他指出,深度学习尤其是 LLM 的爆发,很大程度上归功于能够执行比传统单线程处理器高出几个数量级计算的高度并行处理器的出现。
其次,模型参数的数量也至关重要,它决定了模型能吸收多少知识。虽然参数量的增长通常与计算量同步,但并非必然,通过稀疏化等方法可以在不显著增加计算负担的情况下增加参数。此外,模型的深度(即层数)以及层间的非线性变换,是「深度学习」之名的由来,也对模型能力有贡献。
Shazeer 特别强调了信息流动的重要性。Transformer 架构的核心优势就在于它能高效地在序列的不同部分之间移动信息。无论是序列内部(如注意力机制),还是网络层之间,更畅通、更丰富的信息流都会让模型变得更聪明。最后,训练数据的规模和独特性同样关键。使用更多、更独特的训练样本,避免简单重复,是持续提升模型性能的基础。
「任何时候,如果我们能在不严重损害其他因素的前提下,显著提升其中一项,那通常就是一个巨大的胜利。」Shazeer 总结道。
从语言建模痴迷者到 Transformer 联合创始人
Shazeer 回顾了自己是如何「入坑」LLM 领域的。时间回到 2015 年,他在 Google Brain 工作,遇到了一群痴迷于「十亿词语言建模基准」的研究者。当时,基于 LSTM 的模型在数十个 GPU 上运行数周,只为了将困惑度(perplexity)从 30.5 降低到 30.0。这种对极致性能的追求深深吸引了他。
他认为,语言建模是「最好的问题」。文本是抽象思维最精炼的形式,而预测下一个词这个任务表述极其简单,却蕴含着解决通用人工智能(AGI)的潜力。「如果你在这个任务上越做越好,你几乎就解决了人工智能。你可以通过图灵测试,可以完成任何通过交谈就能完成的任务。」Shazeer 解释道。当时,可用的训练数据看似无穷无尽,这让他看到了无限的可能性。
他的第一个主要贡献是探索稀疏性。既然增加参数和计算能让模型更聪明,而计算又很昂贵,那么是否可以只增加参数而不成比例地增加计算呢?他提出了「稀疏门控混合专家」(Sparsely-Gated Mixture of Experts)模型,其核心思想是设计一种与密集矩阵乘法兼容的块级稀疏性,以避免降低硬件计算单元的利用率。这个想法在当时并未立即实用化,但如今已被广泛采用。
随后在 2017 年,他与一群研究者合作,共同创造了 Transformer 架构。他们希望用注意力机制取代当时占主导地位的、训练起来很「烦人」的 RNN。注意力机制通过构建一种键值存储,极大地增加了序列维度的信息流动,而且整个架构可以高效地用矩阵乘法实现,从而在 GPU 或 TPU 上快速运行。「这最终取得了相当不错的成功。」Shazeer 谦虚地表示。
2018 年,随着 Google 开始构建 TPU Pod(大规模 TPU 集群),Shazeer 开始思考如何将模型扩展到单个芯片的内存限制之外。他与 Cliff 等同事合作开发了 Mesh TensorFlow 库,使得 Transformer 模型能够分布式地横跨多个芯片运行,实现了模型并行,为当今的超大规模模型训练奠定了基础。
七年前的预言与今日的现实
Shazeer 展示了他 2018 年在一次大型会议上发表的题为「自然语言模型:越大越好」的演讲片段,以此作为「我早就说过」的回顾。当时,他展示了参数规模从 3000 万到 50 亿的模型生成文本的质量变化,并预测了千亿参数模型的潜力。他当时驳斥了「小模型有利于泛化、速度和内存」的常见观点,认为训练数据不足、计算机太慢或内存限制都不是根本问题,并大力推介了当时的 TPU v3 超级计算机和 Mesh TensorFlow。
「快进到 2025 年,我想说,我早就告诉过你们应该放大 Transformer。」Shazeer 笑着说道。如今,这已成为行业共识。
自 2018 年以来,他还致力于解决其他关键问题,例如推理延迟。Transformer 在处理并行序列时效率很高,但在逐令牌生成(解码)时,注意力层会退化为向量-矩阵乘法,在现代硬件上效率不高。他参与提出了多查询注意力(Multi-Query Attention)和推测解码(Speculative Decoding,当时称为块级并行解码)等技术,以加速推理过程。此外,他还参与了 T5 项目、Google 的对话机器人 LaMDA 的前身「Mina」的开发,并因此受到启发,共同创办了 Character.ai,旨在构建具有个性、能与用户深度互动的聊天机器人。
「当时,我们是最早推出消费者可直接在线对话的 LLM 的公司之一。」Shazeer 提到,「结果发现很多人将其用于娱乐目的,这很有道理,因为这些模型本质上是被训练来『编造东西』的,而不是告诉你真相。」这也正是他于 2024 年回归 Google,共同领导 Gemini 项目的原因之一——他看到了 LLM 在实用化应用方面的巨大进展和潜力。
硬件,请给我们更多!
作为软件和算法研究者,Shazeer 深知硬件的基石作用。他首先感谢了在场的硬件社区,称 AI 革命「没有你们就不可能发生」。那么,大语言模型到底需要硬件提供什么?
他的清单简明而直接:
- 更多的 FLOPS(计算能力):这让我们能够训练计算更密集的模型,并使用更多的训练样本。
- 更高的内存容量和带宽:从片上存储到 HBM,整个内存层次的瓶颈都可能限制模型的设计。如果内存带宽相对计算能力过低,我们就不得不使用非常大的矩阵乘法维度来补偿,这限制了模型设计的灵活性。内存容量则直接决定了我们能构建多大的模型。
- 更快的网络带宽:当今的训练和推理几乎都是分布式的。网络带宽在所有层次上都至关重要。特别是对于推理延迟,当用户希望模型进行长时间「思维链」推理时,我们希望单步推理时间足够短。这通常受限于访问所有模型参数的速度,即内存带宽。通过模型并行将参数分布在更多芯片上,可以聚合内存带宽,但这又需要芯片间具备足够高的互连带宽。
「总而言之,如果你能给我更多这些标准的东西——更多的 FLOPS、更大的内存容量、更高的内存和网络带宽——我们真的能用得很好。」Shazeer 强调,模型架构师在设计时,总是在问:「芯片能承受什么?哪个部分未被充分利用?」硬件的特性直接塑造了软件和算法的形态。
此外,Shazeer 还提出了两个更具体的偏好:
低精度计算:对于深度学习中的许多应用,参数和激活值本身就在不断变化,低位精度通常足够,且能以更低的功耗提供更高的计算吞吐。「如果你能给我更多低精度的 FLOPS,那通常很有好处。」
确定性:这对于研究和调试至关重要。在 AI 研究中,大量实验因算法想法本身无效而失败,但也可能因为软件错误或数据问题。如果实验是确定性的,研究人员就可以进行微调并精确复现问题,从而高效地排除故障。「除非你能告诉我,通过牺牲确定性可以获得 10 倍的性能提升,否则,确定性就是好的。」
观众问答:架构、对齐与未来
在问答环节,与会者提出了众多深刻的问题,Shazeer 的回答同样富有洞见。
关于第一令牌延迟是否重要,他认为这取决于应用场景。如果是对话式应用,只要生成速度比用户阅读速度快即可;但如果需要生成长文本后才给出答案,则整体延迟比第一令牌延迟更重要。
针对下一代模型架构的探索,有观众询问是否可能借鉴更「有机」、带有循环连接等复杂结构的生物启发设计,以提升「每参数智能」。Shazeer 承认尝试过很多想法,但指出人类大脑的参数与训练数据(经验)之比远高于当前 LLM,这可能是因为人类寿命(训练时间)有限。他更倾向于不过度限制参数,而是追求「每计算智能」的提升。
关于计算增长的重点,Shazeer 预测,未来在训练后优化(如人类反馈强化学习 RLHF)和推理上的计算投入可能会与预训练相当,因为这些都是提升模型最终能力的有效手段。
对于数据耗尽的担忧,Shazeer 的态度相对乐观。他认为即使数据总量充足,数据质量的持续提升永远有益。这与他在 2018 年「数据无穷」的乐观表态形成微妙的对照,反映了行业认识的深化。
硬件-软件协同设计的挑战被多次提及。Shazeer 指出,这常常是一个「先有鸡还是先有蛋」的困境:如果当前硬件不支持某项功能(如低精度),软件就不会使用它,导致下一代硬件也不会包含该功能。打破循环需要硬件团队的前瞻性冒险和软件团队对未来硬件的模拟。
关于AGI 与对齐,当被问及如果硬件在 2025 年停止发展,仅凭现有架构是否能实现 AGI 时,Shazeer 给出了一个引人深思的回答:「可能可以。我认为真正会加速这一切的是自我加速——我们可以用 AI 来帮助我们构建更好的软件和硬件。」至于对齐问题,他坦言自己并不确定硬件架构是否能以「新兴」的方式贡献于对齐研究,这反映了他对未知领域的诚实态度。
最后,针对模型可能机械复述训练数据(数据 regurgitation)以及使用模型自身生成数据进行训练可能导致的质量退化问题,Shazeer 认为这需要后续的数据筛选和质量控制来解决。同时,有观众重提了 RNN 所具有的「神经隐藏状态」的记忆与遗忘能力,并询问未来是否会回归类似机制,而非单纯依赖不断增长的外部上下文(Context)。Shazeer 对此表现出浓厚兴趣,认为这是一个好想法,并幽默地发出了工作邀请。
整场演讲和问答在轻松、坦诚且充满探索精神的氛围中结束,Shazeer 的谦逊与好奇心给听众留下了深刻印象,也为 AI 硬件与软件社区的未来协作指明了充满希望的方向。
免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。
