AMD CEO Lisa Su(苏姿丰):MI350 系列已出货,MI400 与 Helios AI 机架引领开放生态

CN
16小时前

撰文:Techub News 整理

导语

北京时间 6 月 12 日凌晨,AMD 于硅谷举办了年度 AI 盛会「Advancing AI 2025」。在这场长达两个多小时的活动中,AMD 董事会主席兼首席执行官苏姿丰(Lisa Su)携公司高管团队,联合 xAI、Meta、Oracle、微软、OpenAI、Cohere 等一众顶级 AI 公司与云服务商,共同揭晓了其在 AI 计算硬件、软件及解决方案上的最新进展与未来蓝图。此次活动正值 AI 模型与应用爆发式增长、计算需求急剧膨胀的关键节点,AMD 如何以其「CPU+GPU+DPU+FPGA」的全面产品组合,以及在开放生态上的坚定投入,争夺高达数千亿美元的数据中心 AI 加速器市场,成为业界关注的焦点。

摘要

  • 发布旗舰 AI 加速器 MI350 系列,相比 MI300 实现 4 倍性能代际提升,推理性能部分场景达 35 倍,已开始生产出货。
  • 首次预览 2026 年机架级解决方案 MI400 系列及 Helios AI 机架,旨在为万亿参数模型提供计算,性能目标再跃升 10 倍。
  • ROCm 软件栈发布第 7 版,推理性能提升 3.5 倍,并强化训练支持,与 PyTorch、vLLM、SGLang 等开源社区深度整合。
  • 公布与 xAI、Meta、Oracle、微软、OpenAI 等客户的大规模部署与合作细节,突显 AMD Instinct 在推理与训练工作负载中的实际竞争力与成本优势。
  • 强调开放硬件(UALink、Ultra Ethernet)与软件生态是加速 AI 创新与规模化的核心,AMD 致力于提供全栈解决方案以应对多样化需求。

AI 的新篇章:推理爆发与智能体崛起

苏姿丰(Lisa Su)在开场中指出,自 ChatGPT 问世以来,AI 创新的速度是她职业生涯中前所未见的,而 2025 年这一进程只会更快。她观察到几个关键趋势:更强大的推理模型涌现、智能体(Agent)崛起、真实世界用例开始大规模部署。她特别强调,推理(Inference)正成为 AI 计算增长的最大驱动力,预计未来几年年增长率将超过 80%。这得益于模型能力提升和新用例的出现,极大地增加了 AI 的使用量。

另一个显著变化是模型数量的爆炸式增长。不仅有来自 OpenAI、Google 的前沿模型,还有 Meta、DeepSeek 等的开源模型,以及针对医疗、金融、编程、科学研究等领域构建的专用模型。苏姿丰(Lisa Su)预测,未来几年将出现数十万乃至数百万个针对特定任务、行业或用例构建的专用模型

关于近期热议的智能体 AI(Agentic AI),她将其定义为一类新的“用户”:它们始终在线,持续访问数据、查看应用和系统,以自主做出决策和工作。这不仅需要高性能 GPU 实时生成洞察,还会随着智能体活动增加,催生大量传统计算需求,转向高性能 CPU。她形象地比喻道:“我们实际上是在全球计算基础设施中,新增了相当于数十亿新虚拟用户。” 这一切都需要 GPU 和 CPU 在开放的生态系统中协同工作。

市场、战略与信任:AMD 的三大支柱

回顾去年对数据中心 AI 加速器市场规模(TAM)在 2028 年达到 5000 亿美元的预测,苏姿丰(Lisa Su)表示,根据当前所有迹象,这个数字将会更高。她重申了 AMD 的核心战略基于三个关键原则:

  • 提供广泛的计算引擎组合:涵盖 CPU、GPU、DPU、NIC、FPGA 和自适应 SOC,让客户能为特定模型和用例匹配最合适的计算单元。
  • 大力投资开放、开发者优先的生态系统:支持所有主流框架、库和模型,通过开放标准汇聚行业力量。
  • 提供全栈解决方案:通过构建和加强合作伙伴关系,将所有元素整合在一起。

她特别强调了“信任”的价值,认为在迈向 AI 未来的过程中,信任必须引领方向。而信任的建立,源于对路线图的坚定执行、对开放生态的构建,以及提供业界最广泛的 AI 产品组合。

客户之声:xAI、Meta 与 Oracle 的实践

为了展示 AMD 技术的实际应用,苏姿丰(Lisa Su)邀请了多位重量级合作伙伴上台分享。

xAI 联合创始人 Xiao Sun 分享了使用 AMD MI300X 加速其 Grok 系列模型的经验。他形容这个过程是“毫不费力的”(effortless)。作为一个快速行动的小团队,xAI 最宝贵的资源是工程时间。在 AMD 工程师的紧密协作下(甚至常在晚上 9 点或午夜通电话),他们仅用几个月就将 Grok 模型推入生产环境。Xiao Sun 赞扬了 AMD 的年度硬件更新节奏,并从第一性原理出发,展望了从硅到产品的“人类历史上最大规模的协同设计”,期待与 AMD 等供应商共同加速迭代。

Meta 工程副总裁 Yee Jiun Song(YJ Song) 表示,AMD 是 Meta 战略性的、响应迅速的合作伙伴。MI300X 加速器如今已是 Meta 基础设施的关键部分,被广泛用于 Llama 3 和 Llama 4 的推理,因其高性能和出色的总体拥有成本(TCO)。Meta 正在将 MI300X 的使用扩展到更多工作负载,包括对其业务至关重要的排名和推荐模型的训练和推理。对于 MI350,他看好其带来的显著更强的计算能力、新一代内存和对 FP4/FP6 的支持,同时保持与 MI300 相同的外形规格以便快速部署。YJ Song 还指出,AI 不仅改进现有产品,也催生全新产品,这正驱动着前所未见规模的计算基础设施投资。Meta 与 AMD 在软件(PyTorch、ROCm)和硬件(开放计算项目 OCP)上的紧密合作,是能够快速将 MI300 引入生产环境的重要原因。

Oracle Cloud Infrastructure (OCI) 执行副总裁 Mahesh Thiagarajan 阐述了与 AMD 的深度整合。他强调,要解决云和 AI 交叉领域的前沿挑战,需要从电源、计算、网络到存储的全栈深度集成,以榨取每一分性能。AMD Infinity Fabric 技术使得将数据集高速移至加速器旁成为可能。同时,高性能网络(如 Pensando)对于构建作为单一巨型超级计算机运行的 AI 超级集群至关重要。OCI 上 MI300X 的需求巨大,既有 AI 原生公司,也有大型前沿模型公司。OCI 确保客户能立即获得 AMD 的最新 ROCm 创新和性能提升。他宣布,OCI 将在两个月内上线一个支持超过 27,000 个 GPU 的单一集群。Mahesh 还谈及了构建千兆瓦(Gigawatt)级数据中心的挑战与机遇,认为与 AMD 的合作核心是为客户带来“价格性能”价值。

MI350 系列发布:4 倍性能跃升与成本优势

苏姿丰(Lisa Su)正式发布了 AMD Instinct MI350 系列,包括旗舰产品 MI355 和 MI350(两者采用相同芯片,MI355 支持更高的热设计功耗和性能释放)。这是 Instinct 历史上最大的代际性能飞跃。

MI355 采用第四代 Instinct 架构,支持 FP4 等新数据格式,搭载最新的 HBM3E 内存,通过 3D 封装集成 1850 亿个晶体管。其关键规格与优势包括:

  • 4 倍 AI 计算性能提升:加速训练和推理。
  • 288GB 业界领先内存:可在单 GPU 上运行高达 5200 亿参数的模型。
  • 兼容性:采用与 MI300/MI325 相同的行业标准 UBB8 平台,易于部署到现有数据中心基础设施。
  • 竞争优势:相比竞品,MI355 支持 1.6 倍内存,在 FP6 和 FP64 上吞吐量翻倍,在 FP4 计算和 HBM3E 内存容量上具有平台级优势。

性能方面,在 Llama 3.1 上,MI355 在运行超低延迟应用(如代码补全、实时翻译)时,吞吐量比前代提升高达 35 倍。在聊天机器人、内容生成、摘要、对话式 AI 等应用中,性能提升可达 4.2 倍。在 DeepSeek 和 Llama 4 Maverick 等模型上,令牌生成速度可达前代的三倍。

与竞争对手对比,在使用 SGLang 和 vLLM 等开源框架运行 DeepSeek R1 或 Llama 3.1 时,MI355 的吞吐量领先于竞品 B200,甚至与更昂贵复杂的 GB200 性能相当。更重要的是,结合更低的资本支出(CapEx),MI355 每美元可产生的令牌数比竞品解决方案高出 40%,为云和企业客户带来了更高的吞吐量、效率和更优的总体拥有成本(TCO)。

苏姿丰(Lisa Su)宣布,MI355 的生产出货已于本月早些时候开始,首批合作伙伴平台和公有云实例预计将在第三季度推出。

软件之力:ROCm 7 与开发者生态

AMD 高级副总裁、AI 业务负责人 Vamsi Bopanna 登台,强调了软件对于释放 AI 硬件全部潜力的关键作用。他宣布推出 ROCm 7,这是 AMD 的开放式软件平台的最新版本。

ROCm 7 带来了多项重要增强:

  • 聚焦推理:在推理堆栈的每一层进行创新,性能相比 ROCm 6 提升超过 3.5 倍。
  • 拥抱开源:vLLM、SGLang 等开源框架的功能迭代和性能已开始超越封闭的替代方案。通过与这些社区紧密合作,MI355 在 DeepSeek FP8 上的吞吐量可比 B200 高出 1.3 倍。
  • 强化训练支持:支持所有主要的并行策略和框架(PyTorch、JAX 等),训练性能也提升至 ROCm 6 的 3 倍。
  • 提升易用性:持续改进开箱即用能力、简化设置、增加素材,并通过黑客松、竞赛、见面会等方式加强社区互动。发布节奏已加速至每两周一次。

微软 AI 平台公司副总裁 Eric Boyd 作为合作伙伴上台,分享了微软如何在 AI Foundry 和内部使用 AMD Instinct 进行推理和训练。他提到,Instinct 芯片的大内存和高带宽为服务大语言模型带来了显著的 TCO 优势。微软使用 SGLang 引擎推理 DeepSeek 等开源模型,ROCm 与开源的集成使得大规模部署变得容易。此外,微软研究团队已在 2100 块 MI300X 上训练了最先进的多模态模型,同一平台兼顾推理和训练提供了极大的数据中心灵活性。

Cohere 联合创始人兼 CEO Aidan Gomez(Transformer 论文作者之一)也分享了使用 ROCm 进行训练的经验。他表示,Cohere 专注于为金融、医疗等高度监管行业的企业提供安全、私密的 AI。在使用 AMD 硬件运行模型并进行训练后,Cohere 对 ROCm 的进步印象深刻,特别是在扩展训练任务时获得了信心。他期待未来能利用 MI350 系列更高的内存带宽来训练更大、更复杂的模型。

面向未来:MI400、Helios 机架与开放标准

在活动的后半程,苏姿丰(Lisa Su)将目光投向了更远的未来,首次预览了计划于 2026 年推出的 Instinct MI400 系列及其对应的Helios AI 机架。这是一个从零开始设计的、完全集成的 AI 机架平台,面向大规模训练和分布式推理。

Helios 机架将 CPU(下一代 EPYC “Venice”,基于 2nm 工艺,Zen 6 核心)、GPU(MI400 系列)、Pensando NIC(下一代 “Volcano”)和 ROCm 软件统一为一个系统。其设计目标包括:

  • 连接多达 72 个 GPU,提供 260 TB/s 的纵向扩展带宽。
  • 提供 2.9 ExaFLOPS 的 FP4 性能。
  • 相比竞品,支持多 50% 的 HBM4 内存、内存带宽和横向扩展带宽。

MI400 系列预计将为最前沿的模型带来高达 10 倍的性能提升。苏姿丰(Lisa Su)表示,客户对 MI400 和 Helios 的热情非常高,AMD 已与客户进行了多年的前期合作。

为了印证这一点,她请出了重量级嘉宾——OpenAI 创始人兼 CEO Sam Altman(萨姆·奥尔特曼)。Altman 回顾了 AI 从 2020 年代初至今的惊人进展,并预测在未来五年(到 2030 年)将保持同样的进步速度,实现新颖的科学发现和运行极其复杂的社会功能。他强调了实现这一目标需要跨研究、工程、硬件等领域的深度协作。谈及与 AMD 的合作,Altman 表示对 MI450(应为 MI400 系列之一)感到“极其兴奋”,其内存架构非常适合推理,相信也能成为训练的绝佳选择。他回忆最初听到规格时觉得“不可能”、“太夸张了”,但如今看到 AMD 接近交付感到非常激动。

此外,演讲中还重点介绍了 AMD 在推动开放行业标准方面的努力:

  • UALink:用于机架内 GPU 间高速互连的开放标准,旨在打破封闭互联方案的垄断。AMD 与 Astera Labs、Marvell 等合作伙伴正在共同推进。
  • Ultra Ethernet Consortium (UEC):用于超大规模 AI 集群横向扩展的网络标准。AMD 是创始成员,其 Pensando P4 智能网卡已支持 UEC 1.0(该标准于活动前一天正式发布),可提升 AI 性能并降低网络成本。

主权计算与结语

苏姿丰(Lisa Su)还提及了 AMD 在主权计算领域的进展,与全球 40 多个政府和研究机构合作,构建高性能计算和 AI 基础设施。她以 AMD 旗下的 Silo AI 实验室(与欧洲各国合作)以及与沙特阿拉伯新成立的公司 Humain 的合作为例,说明了如何利用本地化、开放的 AI 技术推动社会影响和经济发展。Humain CEO Tareq Amin 现场宣布了与 AMD 的合资企业,承诺利用沙特在土地和能源方面的优势,为全球 AI 开发者降低 30% 的拥有成本,并计划建设吉瓦级数据中心。

在总结中,苏姿丰(Lisa Su)表示,过去一年重新定义了 AI 的进步速度,这个社区正处在一切重要变革的中心。她相信,AI 的未来不会由任何一家公司或在封闭生态中构建,而将由全行业的开放协作所塑造。AMD 期待与所有合作伙伴一起,通过开放的技术、人才与协作,让 AI 变得更强大、更易获取、对每个人更有用,共同改变世界。

免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接