rick awsb ($people, $people)
rick awsb ($people, $people)|2026年09月07日 13:30
Astra 预训练使用了超过 10 万张 gb200,以及老黄说马上还有40万张卡要上线。 但其实和openai拥有的总算力相比,这些仍只是小部分 10万张gb200,不过占openai当时总算力的约10% 但是,Total Compute ≠ Frontier Training Compute。 一家模型公司可能拥有几百万张 GPU 等效算力,但这些卡分布在不同数据中心、不同云厂商、不同芯片代际中,还要承担 ChatGPT、API、Agent、RL、评测、synthetic data 等任务。真正决定一次大模型训练上限的,是: Maximum Tightly-Coupled Training Compute ——一次到底能有多少张卡像“一台机器”一样协同工作。 大模型训练需要频繁同步参数、梯度、activation 和 MoE token routing。GPU 算得再快,如果大量时间在等网络,实际训练效率依然会很低。 这也解释了为什么 Astra 可能只占 OpenAI 当时总算力的 5%—10%,却可能占用了相当高比例的最大统一训练资源。 因此,黄仁勋所说的“接下来还有 40 万张 GPU 上线”,真正关键的还是其中到底有多少能进入同一个 training fabric。 而openai这方面的处于领先,因为他们除了自建,还有之前租用的微软的集群。 在算力即模型的竞争环境中,anthropic当时的保守,今天看来,很可能是致命的(rick awsb ($people, $people))
+3
曾提及
分享至:

脉络

热门快讯

APP下载

X

Telegram

Facebook

Reddit

复制链接

热门阅读