智能无限,芯片紧缺:一场关于算力定价的供给错位观察

CN
47分钟前
算力与内存供给持续受限,正在让硬件从消耗品变成越来越稀缺的战略资源。

作者:Kerman Kohli

编译:深潮 TechFlow

深潮导读:当所有人都在盯着代币价格下跌喊泡沫时,Kerman Kohli 给出了一个完全相反的解释框架:需求无限、供给受限,硬件正在变成战略资源。这篇文章帮你看懂为什么二手显卡在涨价、为什么算力不会贬值,以及为什么「拥有自己的计算能力」正在从技术问题变成生存问题。

我已经有一个月没怎么写 Substack 了,主要原因是我学习的速度太快,根本抽不出时间动笔。这篇文章是对我近期所学的一次更新,以及我脑子里正在形成的一些新思维模型。我想把我的学习成果大致分成三个部分:

第一部分讲硬件动态,以及为什么我认为大多数人对硬件的看法是错的。第二部分讲模型在如何进化,以及这对未来意味着什么。最后一部分讲本地算力与前沿算力之间的关系。

在开始之前,我想先分享一下我自己的硬件探索进展,因为和这篇文章的主题直接相关。

我今年早些时候写过一篇关于花 15,000 美元组装推理机器的文章。最近我对它做了升级,加了一块 GPU,总投入来到 35,000 美元。但有意思的是,今年年初花 10,000 美元买的那块 GPU,现在要花 14,000 美元才能买到,内存也涨了 1,000 美元。也就是说,这台 35,000 美元的机器,我的实际成本基础只有 30,000 美元。对于大多数硬件来说,这种情况并不正常。

此外,我又花了 35,000 美元买了 6 台 DGX Spark,配了一台 16 口 100Gb 交换机,需要用光纤线缆把它们全部互联起来。通过这个过程,我对 GPU 的理解超过了网上任何资料能给我的。真正买硬件回来折腾,是进入这个世界的唯一正确方式。

今年我个人在 AI 硬件上的资本支出呈指数级增长,在 RouteMesh 我们也在沿着这个方向推进,GPU 集群是下一个合乎逻辑的规模化步骤。随着时间推进,我会分享更多关于数据中心探索的经历。

i) 硬件动态

一台用了不到一年的机器,怎么会反而升值?更疯狂的是,一块二手的 RTX 3090(2020 年的 GPU)在 2026 年居然还能以原价卖出?你不能只是说一句「泡沫」就完事了,这里需要想得更深。

这一切的起点是:内存!当然还有英伟达的芯片。我在这一节会展开解释。当我们谈论硬件时,实际上在说两样东西:计算和内存。

计算确实会随着时间推移变得越来越强,新一代产品会完爆老一代。但这只在计算是瓶颈时才有意义(这里的计算指的是 CPU/GPU/XPU)。而在推理场景下,瓶颈是内存。鉴于内存在未来至少十年内都会处于结构性短缺状态(没错,我已经把之前的五年判断上调到十年了),计算部分的任何折旧都会被内存的升值所抵消。

这是第一个趋势。但第二个被市场低估的因素是:英伟达芯片的价值很大程度上来自它们的向后兼容性。旧芯片仍然有用,而且背后有一个庞大的生态可以运行。一块 2020 年的 RTX 3090 或 A100,到今天依然能够执行有经济价值的推理任务,完全有理由让它在数据中心里继续运行下去!

这是一个巨大的叙事,但没多少人真正关注。你不能做空硬件、新型云服务商、算力或内存。硬件的动态已经永久改变了。

我还观察到,某些工作负载永远不需要更新一代的芯片。工作负载似乎开始和特定硬件绑定了,这在科技领域已经很久没有出现过了。

我自己就正在经历这一点。我花 10,000 美元买的 RTX 6000 Pro Max-Q,现在价值 16,000 美元,有时候甚至标价 18,000 美元!这是一个趋势,不是短期的供需失衡。

ii) 模型演进

最近有很多人指出代币价格在下降,并且认为这会导致「泡沫」破裂。这同样是错的,因为他们只看到了价格的一面,没有看到另一面:需求。

下面是 Silicon Data 的一张图,显示代币价格从 6 月以来就在持续下跌。按照这个逻辑,AI 的价格和需求似乎都在放缓。

由于很难找到一个统一的代币需求数据,我决定用英伟达数据中心收入来替代观察。如果代币价格下降能满足需求的话,人们应该需要更少的芯片才对。但我们看到的完全不是这个故事……

如图所示,增长是持续向上的,唯一限制它的是:供给。

人们不理解 AI 和这整场建设浪潮的一点是:需求实际上是无限的(我在上一篇文章里也写过),供给才是限制因素。这很难用直觉理解,因为传统经济学告诉我们供给会扩张以满足需求。但对智能的需求是无限的,使用场景也是无边界的,这意味着我们永远无法真正满足供给。我知道这很难消化,也知道这意味着未来会看起来截然不同,但你必须把这一点内化,否则未来你会处于非常不利的位置。

拥有自己的算力至关重要,因为它正在变成一种战略资源。那些不拥有算力的人,他们的想法会被偷走(我们最近已经看到了 Navier Stokes 问题被解决并赢得 100 万美元奖金的案例)。

一切都在按计划进行。

不过,代币价格下降还带来另一个有趣的趋势:我们可以在一切事物中嵌入更多智能,甚至解锁更多工作流程。我现在有大量个人软件在管理我的生活,每一次模型进步,我都能嵌入更多智能,而这又需要更多智能来协调这一切。智能体需求的递归性和爆发性,至今仍让我感到震撼。

这又回到了我上一篇文章写的核心问题:你认为对智能的需求是有限的还是无限的?提示:它是无限的。

iii) 本地算力 vs 前沿算力

我看到很多关于这个话题的观点,其中大多数我认为完全是错的。先从事实说起:过去一个月,本地智能领域出现了令人难以置信的突破。

Qwen 3.8 DFlash2 和 GLM 5.3 Flash Next DFlash2 在你自己硬件上可编排的速度和智能水平方面,带来了跨越式的改变。我的双 RTX 机器和 6 节点 Spark 集群让我几乎实现了算力自给自足。我仍然保留了一个前沿模型订阅(每月 100 美元的 ChatGPT),但我只用它来处理 iOS 端、计算机操作和一些真正困难的随机问题。我为此支付了很高的溢价,而且心甘情愿。

我认为大多数人最终都会达到类似的配置(前提是他们真的愿意买硬件)。那么这是否意味着前沿实验室的终结?

完全不是。人们经常忘记前沿实验室和前沿模型的两个特点:

购买领先智能所支付的价格,不是贵 10%,而是可能贵 10 倍。你不会只给你最好的员工多付 10% 的薪水,你愿意付几倍的价钱。对智能来说,同样的逻辑也适用。

实验室并不在乎你能否下载开源模型,因为运行它们仍然需要算力!猜猜谁掌握着大量算力:正是他们!

这两个因素是唯一相关的因素,其他一切都不重要。而且它们将带有“美国品牌”标签,这会让它们在企业市场获得溢价。

OpenAI 和 Anthropic 拥有大量算力,不管你怎么想都没用,除非你自己拥有算力(大多数人没有)。硬件价格会持续攀升,每次你评估购买硬件的投资回报率时,你宁愿说“每月 200 美元比起 2 万美元的资本支出算什么”。随着编程订阅服务走向终结(ChatGPT 每月 200 美元的订阅已经暂停),以及硬件价格变得更加离谱且难以获得,这个问题会反噬人们。

做多算力

如果我的信念体系中有两个坚实的锚点,那就是以下两点:

这是这些模型最差的状态。未来只会越来越好。乐观主义至关重要。

价格下降会导致使用量增加。需求是无限的,世界是一个正和的地方。

我认为在这两点中,最后一点是最难让人理解的。无限需求打破了许多假设,迫使人们以完全不同的视角看待市场运作方式、竞争格局以及人类集体组织的方式。

如果你不做多算力,你将会陷入困境。你可以通过多种方式做多算力,包括职业选择、投资组合或拥有的硬件(也许以上全部)。但你唯一不能做的,就是不做多算力。

做多算力。

免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接