老外研究视角:谁在害怕中国 AI 模型?

CN
1 小時前
前沿实验室的恐慌,更多是因为还没适应从训练成本主导到推理规模主导的新游戏规则。

作者:Stratechery

编译:深潮 TechFlow

深潮导读:Kimi K3 冲击认知模型市场,华尔街和硅谷为何反应过度?本文拆解 AI 从 ChatGPT 时代进入 Agent 时代后,代币(token)已经不再是商品,真正的商品是智能本身——而在这场边际成本为王的战争里,中国开源模型看似免费,其实服务成本一点不低。前沿实验室的恐慌,更多是因为还没适应从训练成本主导到推理规模主导的新游戏规则。

我曾经讲过一个故事,关于我在凯洛格商学院上 STRT-431 第一天的经历,这是每个 MBA 新生的必修课。我翻阅课程资料和案例研究,失望地发现课程表上没有任何科技公司。我跑去找教授问为什么,得到的回答是:这门课的目标不是研究特定行业,而是发掘能应用于任何行业任何公司的普适原则。

如我常说的,当时我对这个答案很不满意:在我看来科技的本质,尤其是软件和分发的零边际成本(和零交易成本),是根本性的不同。在公式里填零往往会把一切搅乱。但我很快意识到,这恰恰是我的机会。聚合理论(Aggregation Theory)的核心洞察是:零边际成本导致的价值链与人们曾经对互联网的预期完全不同——在一个控制需求比分发供给更重要的世界里,你会看到中心化和规模化。

然而 AI 的有趣之处在于,那些古老的普适原则正在重新回到前台。这一点在上周末表现得最为明显,当时 X 上爆发了关于 Kimi K3 的激烈争论。Kimi K3 是中国推出的又一个开源权重模型,其能力正在逼近最先进水平。长话短说:边际成本以一种重大的方式回来了,无论是最先进免费模型的短期影响,还是行业长期结构的角度。

COGS 与研发支出

关于开源权重模型最常见的误解之一是它们更便宜——甚至是免费的。毕竟你可以直接下载权重,跳过创建自己模型所需的时间、费用和能力。这当然没错,但这里的"免费"指的是你在研发(R&D)上需要花费的金额。研发是固定支出,与你产生的收入无关。如果你在研发上花了 100 万美元,不管你的收入是 10 万美元还是 1 亿美元,你仍然在研发上花了 100 万美元(当然这会影响你的盈利能力)。

与收入相关的是 COGS——销售成本——而 COGS 对 AI 来说是实实在在的,这是软件行业很长时间以来没有的情况。具体来说,在模型上运行推理——无论是 Kimi 还是 Fable——都要花钱,而且 AI 提供商在推理上花的钱,至少在大多数商业模式中,与收入直接相关。重用上面的例子,产生 1 亿美元收入与 10 万美元收入,可能需要 1000 倍的 COGS。具体来说,如果产生 1 美元收入的代币成本是 50 美分,那么 1 亿美元收入将有 5000 万美元的 COGS,10 万美元收入只有 5 万美元的 COGS。

关于开源权重模型的要点是,它们并非免费服务。Kimi K3 的成本是每百万输入代币 3 美元,每百万输出代币 15 美元。这比 Sol 的每百万输入代币 5 美元和每百万输出代币 30 美元便宜,但这可能不是正确的衡量标准。

代币与智能

英伟达 CEO 黄仁勋将英伟达正在构建的东西描述为"代币工厂",从英伟达的角度来看这个说法很合理。英伟达的 GPU 不针对特定模型:它们生成代币,并以最快最高效的方式这样做。这导致了诸如每秒代币数、首个代币时间、每瓦代币数、代币成本等衡量指标,黄仁勋认为这些指标将成为决策的基础。

这个框架在 AI 的第一个范式——ChatGPT 时代——确实有意义,当时代币直接交付给最终用户。然而 AI 的第二个范式,即推理时代,打乱了这种衡量方式。推理意味着思维链代币的爆炸式增长,而不同模型需要不同数量的推理代币才能得到正确答案。例如,据报道 Kimi 使用的代币数量明显多于 Sol,这使其价格优势化为乌有。Agent 引入了类似的动态:某些模型在执行 Agent 工作流所需的代币数量上更高效。

这意味着代币不是商品。商品的定义特征是它可以互换:一加仑石油就是一加仑石油,一吨铜就是一吨铜,一蒲式耳小麦就是一蒲式耳小麦。但一个模型的代币与另一个模型的代币不同。可以互换的是由代币构建的东西,也就是智能。换句话说,如果 Kimi 和 Sol 都生成了正确答案,那么这个答案是可以互换的。生成正确答案所需代币的差异会导致 COGS 的差异。

智能的 COGS 是几个不同因素的函数:

模型占用空间:权重和运行时状态决定了托管每个服务副本需要多少昂贵的内存和多少加速器

推理效率:架构选择(如混合专家模型)减少每个生成代币的计算量

内存效率:架构选择可以减少 KV 缓存需求,允许更多并发请求和更好的 GPU 利用率

服务效率:批处理、调度、前缀缓存和其他推理优化最大化利用率并在请求之间共享工作

代币效率:达到正确答案所需的代币越少,推理成本越低

这一点很重要,因为我们正在快速接近这样一个状态:对许多经济上有益的任务来说,智能实际上就是一种商品。例如,任何人构建基本的 CRUD 应用程序,都可能使用来自多个提供商的模型来完成。而在商品市场中,盈利之路不是通过收取更高的价格——你可以(或很快就能)使用多个模型制作完全相同的应用——而是通过拥有优越的成本结构。

理解商品市场

这里值得梳理一下机制,因为正如我几个月前在《亚马逊的耐久性》中指出的,商品市场的动态不是科技行业人士普遍熟悉的:

在商品市场中,每个人收取相同的价格,因为每个人卖的都是同样的东西。这个价格由供需决定

对商品的需求是价格弹性的函数:商品越便宜,需求越大,反之亦然

商品的供给是生产商品边际成本的函数

关键要理解的是,不同供应商生产商品的边际成本不同。这在实践中意味着成本结构最差的供应商最终以他们的边际成本出售商品(如果他们还能生产的话)。其他所有人的利润取决于他们的成本结构比边际供应商好多少。

举个例子:

供应商 A 可以以每单位 10 美元的成本生产 10 个单位的商品

供应商 B 可以以每单位 15 美元的成本生产 10 个单位的商品

供应商 C 可以以每单位 20 美元的成本生产 10 个单位的商品

假设价格弹性使得在 20 美元时有 25 个单位的商品需求。这意味着:

供应商 A 将以 20 美元出售 10 个单位,每单位赚 10 美元

供应商 B 将以 20 美元出售 10 个单位,每单位赚 5 美元

供应商 C 将以 20 美元出售 5 个单位,每单位赚 0 美元

这不完全准确:供应商 C 承担短缺的原因是供应商 A 和 B 能够在价格上略微压低他们,这当然会影响需求(有弹性),但这说明了问题。供应商 A 有很好的生意,供应商 B 有不错的生意,供应商 C 要破产了。

破产风险是固定成本重新回到前台的地方:供应商 C 既有固定成本(如可能的研发支出),也可能承担了债务来为生产商品所需的设备融资。它不能以这些成本来定价商品——记住,市场出清价格接近满足需求所需的最高成本单位的边际成本——但这些成本绝对可以把供应商逼出市场。如果供应商倒闭,价格就会上涨,直到另一个供应商决定进入(或其他供应商扩张)。

智能市场

让我们回到模型上来。现在,上述所有分析都不适用,因为前沿模型的需求超过了供给,而供给受到算力缺乏的限制。这种算力短缺不仅意味着像英伟达这样的算力供应商能获得非常高的利润率,还意味着英伟达的客户,比如 SpaceXAI,也可以转手以高利润率将算力转售给像 Anthropic 这样的公司。与此同时,Anthropic 可以支付加价,因为他们可以以更高的加价出售代币。

然而,不仅仅是超额需求给了 Anthropic 巨大的利润率:Anthropic 和 OpenAI 可能拥有最低的前沿质量智能单位成本,这得益于模型能力、服务规模和代币效率。他们比竞争对手提前几个月服务特定能力水平的模型,同时将最好的模型应用于优化这些成本。

还值得注意的是,市场还没有将智能视为商品:需求是专门针对 Anthropic 和 OpenAI 的,对不那么好的模型的需求要少得多(因此 SpaceXAI 和 Meta 将产能卖给 Anthropic)。一种思考优化成本的推动力的方式是,这是按智能水平定义待完成工作的函数,这样智能买家就可以创造一个智能被商品化的市场。然而从长远来看,无论谁在前沿,都最有能力主导非前沿市场,这些市场只是前沿减去 n 个月,也就是前沿模型制造商一直在优化其服务成本的那几个月。

所有这些都是说,我认为对 Kimi 和中国模型的普遍反应相当过度,至少从经济角度来看是这样。现在有一个价格保护伞,这是算力缺乏的下游结果。我非常怀疑中国模型在边际成本基础上是否更便宜服务,它们只是看起来更便宜,因为 Anthropic 和 OpenAI 的供给如此受限,以至于他们收取的价格远高于如果有足够供给来满足智能需求时的价格。

前沿实验室的恐慌

那么,为什么模型制造商似乎对中国模型如此恐慌?

首先,我认为前沿实验室锚定在一个训练成本主导其财务建模的世界。只要训练消耗的 GPU 比推理多,最大化推理收入以帮助资助下一次训练运行就至关重要,这意味着对推理收取非常高的价格。

然而,展望未来,我预计推理市场的增长速度将远快于训练成本(这包括训练成本将继续飙升的假设),这意味着他们真的可以用量来弥补。直到八个月前,这是否会成为现实还不清楚,但 Agent 范式的解锁如此巨大,以至于前沿实验室应该更有信心,他们不仅能以更低的价格生存,还能茁壮成长(一旦他们有足够的算力)。

其次,智能实际上不是一个完美的商品,部分原因是应用智能会让自己变得更聪明。具体来说,无论谁在运行推理,也在收集数据,而这些数据会用于使下一次迭代的模型变得更好。一方面,这更是前沿实验室在更多算力上线时降低价格和增加使用量的理由。另一方面,这就是为什么像微软这样的公司越来越痴迷于帮助公司运行自己的模型。如果中国模型是可行的替代方案,这就更加可行。

第三,前沿实验室不仅能从中国模型中脱颖而出,还能彼此区分的另一种方式是继续向上整合到客户体验中。Claude Code 和 Codex 被证明相当有粘性,这一点令人震惊。无论你开始使用哪种工具,都可能是你坚持使用的那一种,对于非技术用户来说更是如此。从长远来看,这种向上移动的必要性确实意味着前沿模型绝对是对软件提供商的威胁,包括微软。另一方面,目前拥有客户体验的软件公司在多大程度上能够获得有竞争力的模型,就在多大程度上能够抵制前沿实验室的侵蚀。

最后,Anthropic 的意识形态角度特别不容忽视。这是一家相信只有它才能被托付 AI 的公司,而开源权重替代品的存在对这一假设是致命打击。

中国的动机

Kimi 不是唯一的新中国模型。彭博社报道:

阿里巴巴集团控股有限公司股价周一上涨 5.4%,此前该公司推出了其旗舰 Qwen3.8 Max 模型的预览版,称其仅次于 Anthropic 的 Fable 5。这次周日发布是在初创公司月之暗面推出强大新产品仅几天后,后者震动了市场并引发美国对中国缩小与 Anthropic 和 OpenAI 等全球领导者差距的担忧。Qwen3.8 Max 拥有 2.4 万亿参数,与月之暗面的 Kimi K3 一起进入重量级类别。K3 拥有 2.8 万亿参数,可与顶级产品相媲美,阿里巴巴也设定了同样高的期望。

开发者现在可以通过阿里巴巴的编码平台(包括 Qoder)访问 Qwen3.8 Max。阿里巴巴计划很快将该模型开源权重化,将访问范围扩展到预览版之外。对这些中国制造的人工智能系统和模型的兴趣如此之高,以至于月之暗面被迫在周日晚些时候暂停接受新订阅,以应对压倒性的需求。

阿里巴巴集团控股有限公司股价周一一度上涨 5.4%,此前该公司推出了其旗舰 Qwen3.8 Max 模型的预览版本,并称其仅次于 Anthropic PBC 的 Fable 5。这次周日发布仅在 Moonshot AI 推出强大新产品数天之后,后者震动了市场并引发美国对中国在追赶 Anthropic 和 OpenAI 等全球领先者方面的担忧。Qwen3.8 Max 拥有 2.4 万亿参数,与 Moonshot 的 Kimi K3 一同进入重量级行列。K3 拥有 2.8 万亿参数,可与顶级产品媲美,阿里巴巴也设定了同样高的期望。

开发者现在可以通过阿里巴巴的编码平台访问 Qwen3.8 Max,包括 Qoder。阿里巴巴计划很快开放该模型的权重,将访问范围扩大到预览版本之外。这些中国制造的人工智能系统和模型的需求如此之高,以至于 Moonshot 被迫在周日晚些时候暂停接受新订阅以应对压倒性的需求。

Qwen3.8 Max 也将开放权重这一事实值得注意。阿里巴巴在今年早些时候停止发布其领先模型的权重,但似乎已经改变了这一决定;我怀疑这一转变与上周习近平关于 AI 的讲话有关,该讲话加倍强调了开放权重的方法:

我们应该坚持开放共赢的原则,推动创新驱动发展。作为世界经济增长的新引擎和增长动力转换的加速器,人工智能正在从数字世界走向物理世界。我们应该抓住这一难得的历史机遇,鼓励开源、开放、协作和共享。我们应该促进人工智能的技术创新、产业发展和场景化应用。我们应该协调推进传统产业的转型升级、新兴产业的培育壮大和未来产业的前瞻性规划,让各行各业都能从人工智能中受益。

中国的战略显而易见:将你的互补品商品化。注意习近平明确将开放性与 AI "从数字世界走向物理世界"联系起来;物理世界是由中国主导的世界,中国在机器人技术等领域的领先地位将从广泛可用的 AI 模型中获益匪浅。

同样,中国不希望美国在 AI 方面获得不对称优势;如果中国能削弱美国前沿实验室的同时增强任何和所有潜在的美国对手,那就更好了,而且它可以从附着在开放生态系统上的创新中受益。

蒸馏问题

同样,不要指望中国对前沿实验室的蒸馏攻击采取任何措施。我认为将中国实验室的所有成功都归因于蒸馏是错误的,但假装蒸馏没有给中国实验室带来巨大优势同样是错误的。这种优势在过去一年中真正显现出来,因为训练后强化学习对模型性能变得越来越重要。中国实验室不必从头开始构建强化学习环境,而是可以简单地使用前沿实验室的模型作为教师,以低得多的成本实现快速改进(这不是中国模型开发成本更低的唯一原因,但这是一个重要原因)。

有趣的是,中国模型在西方最重要的用例之一本身就是蒸馏。例如,刚刚发布开放权重模型的 Thinking Machines,依靠中国模型来解决强化学习的冷启动问题。Dean Meyer 和 Konstantine Buhler 在 X 上写了一篇出色的文章,解释蒸馏意味着西方开放权重模型相对于中国从根本上处于劣势:

蒸馏并不能解释中国在开放模型方面的全部领先优势。中国实验室拥有世界级研究人员、大量算力、强大的预训练模型、软硬件协同设计以及快速提升的训练后能力。但蒸馏压缩了从强大基础到接近前沿系统之间代价高昂的最后差距。即使蒸馏在中国模型总能力中所占份额较小,它在其相对美国开放模型的优势中也占有重要份额。

新的执法机制将使大规模蒸馏对中国公司来说变得更难、更慢、更昂贵。然而,执法无法消除由国家行为者支持的蒸馏。因此,西方的每一次前沿进展都为中国实验室创造了另一个教师。西方建设者必须独立复制这些能力,或者等待从中国模型中学习。这种差距为中国实验室提供了相对西方公司的反复出现的结构性优势。

这一点值得重复:因为美国开放权重模型制造商必须遵守前沿实验室的服务条款,他们(1)不如中国替代品,(2)最终蒸馏的是蒸馏物,只是绕道经过中国实验室。如果西方开放权重模型制造商可以直接从源头获取,岂不是更好?

为此,围绕蒸馏还有一个更有趣的问题:它到底为什么不好?毕竟,大语言模型不就是对开放互联网上所有知识的蒸馏吗,由前沿实验室抓取并蒸馏成正在被蒸馏的模型?这里到底谁受到了侵害?

事实上,这个悖论就是解决方案。我相信开放权重模型有利于创新(并且,根据上述内容,我认为前沿实验室会没事),但依赖中国是个问题。美国应该通过一项法律,(1)明确收集数据用于训练模型属于合理使用,(2)至少对美国公司禁止禁止蒸馏的服务条款。阻止蒸馏——实际上就是查询 API——几乎是不可能的;美国应该走另一条路,倾向于一项新的版权政策,既保护实验室,也保证他们所学的知识为其他人的进一步创新提供动力。

值得担心的理由

整篇文章一直在消除对 Kimi K3 以及中国开放权重模型的过度反应;然而,有一个值得担心的理由,那就是网络安全。考虑 The Stack 的这个故事:

Hugging Face 表示,其生产基础设施上周早些时候遭到"自主"AI 代理系统的入侵。该平台的安全团队最初在事件响应(IR)中受阻于未具名的美国 LLM 前沿模型护栏,"它们无法区分事件响应者和攻击者,"他们说。因此 Hugging Face 的防御者转而使用来自中国 Z.ai 实验室的开源 GLM 5.2 模型——在他们自己的基础设施上运行它来分析攻击者留下的 17,000 多条日志或足迹。

对于总部位于纽约的 Hugging Face 来说,这是一个引人注目的公开承认,该公司让用户在模型、数据集和应用程序上协作,今年夏天达到了 1 亿美元 ARR 的里程碑。在一份事件报告中,该公司建议防御者"在事件发生前准备好一个可以在自己基础设施上运行的有能力的模型[我们的斜体],既可以避免护栏锁定,也可以防止攻击者数据和凭证离开你的环境。"

很难夸大特朗普政府对 Anthropic 发布 Fable 的恐慌反应有多么错误,特别是因为它加剧了 Anthropic 的最坏倾向,即假设只有他们才能被信任使用强大的 AI。在一个只有一个 AI 的世界里,将最强大的网络安全能力保留给美国政府和可信赖的盟友可能是有道理的;然而,这不是我们生活的世界。

已经有并将有完全能够对现有基础设施发动网络安全攻击的模型,而且这些模型将——已经——广泛可用。最好的防御——事实上是唯一可行的防御——将是确保防御者也能获得最好的模型。现在,由于特朗普政府的指令,防御者实际上被禁止将 Fable 或 Sol 用于网络安全;这意味着最好的替代方案是使用来自一个多年来一直试图削弱我们网络防御的国家的模型。这太疯狂了!

更好的做法是明确的:首先,放松 Fable 和 Sol 在网络安全方面的限制,其次,确保美国开放权重模型制造商与中国处于平等竞争环境。是的,前沿实验室会大吵大闹,但政府应该意识到,听从他们的歇斯底里已经导致美国处于美国公司依赖中国进行防御的境地。让前沿实验室通过做得更好来获胜;不要让他们定义安全或保障,也不要让他们拉起人类集体知识的梯子。中国已经够难竞争了;让他们扛起开放和创新的大旗简直是放弃我们最大的优势。

免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下載

X

Telegram

Facebook

Reddit

複製鏈接