中国DeepSeek升级V4 Pro:Claude Fable的性能仅提升5%,价格却是4500%的差距

CN
Decrypt
關注
1 小時前

DeepSeek 于周三发布了其旗舰产品的最终版本,没有博客文章和公告。一个明显的标志是一张表格单元格:在 API 价格页面 上列出的“deepseek-v4-pro”模型版本现在显示为 DeepSeek-V4-Pro-0813。


使用该模型的费用大约为每百万个标记(模型可以处理的信息基本单位) $0.435 和 $0.87。因此,定价结构保持不变,但底层的权重发生了变化。





Deepseek V4 Pro 自四月起已在市场上,价格 低于 GPT-5 Pro 的 98%,而每个独立实验室测试时都是在测试预览版。DeepSeek 自己在 7 月 31 日表示,当时它将 V4-Flash 推向公众,指出 Pro API 在官方发布时“未变”并表示“将很快跟进”。在 Hugging Face 上,作为开源 AI 项目的首要存储库,模型卡仍然将 V4 系列描述为“预览版”。


因此,广泛传播的分数描述了一个 DeepSeek 认为未完成的版本。公司外部尚未有人独立基准测试 0813。


DeepSeek 的表格声明


该公司发布了 10 个代理基准的比较。在 Fable 5 或其他模型占优势的八个基准上,差距很小。



在基准测试中,Fable 5 的相对领先平均为 5.3%。去掉“人类的最后考试”无工具的部分——DeepSeek 得分为 42.7 对 53.3,差距为 10.6%,影响了所有其他结果——剩余行的平均差距为 2.8%。


两边的定价都是公开的,正是在这里比较才开始显得不那么接近。Fable 5 每百万输入标记收费 $10,每百万输出标记收费 $50。V4 Pro 的成本为 $0.435 和 $0.87,缓存输入为 $0.003625。综合费率为 $30 对 $0.65——大约是 46 倍,或 4600% 的成本。当你经营一项业务并大规模使用 AI 工具时,这种价差非常重要。


完成每个任务的费用差距更大,因为 Fable 5 思考时间更长、写作更多。人工分析将其测量为每个基准任务 $3.15,而 V4-Flash 则为 3 美分,便宜约 105 倍。Hugging Face 首席执行官 Clément Delangue 将每个任务的差距定在超过 $31,而大约为 $0.04。0813 的每个任务费用尚不存在。


Anthropic 自家的产品线使得高端产品更加复杂。Claude Opus 5 在大多数基准测试中超越 Fable 5,价格却只有一半


DeepSeek 自行评分,使用了它尚未发布的基础设施。它在七月的说明中明确指出 DeepSeek Harness 最小模式“将很快发布”,以最大努力和高度创造力运行。其中两个基准,DSBench-FullStack 和 DSBench-Hard,是内部测试集,没有公开的排行榜可以进行对照。


尽管如此,趋势依然明确。中国的开放权重实验室以极低的价格不断接近美国的前沿——Kimi K3 在发布时超越了 Fable 5 和 GPT-5.6 Sol,而 DeepSeek 和小米则一直在 将前沿成本降低 99%,而美国实验室则走向相反的方向。DeepSeek 的权重是 MIT 许可的,并在 Hugging Face 上,因此独立验证只需下载即可。


免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下載

X

Telegram

Facebook

Reddit

複製鏈接