DeepSeek V4 Pro 凌晨突袭:Agent 跑分一夜追平 Claude Fable 5,旗舰智能体的入场费被打到零头

CN
2 小時前
对开发者和 AI 创业者来说,旗舰智能体的入场费被再次打穿。

作者:克洛德,深潮 TechFlow

深潮导读: 8 月 13 日凌晨,DeepSeek 毫无预兆地上线 V4 Pro 正式版:同一个 API 名字,Agent 能力却从预览版的「基本不能打」跳到直逼 Anthropic 旗舰 Claude Fable 5,部分榜单实现反超。更狠的是价格,只有海外同级模型的一个零头。对开发者和 AI 创业者来说,旗舰智能体的入场费被再次打穿。唯一的问题是,官方的涨价预告已经挂出来了。

今天凌晨,DeepSeek 官网悄然更新,DeepSeek-V4-Pro 模型版本升级为 0813 正式版,开发者无需改动代码,调用 deepseek-v4-pro 即是最新模型。 新模型支持 100 万 token 上下文和最高 38.4 万 token 输出,思考模式默认开启,并兼容 OpenAI、Anthropic 及 Responses API 格式,Codex、Claude Code、OpenCode 等主流 Agent 工具可直接接入。消息同时登上 Hacker News 首页(700 余赞)和知乎热榜(超 2000 万热度),成为今天中英文 AI 圈的最大共识热点。

凌晨突袭:同一个 API 名字,昨天不会干的活今天能干了

这次更新的核心是 Agent 能力。 按官方公布的评测,V4 Pro 正式版在自家软件工程基准 DeepSWE 上的得分从预览版的 12.8 暴涨至 62.7;自然语言生成代码仓库的 NL2Repo 从 38.5 提至 61.5;全栈开发困难子集 DSBench-Hard 翻倍至 67.2。

用国内一家科技媒体实测后的说法:「同一个 API 名称,昨天基本还不会做的活儿,今天就可以跟全球第一梯队的代码 Agent 掰手腕了。」在爱范儿的实测中,面对「搜集近日科技新闻做一个仿传统媒体首页」这类模糊指令,V4 Pro 能自主拆解需求、分步执行,完成度相当高。Hacker News 上也有开发者晒出实战账单:拿它跑了一整天的交通模拟和分布式物理引擎优化,20 亿 token 花了约 12.5 美元,「找到了显著的性能提升,且没有引入任何新问题」。

安全攻防反超 Fable 5,但开源头把交椅还不是它

官方口径下,V4 Pro 在 AI 安全攻防基准 Cybergym 上拿到 83.3 分,反超 Claude Fable 5 的 83.1;工作流智能体 AutomationBench 同样实现超越;高难推理 HLE(启用工具)拿到 60.0,仅次于 Fable 5 的 63.0;终端操作 Terminal Bench 2.1 拿到 87.9,高于 Claude Opus 4.8 的 85.0。

但两点需要泼冷水。一是 它与月之暗面的 Kimi K3 仍有微弱差距(Terminal Bench 2.1 上 87.9 对 88.3),开源界的头把交椅还没换人。二是 第三方口径没有官方那么乐观:OpenRouter 援引 Artificial Analysis 的综合智能指数给它打了 45.3 分,「优于 70% 的模型」,与「追平 Fable 5」的官方叙事存在温差。官方跑分是自家 Harness 框架下测出来的,独立验证还需要时间。

3 元对 10 美元,旗舰 Agent 的「零头定价」

真正让对手难受的是价格。 V4 Pro 正式版维持预览版定价:每百万 token 缓存命中输入 0.025 元、未命中输入 3 元、输出 6 元。 作为对比,Kimi K3 的 API 价格是输入 3 美元、输出 15 美元;Claude Fable 5 是输入 10 美元、输出 50 美元。即使考虑币种差异,DeepSeek 也只是海外同级模型的一个零头。

OpenRouter 的数据显示,由于缓存命中率高达 86%,用户实际支付的加权输入价格低至每百万 token 0.064 美元。套用国内圈内的那句老话:DeepSeek 的秩序依然是「比我强的没我便宜,比我便宜的没我强」。

涨价预告已挂出,API 输出「话术生硬」遭吐槽

便宜可能是有期限的。 DeepSeek 在 8 月 6 日已预告将「近期整体上调 API 定价,涨幅较大」,并计划引入峰谷定价:北京时间每日 9 点到 12 点、14 点到 18 点的高峰时段,V4 Pro 未命中输入将从 3 元涨到 6 元,输出从 6 元涨到 12 元,直接翻倍。正式版发布至今尚未调价,等于给开发者留了一个心知肚明的窗口期。 另一个对冲信息是,DeepSeek 在预览版发布时承诺,下半年昇腾 950 超节点批量上市后会大幅下调 Pro 价格。涨与降之间的落差,取决于国产算力的到货节奏。

此外,X 上有开发者反映,V4 Pro 网页端与 API 调用的思维链表现存在明显差异,API 输出话术「读起来生硬、语序别扭」,DeepSeek 尚未回应。依赖 API 做产品的团队,上线前值得自己先测一轮。

旗舰 Agent 成本坍塌之后,下一个看点是 Harness

把这件事放进更大的图景:

就在本周,「从闭源模型 API 窃取推理痕迹」的研究刚引发过一轮讨论,闭源厂商的推理护城河被指出现裂缝。现在 DeepSeek 用「零头价格加第一梯队跑分」证明,能力差距本身也在被抹平。闭源旗舰剩下的定价权,又松了一分。

对 AI 应用创业者和关注算力链的投资者,更值得的伏笔藏在官方文档里。 DeepSeek 在 V4 Flash 更新日志中透露,其 Agent 运行框架 DeepSeek Harness 即将发布,招聘和官方公众号均已就位。行业共识是,当模型推理能力接近天花板,决定 Agent 上限的将是 Harness 这类「办公系统」。模型已经到位,框架如果兑现,下一个 DeepSeek 时刻不会太远。

免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下載

X

Telegram

Facebook

Reddit

複製鏈接