比特币橙子Trader|2026年08月15日 02:32
DeepSeek V4 Pro 上线两天,我把现在所有争议重新整理了一遍,基本就这些🧐
DeepSeek V4 Pro 0813 发布以后,网上已经快吵成两个模型了。一边是官方非常夸张的 Agent 跑分,另一边是大量开发者说根本不是这个体感。
1、发布过程很混乱
8 月 12 日晚,API 文档和模型版本先发生变化。
8 月 13 日 DeepSeek 才正式宣布 V4 Pro GA。
中间官网横幅、公告还出现过撤回、重新上线的情况,但 DeepSeek 到现在都没有解释这段过程到底发生了什么。
更敏感的是价格也跟着变了。新价格 8 月 17 日生效,引入峰谷定价,V4 Pro 高峰输出价格达到 $3.96/百万 Token。也就是说,用户一边还在判断正式版到底强了多少,另一边已经先面对明显涨价。
2、官方跑分和大量用户体感对不上
这是目前争议最大的地方。
官方给 V4 Pro 的 Agent 数据非常漂亮:DeepSWE 62.7、CyberGym 83.3,Terminal Bench 等任务也进入头部水平。
但第三方 Artificial Analysis 给 0813 Max 的综合 Intelligence Index 是 53,没有出现同等级别的碾压式升级。
而社区最近两天最密集的反馈,集中在几个问题:
复杂任务思考过短、Agent 提前结束、长任务执行不稳定。
有时候甚至感觉不如 Flash,同一个 Prompt 换时间、换会话以后结果差距很大。
3、V4 Pro 可能极度依赖 Harness / Scaffold
这个是我觉得最值得关注的地方。
DeepSeek 自己其实已经公开承认,在部分 Code Agent benchmark 中使用过 DeepSeek Harness 的 Minimal 模式。
这个模式不是简单换个 Prompt,而是把 System Prompt、工具数量、Tool Schema、上下文压缩方式等,都尽量做成模型强化学习阶段熟悉的 Agent 环境。
社区随后在 V4 Pro 0813 上做了一些很有意思的实验。
同一个任务,DSH Standard / PTC 大约 91–92 分,换成 Minimal 后能到 96–99。
更夸张的是 Anchored Standard,第一轮先用 Minimal 把模型带进去,第一次 Tool Call 后再恢复完整工具,两次还能跑到 98–99。
这组测试规模还不足以证明所有任务都这样,但它至少暴露了一个问题:
V4 Pro 的能力可能不是固定的 90 分或者 60 分,而是非常吃你怎么把它架起来。
4、最火的API 后面有多个模型
社区有人怀疑 deepseek-v4-pro 这个 API 后面其实在路由多个 checkpoint。
原因是有人发现,换 IP、新建会话以后,模型的思考方式会出现不同指纹:
有的疯狂写 Let me…,有的习惯 The user wants me…,还有一种大量使用 we,同时能力明显更强,于是有大家它们叫成 Preview 版、Flash 版和神版。
这个说法传播非常快,但目前没有任何官方证据证明 DeepSeek 在一个模型名后面偷偷切换多个 checkpoint。
现在更有解释力的可能是两层东西叠加:服务端灰度/集群配置存在差异,同时 V4 Pro 又对第一轮 System Prompt、Tool Schema 和 Agent Scaffold 极其敏感。
于是用户看到的效果,就像“随机抽模型”。(比特币橙子Trader)
分享至:
脈絡
熱門快訊
APP下載
X
Telegram
複製鏈接