DeepSeek打破大模型「不可能三角」:更强、更快、还更便宜
律动BlockBeats|2026年09月10日 07:25
DeepSeek V4.1 Flash 这次几乎把整套架构都重做了一遍,想同时把能力做强、速度拉高、成本打下来。更强:模型有 5520 亿主干参数,还外挂了 1960 亿参数的 Engram 条件记忆。预训练用了 45T 多模态 Token,后训练则大量加入真实 Agent 任务、工具环境和失败案例。DeepSWE v1.1 跑到 74.2%,已经超过 Claude Opus 5 和 GPT-5.6 Sol。更快:新的 CED 架构把 40 层模型拆成前后两半。读取 Prompt 时每个 Token 只激活 80 亿参数,生成时也只有 160 亿。再加上 CSA2 跨层复用和 DSpark 投机解码,上下文从 4K 拉到 1M,长度扩大 256 倍,单 Token 解码计算量只增加约四分之一。更便宜:DeepSeek 把 KV Cache 继续往死里压。主缓存改成 FP4,再加跨层复用,每个 Token 的全局 KV 只剩 890 字节,约为 V4 Flash 的 1/4;长期放在 SSD 或内存里的缓存进一步降到约 1/8。V4.1 Flash 没有把「更强」简单等同于「算更多」。模型规模继续做大,但每次只动一小部分参数;上下文继续拉长,缓存却被压得更小。能力上去了,速度和成本也没被拖垮。[原文链接](动察 Beating AI 快)
分享至:
脉络
热门快讯
APP下载
X
Telegram
复制链接