DeepSeek的新模型在设计上几乎匹配了GPT-6 Astra,成本仅为1.4%。

CN
Decrypt
关注
48分钟前


OpenDesign,基于基准网站 OpenDesign Arena 的公司,本周通过相同批次的设计任务运行了 13 个 AI 模型。得分最高的是 OpenAI 的 GPT-6 Astra。但 DeepSeek 最新的模型 V4.1 Flash 达到了该最高分的 98%,而价格仅为最高价格的约 1.4%。


OpenDesign Arena 对模型在日常设计工作中的表现进行评分——构建网页应用程序、仪表板、移动屏幕和落地页——满分为 100 分。其中 30 分用以检查输出是否实际满足任务要求;另外 70 分则根据布局、层级、颜色和风格契合度来评估设计质量。



Myriad:九月份英伟达的交易价格会有多高? 点击做出你的预测

它的设计旨在回答一个比大多数 AI 排行榜更狭窄的问题:工作中的网页设计师明天究竟应该使用哪个模型。


在这个评分体系中,GPT-6 Astra 的平均得分为 82.7 分,完成一个设计的时间为 11.1 分钟,成本为 1.61 美元。DeepSeek V4.1 Flash 得分为 81.2,完成任务的时间为 5.3 分钟,成本为 0.023 美元。Claude Fable 5.1 的得分为 80.3,耗时 12.8 分钟,成本为 3.66 美元。




OpenDesign 测试的其他所有模型——其中包括 Grok 4.6、Qwen 3.8-Max、Kimi K3、GLM-5.3 Flash 和 Gemini 3.8 Flash——得分均低于 DeepSeek V4.1 Flash,并且运行成本更高。这是 13 个测试模型中 11 个。只有 GPT-6 Astra 完全超过了它,且仅多了 1.5 分。


DeepSeek 对 V4.1 Flash 的技术报告解释了节省成本的来源。该模型总共包含 5520 亿个参数——模型在训练过程中调整的内部设置,用于存储所学的内容——但仅唤醒 80 亿个参数来读取输入提示,并唤醒 160 亿个来写入响应。DeepSeek 将此称为因果编码器-解码器设计,这也是该模型快速完成时间的原因。


这不是 DeepSeek 首次以低廉成本缩小能力差距。几周前,该公司的 V4 Pro 模型在另一项基准比较中实现了 距离 Claude Fable 5 仅 5% 的成绩,但收费仅为 Fable 价格的一小部分。DeepSeek 还在北京招募工程师,力求构建自己的 代码工具,希望掌握完整的代理堆栈,而不仅仅是提供底层模型。


OpenDesign 的测试设置限制了这些数字能够证明的内容。模型的输出只有在首先渲染为有效网页时才会评分;任何空白、损坏或截断的输出得分为零,并且不会重新测试。这意味着该基准测量的是可靠的、日常的设计输出,而不是一般推理或编码技能。


GPT-6 Astra 于 9 月 3 日发布,已因其能够处理各种任务而积累了一定声誉——从布局电路板、草拟税务申报,到构建 3D 场景——但早期测试者指出,它的写作能力弱于其替代的模型。它在 OpenDesign 排行榜上的价格和速度符合这种通才设计:比 DeepSeek 更便宜的入门款慢且价格高,但仍是该领域得分最高者。


DeepSeek V4.1 Flash 的交付率——OpenDesign 认为可以在不修改的情况下交付的输出比例——为 57.7%。GPT-6 Astra 的交付率为 60%。Claude Fable 5.1 的交付率为 56.7%。


免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接