Colin Wu|2026年08月12日 10:15
财经杂志进行的测试显示:
财报统计等日常办公任务中, DeepSeek-V4-Flash(正式版)成本只有 Claude Opus 5 的不到 3%
但速度方面,海外模型明显更快。Claude Opus 5 平均耗时3分36秒,GPT-5.6 Sol平均耗时4分33秒,GPT-5.5平均耗时5分49秒。
Kimi K3平均耗时10分29秒,Qwen 3.8-Max(正式版)18分46秒,DeepSeek-V4-Flash(正式版)20分44秒,Qwen 3.8-Max(预览版)25分45秒。
具体任务是:阅读谷歌2020年-2025年的24份财报,统计2021年-2025年20个季度的10个财务指标共200个数据,并生成表格。
对18款模型分别进行了两轮测试,每轮每款模型独立执行3次,共完成108次任务。所有测试任务均采用串行方式逐一执行。
全文
https://mp.weixin.qq.com/s/8nmE9mNimSS46JpEHn6ibA(Colin Wu)
分享至:
脉络
热门快讯
APP下载
X
Telegram
复制链接