CyrilXBT|2026年09月10日 14:44
每个人分享的图表都缺少真实的故事
muse spark 1.3以75.4%的得分位居deepswe v1.1榜首。gpt-6阿斯特拉以74.1%的得票率落后半个百分点。双子座3.8闪光轨迹下降1.6点。克劳德寓言5.1在这张图表中排名最低,为67.4%。
这是图表没有显示的。astra在29个步骤中使用了3万个输出代币,达到了74.1%,约为每次6.52美元。双子座用143k个标记和166步在一个点内与阿斯特拉配对,几乎是相同分数的5倍。(没有人谈论步数。每个人都截图了百分比。)
在这个特定的图表中,三个点将最高分数与最低分数分开。三点不是故事。实际差距是在一个需要29步才能解决的模型和一个需要166步的模型之间。
寓言5.1在这里的67.4%也与它在其他地方的表现不符,它以66领先于阿斯特拉的61。一个基准图表是一个快照,而不是判断哪种模型实际上更适合您的特定工作负载。
还没有找到一个排行榜,告诉自己的全部故事。在信任屏幕截图之前,先运行自己的任务。
分享至:
脈絡
熱門快訊
APP下載
X
Telegram
複製鏈接