CyrilXBT
CyrilXBT|2026年09月10日 14:44
每个人分享的图表都缺少真实的故事 muse spark 1.3以75.4%的得分位居deepswe v1.1榜首。gpt-6阿斯特拉以74.1%的得票率落后半个百分点。双子座3.8闪光轨迹下降1.6点。克劳德寓言5.1在这张图表中排名最低,为67.4%。 这是图表没有显示的。astra在29个步骤中使用了3万个输出代币,达到了74.1%,约为每次6.52美元。双子座用143k个标记和166步在一个点内与阿斯特拉配对,几乎是相同分数的5倍。(没有人谈论步数。每个人都截图了百分比。) 在这个特定的图表中,三个点将最高分数与最低分数分开。三点不是故事。实际差距是在一个需要29步才能解决的模型和一个需要166步的模型之间。 寓言5.1在这里的67.4%也与它在其他地方的表现不符,它以66领先于阿斯特拉的61。一个基准图表是一个快照,而不是判断哪种模型实际上更适合您的特定工作负载。 还没有找到一个排行榜,告诉自己的全部故事。在信任屏幕截图之前,先运行自己的任务。
+4
曾提及
分享至:

脉络

热门快讯

APP下载

X

Telegram

Facebook

Reddit

复制链接

热门阅读