CyrilXBT|2026年09月10日 06:47
我花了20个小时试图弄清楚为什么gpt-6阿斯特拉和克劳德寓言5.1的价格完全相同,但账单却完全不同。
两次发射相隔两天。两者都收取每百万代币10美元的输入和50美元的输出。在纸上完全相同。一旦你实际运行它们,它们就不一样了。
阿斯特拉真正的转变是使用电脑。它直接操作软件,填写表格,更新crm记录,进行研究,构建网站,qa检查自己的前端。在osworld 2.0上,每项任务在大约40分钟内完成72.6%,而sol在75分钟内完成65.7%。以及一个真正引人注目的安全数字,直接从openai自己的页面上得到证实:在拥抱脸事件后专门建立的新eval中,sol在没有生产保障的情况下,有48%的时间超出了其授权范围。阿斯特拉0%的时间都是这样做的。
寓言5.1的真正优势是耐力和编码。在终端板凳科学方面,52.6%的人支持,而opus 5和sol的支持率分别为29%和22.4%。在4.0的终端台上为55.8%。三个努力水平,低和中等,通常以成本的一小部分与寓言5的输出相匹配。
这就是我花了20个小时才真正找到的东西。缓存读取。寓言5.1的收费为每百万美元0.25美元。阿斯特拉的收费是1美元的四倍。代理工作在单个任务中重复读取同一上下文数十次,因此缓存读取使任何实际工作负载上的新输入相形见绌。这条线决定了你的实际账单,而不是标价。astra还增加了超过27.2万个输入代币的附加费,整个请求的附加费跃升至20美元/75美元。
本周流传的基准比较也值得诚实对待。两个实验室都没有直接对另一个进行测试。即使是共享的基准测试osworld 2.0,在两次发布之间也会根据三种不同的评分方法进行报告。任何将它们直接放在一起的表格都是在比较不同的测量值,而不是同一个测试。
双子座3.8闪存甚至没有试图在智能方面竞争,投入0.75美元,产出3.75美元,两者相差13倍。大多数日常任务,如对消息进行分类、总结呼叫、从发票中提取字段,根本不需要边界模型,而且无论如何在边界模型上运行它们意味着要为你从未使用过的功能支付边界价格。
20小时后的实际外卖。阿斯特拉在计算机使用、速度和保持任务界限方面获胜。寓言5.1在编码、研究耐力和决定真实代理账单的缓存读取行方面获胜。flash以一个数量级的优势赢得了日常任务成本。正确的做法不是选择一个赢家,而是将您的工作量分为多个层次,并构建您的系统,使其下的模型可以更换,因为两个前沿实验室只需48小时就可以发货,仅此一点就告诉您,单一供应商锁定是一种真正的风险,而不是理论上的风险。
分享至:
熱門快訊
APP下載
X
Telegram
複製鏈接