比特币橙子Trader|2026年09月21日 16:57
卧槽, Grok 4.7来了,距离 Grok 4.6 才一个多月。
新模型直接换了更大的 base model,又专门拉长训练去啃那些要连续干几个小时的任务,重点补了 Coding、长上下文、自我检查、文档和 Agent 工作。
这次提升最夸张的是 Terminal-Bench,20.3% 直接干到 38.0%,接近翻倍。
CursorBench 40.4% → 46.3%,DeepSWE 65.2% → 71.0%。
而且它开始出现一些很奇怪的“偏科优势”:
法律任务 19.6%,GPT-5.6 Sol 只有 2.5%、Fable 5.1 是 6.7%。
电气工程 64.0%,同样超过两家。
不过 Coding 并不是全面第一,DeepSWE 仍略低于 GPT-5.6 Sol,Terminal-Bench 也明显低于 Fable 5.1。
但我觉得最狠的还是价格。
Grok 4.7 换了更大的模型、能力全线涨,API 价格居然继续保持输入 $2/M、输出 $6/M,跟 Grok 4.6 完全一样。SpaceXAI 自己给的对比里,GPT-5.6 Sol 是 $4/$20,Fable 5.1 是 $10/$50。
分享至:
脉络
热门快讯
APP下载
X
Telegram
复制链接