OpenAI推出GPT-6,太阳和月亮在Anthropic发布Claude Opus 5.5后几分钟内。

CN
Decrypt
关注
35分钟前

开放AI在周二发布了两个新模型,GPT-6 Sol 和 GPT-6 Luna。这发生在 Anthropic推出 Claude Opus 5.5,其自己的新旗舰产品之后的几分钟。


Sol 和 Luna 位于 GPT-6 Astra 之下,这个模型在9月3日发布时被开放AI称为“世界上最智能和一致的模型”。Astra 仍然是开放AI处理最困难工作的首选;Sol 和 Luna 是为日常工作构建的更便宜、更快速的选择。



Myriad:下一个上市的公司将是谁? 点击预测

因此,这与 Anthropic 应用的策略非常相似。Astra 相当于 Fable,Sol 相当于 Opus,Terra 相当于 Sonnet,Luna 相当于 Haiku(在升级后)。


开放AI还调整了价格以保持竞争力。这两个模型的 API 成本相比于 GPT-5.6 的促销费率每个代币降低了 50%。代币是模型读取和写作的文本块,通常比一个完整单词少一点,公司按百万支付,因为这就是 AI 费用在大规模时如何累积的。



Sol 现在每百万输入代币的费用为 2 美元,每百万输出代币的费用为 10 美元,之前分别为 4 美元和 20 美元。Luna 降至 0.10 美元和 0.50 美元,之前分别为 0.20 美元和 1.20 美元。总体来说,与 Anthropic 相比,开放AI 是每个层级中更便宜的选择。




性能案例依赖于 AutomationBench,这是 Zapier 构建的基准测试,测试 AI 代理是否能够使用覆盖销售、营销、运营、支持、财务和人力资源的 47 种工具来执行完整的商业工作流程,以通过及格率进行评分。GPT-6 Sol 在最高推理设置下的得分为 33.2%,每个任务花费 0.27 美元。


根据开放AI自己的数据,Claude Opus 5 在其最高设置下得分为 26.9%,但每个任务的费用超过了 11 倍。GPT-6 Sol 也在相同测试中超越了 Anthropic 的更昂贵旗舰 Claude Fable 5.1。




在 Agents' Last Exam 中,该考试评估 AI 代理在 55 个子行业中进行长期、经济有价值的工作,并将结果按完成百分比评分,GPT-6 Sol 在其最高努力下的得分为 56.4%。开放AI表示,这超过了 Claude Opus 5 的最佳得分,其每任务的成本低 60%。


推理努力是开放AI添加的一个旋钮:调高它,模型在回答之前会花更多时间和计算能力进行自我检查,这通常会同时提高准确性和成本。


对于计算机使用——AI 代理像人一样点击、输入和导航软件——在 OSWorld 2.0 中 GPT-6 Sol 几乎与 Claude Opus 5 的中等努力得分平分秋色,得分为 60.5% 对 60.3%,且成本约低 80%。OSWorld 测试长时间的现实计算任务,并根据完成工作的正确程度报告部分得分。


GPT-6 Sol 和 Luna 现在在 ChatGPT Work 和 Codex 中为 Plus、Pro、Business、Enterprise 和 Edu 订阅者提供,Luna 还通过桌面应用程序覆盖免费和 Go 用户。


这两个模型还未在普通的 ChatGPT 应用中发布,开放AI表示正在逐步推出两者,以保持服务稳定。


免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接