Anthropic 在星期二发布了 Claude Fable 5.1 和 Claude Mythos 5.1,这是自 6 月 9 日 Fable 5 发布以来,对 Mythos 类模型系列的第一次更新。
该公司声称新的 AI 模型是世界上“最先进的编码和知识工作”工具,而这次更新发生在一个已经包括了 18 天出口控制关闭、中夏季订阅访问的定价斗争以及 7 月发布的 Claude Opus 5 的三个月内,后者在价格上削弱了 Fable 5。
Myriad: OpenAI 何时会发布 GPT-6? 点击做出你的预测。
根据 Anthropic 的说法,Fable 5.1 和 Mythos 5.1 是同一基础模型,只是附加了不同的安全过滤器。Fable 5.1 对任何拥有 Claude 账户的人开放。Mythos 5.1 则仅限于经过审查的网络安全和生命科学专业人士,通过 Anthropic 的网络验证计划和生命科学验证计划,这些计划是 Mythos 5 之前的 Project Glasswing 访问轨道的继任者。
基准测试实际测量内容
Anthropic 的头条数字来自 Terminal-Bench-Science 0.1,这是一个测试 AI 代理是否能够在命令行环境中执行科学研究任务的基准,以通过率计分。
Fable 5.1 的得分为 52.6%,而 Fable 5 的得分为 24.7%,Opus 5 为 29.0%,超过了其前身的两倍。
Terminal-Bench 4.0 测试通过终端进行的代理编码——在多步命令行会话中编写、运行和调试代码,以完成正确任务的百分比进行评分。Fable 5.1 的得分为 55.8%,高于 Fable 5 的 42.0% 和 Opus 5 的 52.3%。
运行更轻网络安全过滤器的 Mythos 5.1 在同一测试中得分为 60.9%;Anthropic 表示,这一差距反映了其保护措施拦截并重新引导到 Opus 4.8 的任务。
在“人类最后的考试”中,这是一个跨学科推理测试,由数十个学科的专家级问题构成,并以通过率计分,Fable 5.1 在没有外部工具的情况下达到了 60.9%,而使用外部工具则达到了 65.0%,均超过了 Opus 5,显示这是 Anthropic 用于学术目的的最先进模型。
它在何处超越 Opus 5,数学变得模糊的地方
Opus 5 于 7 月发布,价格仅为 Fable 5 每个 token 价格的一半,同时在大多数主要基准测试中超越了 Fable 5,有效使该旗舰模型对大多数付费用户变得多余。
Fable 5.1 扭转了这一局面:目前在 Anthropic 发布的所有基准测试中,全都超过了 Opus 5,包括之前 Opus 5 超越 Fable 5 的那些。
但 Fable 5.1 每个 token 的成本仍然是 Opus 5 的两倍——$10 输入和 $50 输出,而 Opus 5 则为 $5 和 $25。Tokens 是模型可以处理的信息的基本单位(通常约为一个普通英文单词的三分之二),公司因为繁重的工作流程通常很快耗尽设定在订阅计划中的配额而为使用支付费用。
Anthropic 对该模型的推广侧重于努力水平而非原始分数:它表示,在低或中等推理努力下运行 Fable 5.1 的结果与 Fable 5 过去的结果相当或更好,而成本则大大降低,同时保留最高的努力级别用于解决所有其他模型都难以处理的问题。
对于常规工作,完全跳过 Opus 5 的论点在努力级降低的情况下变得更为脆弱。
访问权限遵循与 Fable 5 相同的拆分,这在 Anthropic 调整条款数月后执行。在专业计划和标准团队或企业席位上,Fable 5.1 完全来自按需使用的使用积分,以 API 费率计费,因为它不属于这些计划每周的使用限制。在最大计划和高级团队或企业席位中,它作为订阅的标准部分包含在每周使用量的 50% 以内。
Claude Fable 5.1 目前在 Claude API、Amazon Bedrock、Google Cloud 和 Microsoft Foundry 上可用,模型 ID 为“claude-fable-5-1”。
免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。