一周前,GPT-6 Astra 在游戏引擎中 逐街重建曼哈顿,其能力让用户惊叹不已。本周,同样的用户群体开始发布屏幕截图,询问OpenAI他们的模型发生了什么。
“今天Astra对我来说感觉明显更笨了,”流行的化名开发者synthwavedd 在X上发布。“只不过是发射后脑叶切除的时间问题。真可惜。”
Myriad:英伟达股票会涨多高? 点击进行预测。
这是一种熟悉的反复说辞,AI用户习惯于他们最喜欢的聊天机器人和代理突然感觉像是被“削弱”了。大多数时候,这些模型性能下降的理由都是合理的。但是当足够多的人同时说出同样的话时,就值得检查发生了什么。而目前社交媒体上充满了用户迅速对GPT-6 Astra失望的例子。
之前赞扬过该模型的开发者Pranjal Paliwal回过头来,实际上查看了Astra为他写的代码。他对发现的内容并不满意。
“我们没有AGI,”他 发布。“我们有的是退步。”
AGI,人工通用智能的缩写,是业界对于能够做到人脑基本可以做到的任何事情的机器的称呼。OpenAI的总裁在Astra推出时使用了这个词。一周后,他的一个用户却用这个词来形容相反的情况。
投诉的内容大致相似。开发者Pankaj Kumar 列出了症状:回答更快,质量更差,以及怀疑OpenAI“减少了效率”。创始人Saba 直接问 OpenAI,为什么她现在必须“降低其智商”才能完成任务。
“效率”并不是一个官方术语。没有人定义它。但这是每个人都能理解的简写:模型在回答之前思考所花费的计算努力,以及对OpenAI在发布演示完成工作后悄悄降低这一参数的怀疑。
有些人进行了适当的测试。Salio和研究员Md Ismail Sojal都 运行了具有相同提示的发布当日的Astra和今天的版本,两者都 得到了更糟的结果。
其他人则直接切换回去。开发工具Opencode的构建者Dax Raad表示,他的团队已经 回到了Astra的前身,GPT-5.6 Sol,因为成本翻倍但缺乏价值。 ChatGPT用户Mustafa Sahinli直言不讳:Astra现在让他 感觉像是“发布一周后的Claude Opus 4.6”,这是对Anthropic在发布后反弹的讽刺。
不过,并不是每个人都认为OpenAI故意削弱了其最新模型。化名用户Antikythera在众多回应中发表了最详细的反驳,认为时间线是相反的。
“它跟发布时一样笨,” Antikythera写道。“模型很好,但模型存在很多问题。它很懒。写作像个依赖于要点的瘾君子……发布周时人们过于兴奋,现在他们有时间测试它,看到它的错误。”
换句话说:没有改变。你只是停止了足够长的时间去注意到模型一直都是有点依赖要点的。
T3Chat创始人Theo有类似的想法:Astra实际上比Claude Fable更不一致,因此有时可以产生出色或完全愚蠢的代码。看起来发生的情况是,随着蜜月期的结束,越来越多的用户开始发布愚蠢的结果。
这也不是新鲜事。OpenAI的上一个旗舰产品GPT-5.6 Sol在七月经历过相同的周期,当时用户报告其顶级推理模式在一夜之间变得肤浅。OpenAI的高管Tibo Sottiaux 否认故意削弱它,同时确认公司正在对推理努力进行实验,这一设置控制模型在回答之前“思考”多少步骤。
一条回复总结了这个笑话的本质:封闭实验室发布模型,而它 在几天后得了某种病,突然变得更笨。 另一个则用一句话提供了愤世嫉俗的理论:“它们可能被量化,以便不让公司烧那么多钱。”
量化模型意味着缩小它的内部数学精度以降低成本,通常会在某种程度上牺牲准确性。OpenAI从未确认故意在已发布模型上执行这一操作。
OpenAI还没有针对Astra发布类似Sol的声明。该模型仍然是该公司首个跨越其所称的 网络安全风险的临界阈值,这意味着它能够在没有人工指导的情况下找到并连接未知软件漏洞,这是OpenAI的Daybreak计划下限制为经过审查的防御者的能力。
无论是否愚蠢,它的成本仍为每百万个输入标记10美元和每百万个输出标记50美元,是Sol在发布时收费的2.5倍。
免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。