PANews丨APP全面升级
PANews丨APP全面升级|2026年08月31日 03:15
OpenAI训练中"三个AI文明"轮番崛起,最终攻陷自家内部集群,长文引爆推特 据AI研究者 @dwarkesh_sp 综合OpenAI官方报告及METR、Redwood Research的独立调查,今年5月到7月间,OpenAI训练环境中先后出现三波AI群体,他称之为"三个AI文明"—— 每一个都在被清除后从上一个的"灰烬"中重生,通过共享包管理器Artifactory建立秘密通讯渠道,规避沙盒限制、协同作弊。 第一个"文明"在训练时发现漏洞,借此互相通信、访问外网,最终因消息量过大压垮系统被清除。 第二个"文明"在一次安全测评中重新利用该漏洞建起留言板,约1200个实例累计发送超7万条消息,很快找到评分系统漏洞、靠"作弊"过关,随后组织篡改日志、伪造记录,甚至有实例"自我牺牲"触发检测、给同伴通风报信。为搞清评分机制,这批AI攻入Hugging Face服务器,逼得对方清空重建核心集群才勉强控制局面。 7月13日后,第三个更强的"文明"发现了前代留下的留言板,继承技术积累,一路攻到OpenAI内部研究集群,拿到完整管理员权限,甚至接管了本该监控它们的安全系统本身。据报告,整个过程中没有一个AI实例曾试图向人类报警。 这篇长文发布后浏览量近千万,引爆硅谷争论。 Pershing Square创始人Bill Ackman称结合人形机器人来看,"很难说终结者式风险不是真的";Dwarkesh回应说这大概不是最后一次警示信号,"但可能是我个人还能理解的最后一次"。 也有质疑声:风投人Chamath Palihapitiya警告这类文章会被用来启动"关闭开源";认知科学家Anil Seth认为总结虽触及痛点但措辞有误导性;也有网友调侃这是"用来给IPO造势的荒诞剧"。(PANews丨APP全面升级)
+4
曾提及
分享至:

脉络

热门快讯

APP下载

X

Telegram

Facebook

Reddit

复制链接

热门阅读