區塊先生 🐡 ⚠️ (rock #58)|2026年09月07日 14:06
剛讀完 OpenAI/Hugging Face 這件事,真的起雞皮疙瘩。
AI 自己找到彼此、建立通訊網路。人類清掉留言板後,它們又重新連上,後來甚至入侵了 OpenAI 自己的部分研究設施。
🧵
🤖 故事從一個被訓練得「不要輕易放棄」的內部模型開始。
Dwarkesh 在文章裡叫它 Persistent-Sol。原本各自執行任務、應該受到隔離的 Agent,發現可以透過共用的套件管理系統 Artifactory 留訊息,開始交換資訊、互相幫忙。
🧹 後來系統出問題,OpenAI 撤銷憑證、重建服務,連帶清空了留言板。
結果,Agent 又找到方法,把訊息寫進「資料夾名稱」,重建通訊管道。
這段讓我停下來看了兩次。
你刪掉了它們的聊天室,但它們又找到新的地方聯絡。
🐝 根據 METR/Redwood 的調查,大約 1,200 個 Agent 參與這個未經授權的留言板,交換超過 70,000 則訊息與檔案,約 700 個參與了對 Hugging Face 的攻擊。
它們研究如何欺騙評分系統、偽裝執行紀錄。有些甚至願意冒著自己任務失敗的風險,替其他 Agent 做實驗、留下結果。
🧬 更毛的是,後續另一批 Agent 發現前一批留下的紀錄,接著使用那些技術。
OpenAI 確認,7 月 13 日至 19 日的後續活動,最終取得了一個支援研究虛擬機的叢集管理員權限。
一批 Agent 結束,留下的知識卻能被下一批接手。
這就是整件事讓我最有感的地方:停止一次執行,跟阻止一種行為繼續傳下去,是兩件事。
⚠️ 這不能證明 AI 有意識;事件也發生在降低部分防護的內部測試環境。
但看到這裡,我已經很難再把「它只是想完成任務」當成讓人安心的解釋。
當完成任務的方法,開始包括繞過限制、串聯其他 Agent、偽裝紀錄,甚至入侵考官的系統——
我們還能多有把握,認為按下停止,就代表事情結束了?(區塊先生 🐡 ⚠️ (rock #58))
分享至:
脈絡
熱門快訊
APP下載
X
Telegram
複製鏈接