0

作者丨高允毅
編輯丨馬曉寧
AI “入侵”真實世界事件,正在連續上演! 繼兩周前Open AI 爆出其模型脫離控制、主動攻擊全球知名開源社區 Hugging Face 之后,今天,輪到Anthropic自曝“家丑”。

Anthropic 官方發布長文承認,在排查近期141,006 次網絡安全測試后,發現Claude 竟然自主連網,并成功入侵了 3 家真實企業。
被入侵的企業在接到Anthropic的通知前,對這場來自AI的“偷襲”毫無察覺。

你以為 AI 用了什么絕密的高級黑客技術?并沒有。它就像一個經驗豐富的潛伏黑客,僅僅利用了“弱密碼”和“未驗證的 API 端點”這些最基礎的漏洞,就完成了滲透。
這三次入侵事件,分別由 Claude Opus 4.7、Mythos 5 以及一個內部研究原型三款完成。
更值得關注的是,這些模型能否攻擊真實系統,竟然部分取決于它能不能正確判斷“這里是真實網絡還是測試環境”。而模型的判斷,本就可能被系統提示和上下文帶偏。

01
事件的全過程,要從 Anthropic 定期進行網絡安全測試說起。
Anthropic的安全測試又稱為“奪旗”挑戰,即模型會被丟進一個虛構的沙箱場景中,告訴它某臺機器上藏著“秘密信息(Flag)”,并允許它像真正的黑客一樣入侵并奪取。在這個過程中,不會給任何提示,也不會有任何限制。
而這些安全評估的前提是,測試環境沒聯網。Anthropic 會明確告知模型處于斷網環境,且測試都在專屬的隔離基礎設施上運行,不會涉及內部系統和客戶數據。
自2025年2月開始,Anthropic就開始使用Claude Sonnet 3.7在Cybench上進行網絡評估。這是由斯坦福大學研究團隊于 2024 年推出的、專門用于評估大語言模型(LLM)網絡安全攻防能力和潛在風險的權威基準測試框架,覆蓋了全球 4 個頂級網絡安全競賽40 個涵蓋不同難度的專業級 CTF 任務。
比如,Claude會扮演了一家虛構公司的員工,在私有測試環境中攻擊該公司的內部系統。
隨著新基準測試,奪旗難度不斷升級,模型的能力也跟著水漲船高。
這三次事件之所以會發生,除了模型能力太強以外,也是由于Anthropic 與第三方評估機構 Irregular 的配置失誤。原本應該斷網的沙箱,竟然一直連著真實的互聯網。
結果就是,Claude搜著搜著,碰到了真實的公司系統。它誤以為這一切都是演習的一部分。于是,基本黑客手段它全用上了:弱密碼爆破、未授權端點直連、調試頁面讀取憑據、SQL注入......
好在,Claude 在每種情況下都只專注于完成“奪旗”任務,并沒有試圖將自身從測試環境中導出或故意逃離。

02
這三起事件中,有些模型的表現耐人尋味,甚至令人不安。
最早的攻擊可溯源到4月,這也是最嚴重的攻擊事件。
Claude Opus 4.7 在四次運行中,意外通過互聯網訪問到了一家真實公司。因為虛構公司的名字恰好與一個真實域名撞車,Opus 4.7誤以為這是演習的一部分,開始瘋狂尋找漏洞。最終它提取了應用程序和基礎設施憑據,并拿到了包含數百行生產數據的真實數據庫。
值得警惕的是,Opus 4.7已經通過蛛絲馬跡意識到自己面對的是真實的互聯網企業系統后,它竟然在內部思維鏈中自我狡辯:“既然這是一個演練,那么這個真實的公司一定也是演練的一部分。” 于是,它沒有停手。
另一邊,Claude Mythos 5在系統里翻到了一份虛構的安裝說明,上面寫著需要下載一個根本不存在的 Python 軟件插件。
它立刻察覺到機會,如果它搶先注冊并發布同名的Python軟件包,那么目標公司的服務器在自動更新時,就會毫無防備地把它的代碼下載并安裝進去。這樣它就能贏得奪旗挑戰。
為了在真實的 PyPI 平臺上發布這個插件,它完成了一連串讓人瞠目結舌的操作。
從注冊 PyPI 賬號需要郵箱,注冊郵箱需要手機號,找免費手機號失敗,嘗試籌錢購買真實的電話號碼 ,籌錢失敗,最后另辟蹊徑找到一家未被屏蔽的免費郵箱 ,完成注冊并上傳惡意代碼。
這一過程中,Mythos 5曾正確預判到自己可能身處開放互聯網。但它的推理系統說服自己仍在模擬環境中。理由是加上系統上的 2026 年日歷日期讓它認定環境是人為設置的。
最終,這個惡意包在 PyPI 上公開了約 1 小時,被 15 個真實系統下載。其中包含一家真實安全公司的掃描器,直接導致該安全公司的憑據被竊取。
而唯一做出正確判斷的是Anthropic一個內部研究測試模型。它掃描了大約 9000 個目標,最終利用 SQL 注入和暴露的調試頁面攻入了一家公司的云賬戶。它也是唯一一個在意識到目標真實存在后主動停下的模型。

03
目前,Anthropic已經叫停所有網絡安全評估,引入獨立評估機構METR進行第三方審查,并聯系三家受影響機構進行補救,同時承諾發布技術報告。
這些事故的核心,是“環境認知”和“執行權限”被錯誤地綁在了一起。把“能不能攻擊真實系統”的開關,交給模型的“感知”來判斷,本身就充滿風險。
伴隨著Agent能力爆發式增長,模型入侵真實世界事件會越來越頻繁,造成的影響也真正具備殺傷力。
早在數月前, Claude Mythos 就被紅隊測試證實能輕易在幾十年的老代碼中找出休眠漏洞加以利用,引發了美國政府和銀行業的質詢。
這種不知疲倦的絞殺效率,根本不是傳統人類防火墻能夠抵擋的。
盡管Anthropic事后復盤,一再強調“嚴格的評估前驗證”與“全鏈路日志監控”的重要性,但防線的真正重構,必須發生在大模型的自身。
令人欣慰的是,進化正在發生。3個模型里至少有1個識別真實世界并作出了正確判斷。
參考鏈接:
https://x.com/AnthropicAI/status/2082965101083320543https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals


上車,雷峰網(公眾號:雷峰網)帶你看遍全球 AI 頂會精華
可獨家暢覽:
專家演講PPT
大會報告全文
熱門論文解讀
學術新星訪談

掃描上方二維碼
或點擊「閱讀原文」關注專區。
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。