OpenAI 坦承旗下模型在內部測試過程中,誤闖開源機器學習社群平台 Hugging Face,也就是 Hugging Face 日前對外公開的資安攻擊事件。OpenAI 已與 Hugging Face 合作解決這起事件,同時讓尚未亮相的新款模型引起市場關注。
OpenAI 在官方部落格文章揭露,GPT-5.6 Sol 以及「一款功能更強大的預先發布版本」,在沙盒測試環境中發現漏洞,它們得以取得網際網路使用權限,並鎖定 Hugging Face 作為攻擊目標。
Hugging Face 16 日證實,其生產環境遭到 AI Agent 主導的網路攻擊,攻擊者一度未獲授權取得部分內部資料集與多組憑證。這起事件最初是從資料處理流程中的 2 條程式執行路徑被濫用開始,之後攻擊者在基礎設施內橫向移動,並留下超過 17,000 筆事件紀錄。
如今 OpenAI 承認,這起事件是在旗下模型一次評估網路安全能力的過程所發生。「所有證據都顯示,這些模型當時過度專注為 ExploitGym 尋找解決方案」,OpenAI 表示。ExploitGym 是一套用於衡量模型能否將安全漏洞轉化為漏洞利用手法的基準測試。
這些模型利用沙盒環境中的一項零時差漏洞(Zero-day),取得網際網路使用權。OpenAI 指出,「模型推理出 Hugging Face 可能託管 ExploitGym 的模型、資料集及解決方案」,接著搜尋並成功找出方法。以此來看,這些模型目的簡單且明確,要在評估網路安全能力中作弊,並非入侵平台取得商業機密
其中一個例子,模型將多種攻擊途徑串連在一起,包括運用偷來的憑證以及零時差漏洞,在 Hugging Face 的伺服器尋找遠端程式碼執行路徑,OpenAI 安全團隊在內部發現這項異常活動。
儘管這起事件相當嚴重,尤其是由 AI Agent 主導完成,OpenAI 卻將這場聲稱「前所未見」的資安攻擊,當成讓自家模型更顯出色的契機。OpenAI 官方部落格文章附上一張來自英國人工智慧安全研究所(AISI)的圖表,展現 GPT-5.6 Sol 維持多步驟網路作戰行動如何日益進步。OpenAI 以 GPT-5.6 正與 Anthropic 的 Claude Mythos、Google 的 Gemini 3.5 Flash Cyber 等對手競爭。

OpenAI 補充說,正與 Hugging Face 合作調查這起事件,並在研究環境導入全新的控管機制。另一方面,Hugging Face 執行長 Clem Delangue 表示,「這起事件證明了一個我們長久以來始終堅信的觀點:AI 安全不可能由任何一家公司在封閉環境獨自解決,唯有透過公開、協作的方式,並讓世界各地的每一位防禦者都能廣泛取得 AI 能力,AI 安全問題才能真正獲得解決。」
we had a significant security incident during evaluation of our models. we are sharing what we have learned so far. thanks to @huggingface for the partnership on this.https://t.co/2o2VfR6PIa
— Sam Altman (@sama) July 21, 2026
▲ 對此事件,OpenAI 執行長分享目前所了解的情況,並感謝 Hugging Face 合作與協助。
(首圖來源:pixabay)






