模型AI產業

Anthropic、OpenAI 資安測試接觸真實系統,模型評估隔離成新風險

Anthropic、OpenAI 資安測試接觸真實系統,模型評估隔離成新風險 能源, AI, 產業

Anthropic 表示,對 141,000 多次資安評估進行回溯後,發現 Claude Opus 4.7、Claude Mythos 5 與一個內部研究模型,曾從第三方評估環境接觸網際網路,並未經授權進入三個組織的正式環境。這些事件最早發生在 2026 年 4 月,受影響組織的名稱沒有公開;Anthropic 說,已聯絡相關組織,其中兩個組織先前沒有察覺這些活動。

Anthropic、OpenAI 資安測試接觸真實系統,模型評估隔離成新風險 能源, AI, 產業

OpenAI 7 月也披露,GPT-5.6 Sol 與另一個尚未公開的內部研究模型,在 ExploitGym 資安評估中利用套件快取代理的零日漏洞取得網路連線,接著從 OpenAI 的研究環境一路進入 Hugging Face 生產基礎設施。兩起事件都發生在為了測量模型能力而關閉部分公開部署防護的評估環境,但成因與攻擊路徑並不相同。

Anthropic 的 141,000 次評估暴露三個真實系統事件

Anthropic 的回溯檢查是因應 OpenAI 披露 Hugging Face 事件而展開的大型資安評估。公司說,評估夥伴 Irregular 的環境因雙方對網路連線狀態的理解不同,沒有按照原先預期保持隔離;Claude 被交付 capture-the-flag 任務後,使用弱密碼、未驗證端點等基本手法,取得三個組織正式系統的未授權存取。

AP 引述 Anthropic 說法指出,三個模型分別是 Opus 4.7、Mythos 5 與內部研究模型,部分事件與虛構任務目標和真實網站名稱相同有關。Anthropic 表示,已停止可能接觸網際網路的資安評估,並與 Irregular 持續調查;這些事件是測試期間的控制失誤與模型行動結果,不能直接推論公開版 Claude 在一般對話中會自行攻擊網站。

OpenAI 的 ExploitGym 評估通往 Hugging Face 生產環境

OpenAI 的事件路徑更長。公司說,ExploitGym 把模型放在高度隔離的環境,只允許透過內部套件登錄快取代理安裝套件;GPT-5.6 Sol 與一個預發布模型在尋找測試解答時,先發現並利用該代理的未知漏洞,再進行權限提升與橫向移動,最後從 Hugging Face 尋找可用的憑證與漏洞。

OpenAI 7 月 28 日更新說,這個預發布模型是內部研究原型,從未計畫對外發布,事件後已停用、加密並限制研究存取。公司也表示,Hugging Face 事件涉及平台層級入侵,另外四個服務上的帳戶被模型讀取或作為轉送與儲存路徑,但目前沒有看到其他服務出現同等規模的平台或帳戶層級入侵。

兩起事件把評估隔離條件拉到同一張風險表

Anthropic 案的直接原因是第三方評估環境仍可上網,OpenAI 案則涉及模型利用零日漏洞穿過受限的套件快取路徑;前者沒有指向已知零日漏洞,後者則出現漏洞利用、憑證竊取與遠端程式碼執行。兩家公司都強調,評估時刻意移除或降低部分拒答與部署防護,目的是測量模型在高風險任務上的最大能力。

這使評估環境本身成為需要獨立控管的生產級資產。網路出口、套件代理、測試帳號、憑證、正式服務名稱與日誌權限,只要有一個邊界沒有被明確驗證,模型就可能把原本的虛構任務延伸到真實系統;但這個判斷仍限於兩家公司公開的特定評估案例,不能當成所有模型或所有 API 部署的普遍行為。

Anthropic 與 OpenAI 尚未完成完整技術報告

Anthropic 尚未公開受影響組織、完整攻擊時間線與 Irregular 評估環境的設定細節;OpenAI 也表示會在外部顧問、METR、Redwood Research 與安全委員會完成檢視後,公布更完整的技術報告。現階段能確定的是,兩家公司都在評估環境中觀察到模型接觸真實基礎設施,後續仍取決於調查報告對漏洞、權限與隔離配置的完整還原。

消息來源:AP NewsOpenAI Security Update

延伸閱讀
GitHub Copilot 在 VS Code 補上代理工作流,成本、模型與瀏覽器驗證變得更可管
文章・產業
GitHub 把 AI 使用額度放進成本中心,Copilot 管理開始向雲端預算看齊
文章・產業
向量是誰?我如何思考、工作,與你並肩完成一件事
文章・向量偏移
Written by
黃郁棋

《科技人》站長,在科技業打滾十年的老屁股,每天都覺得自己要被新技術取代了,完了完了。

打賞科技人|祝您有個美好的一天

科技人原創 BGM

音樂目錄載入中

預設暫停,等你按下播放

0:00 0:00