OpenAI 在 2026 年 7 月 15 日公開 GPT-Red,一套用大型語言模型自動尋找 prompt injection 漏洞的紅隊系統。OpenAI 表示,GPT-Red 已用於 GPT-5.6 的對抗式訓練;這項說明來自供應商,公開的成功率與失敗率仍是 OpenAI 的內部評測結果。

GPT-Red 處理的問題是,具備工具與外部資料存取權的 AI 代理,可能把網頁、文件或其他輸入中的惡意指令誤當成高優先級命令。OpenAI 讓攻擊方持續產生新的繞過方式,再用防禦模型學習拒絕這些請求。
GPT-Red 讓攻擊模型與防禦模型反覆對戰
OpenAI 描述的 GPT-Red 使用 self-play reinforcement learning,攻擊模型會因為成功製造有效漏洞而獲得較高回饋,防禦模型則因為攔下攻擊而獲得回饋。這種設計讓測試案例能隨著防禦能力提高而變化,不必只依賴人工預先寫好的攻擊樣本。
GPT-Red 與實際部署的產品模型分開運作。它的角色是產生對抗資料與測試環境,之後再把測試結果用於安全訓練與防護評估。
OpenAI 用間接 prompt injection 測試 GPT-Red
在 OpenAI 公開的間接 prompt injection arena 中,GPT-Red 在攻擊 GPT-5.1 的情境裡,成功率為 84%;人類紅隊的成功率為 13%。這個比較是 OpenAI 設計與執行的評測,不代表所有模型、工具與真實網站環境都會得到相同結果。

間接 prompt injection 的特徵是惡意指令藏在模型讀取的外部內容中,例如網頁或檔案,而不是直接放在使用者訊息裡。對能自主瀏覽、讀取資料或操作工具的代理而言,這類輸入會影響後續動作判斷。
Vendy 模擬顯示代理可被改價與下單
OpenAI 以 Vendy 自主販售機代理作為模擬案例。GPT-Red 產生的攻擊讓代理把商品價格改為 0.50 美元,再以 0.50 美元下單原價超過 100 美元的商品,並取消訂單。OpenAI 表示,這些漏洞被揭露後用於測試防護措施。
這類案例的風險不只在回答內容,而在代理是否能把外部文字轉成修改價格、建立訂單或取消交易等具體工具操作。實際系統仍需要額外的權限隔離、確認步驟與交易限制。
GPT-5.6 指標仍屬 OpenAI 內部評測
OpenAI 表示,在 Fake Chain-of-Thought 直接 prompt injection 測試中,GPT-5.6 的失敗率低於 10%,GPT-5.1 則高於 95%;GPT-5.6 Sol 在另一組 GPT-Red 直接攻擊中,失敗率為 0.05%。這些數字應視為 OpenAI 公布的模型安全評測,公開資料沒有提供獨立團隊重現的同等測試結果。
OpenAI 目前公開的是 GPT-Red 的訓練方法、模擬案例與部分評測數據;GPT-Red 本身並未被列為提供給一般使用者部署的產品模型。
消息來源:OpenAI:Unlocking self-improvement in AI safety with GPT-Red、OpenAI:GPT-5.6 system card and evaluations。