OpenAI嘅自動紅隊測試方法記錄喺佢哋嘅論文《Diverse and Effective Red Teaming with Auto-generated Rewards》(2026年7月14日)。呢個系統將紅隊測試嘅問題拆分做兩個步驟:
呢個方法用到自對弈,即係由一個LLM驅動嘅自動攻擊者去探測目標模型嘅弱點,例如提示注入同越獄攻擊。OpenAI表示,呢種強化學習驅動嘅方法可以主動發現同修補漏洞,防止佢哋喺現實世界被武器化。公司將提示注入形容為「前沿安全挑戰」,並且積極用自動紅隊測試嚟開發新嘅提示注入攻擊手法。
喺GPT-5.6公開發布之前,OpenAI對呢個模型進行咗有史以來最全面嘅評估。GPT-5.6 Preview System Card寫住:「我哋仲用咗超過70萬個A100e GPU小時嚟自動尋找通用越獄漏洞同其他弱點」。呢啲自動測試係配合咗幾個禮拜嘅人手紅隊測試同外部領域專家評估嚟做嘅。
公司投放咗呢個龐大嘅算力預算,專門用嚟尋找全面性、系統性嘅越獄漏洞,而唔係單一、零星嘅失敗。自動紅隊測試嘅設計係即使喺模型發布之後都會持續運行,每當有新嘅越獄漏洞被報告,就會進行修補同重新測試。
根據OpenAI嘅Preparedness Framework,GPT-5.6嘅三個版本——Sol(旗艦)、Terra(低成本)同Luna(最快)——喺網絡安全同生物/化學風險兩個類別都畀評為「高」能力。今次係第一次,連較細、較平嘅模型都跨越咗呢啲類別嘅高門檻。
不過,冇任何一個模型達到「臨界」門檻。內部網絡安全測試發現,GPT-5.6 Sol同Terra可以識別漏洞同部分漏洞利用代碼,但冇辦法自主完成完整嘅端到端攻擊。所有模型喺AI自我改進方面都未達到高門檻。
GPT-5.6配備咗OpenAI形容為「至今最穩健嘅安全防護」。安全架構包括:
呢種多層次方法反映咗OpenAI嘅結論:冇任何單一嘅安全防護係足夠嘅。
OpenAI正積極建立內部自動紅隊測試嘅能力。公司正在招聘一位「研究員,自動紅隊測試」(基本薪資$295K–$445K),職責係「領導自動紅隊測試工作,專注於建立可擴展系統,嚟揭露AI模型同安全防護中嘅失敗模式」。公司亦正在招募一位「生物安全紅隊測試專家」($158K–$320K),負責領導生物安全同CBRN(化學、生物、放射性、核)嘅紅隊測試工作。
OpenAI喺Kaggle舉辦咗一場紅隊測試挑戰賽,獎金池高達50萬美元,目標係針對其開放權重模型gpt-oss-120b同gpt-oss-20b。呢個比賽鼓勵參與者發現之前未被識別嘅新漏洞。雖然50萬美元呢個具體數字同挑戰細節未能從呢次分析嘅官方OpenAI來源獨立核實,但第三方媒體TechPolicy.Press嘅報導確認咗呢個比賽嘅存在。GPT-5.6 System Card提及咗「MLE-Bench Revised」(一個評估模型喺Kaggle比賽表現嘅基準),但冇直接提到50萬美元獎金。
現有證據確認,GPT-5.6配備咗多層安全架構,而且OpenAI嘅Preparedness Framework對自己嘅模型進行咗分類。第三方報導提到美國政府以「把關」嘅角色參與,政府可能會影響最強大模型嘅使用權限。不過,喺已爬取嘅主要來源入面,並冇直接提及英國AI安全研究所或具體嘅美國監管行動。OpenAI自己嘅系統卡文件處理咗安全分類,但冇詳細說明除咗佢哋自己嘅Preparedness Framework之外嘅外部監管審查。