同一般 AI 安全測試工具唔同,呢個平台會讓 AI 代理進入大量「刻意設計成有漏洞」嘅開源軟件環境,模擬真實世界嘅安全測試場景,令模型可以一步一步學識點樣發現同修復漏洞。
目前好多 AI 安全模型主要依賴合成數據或固定嘅漏洞樣本庫去訓練。不過 Bugcrowd 指出,呢類數據往往過於簡化,同現實世界複雜嘅程式碼環境有差距。
RL Environments 嘅做法係建立 數十萬個由開源專案構成嘅訓練環境,每個環境都包含真實程式碼同可驗證嘅安全漏洞。
AI 代理喺呢啲環境入面可以同軟件互動,就好似人類安全研究員測試系統一樣,逐步理解漏洞點樣喺真實程式碼中出現,以及點樣被利用同修補。
整個平台係以 強化學習(Reinforcement Learning) 為核心。
簡單講,AI 會不斷嘗試完成安全測試任務,系統再根據結果給予客觀評分,令模型逐步改善策略。
喺每個訓練環境入面,AI 代理可以完成完整嘅安全測試流程:
每個步驟都會得到系統評分,讓模型透過反覆練習提升能力。
RL Environments 背後嘅核心技術,其實源自 Bugcrowd 2025 年收購嘅 AI 安全公司 Mayhem Security。
Mayhem 原本專注於自動化漏洞發現與利用技術,透過 AI 模擬攻擊者思維去測試軟件安全。收購完成後,Bugcrowd 將呢套技術整合到自己嘅眾包安全平台入面。
Bugcrowd 嘅長遠目標係結合三個元素:
希望可以更快發現同修復軟件漏洞。
Bugcrowd 認為,AI 安全模型如果只用合成數據訓練,往往只學到表面模式。
現實軟件系統通常涉及:
透過模擬更接近真實世界嘅軟件環境,AI 模型理論上可以更有效應對實際部署系統中出現嘅漏洞。
安全測試通常會涉及敏感資料,因此數據來源非常重要。
Bugcrowd 表示,RL Environments 只使用開源軟件建立訓練環境,並且 不會使用任何客戶或安全研究員數據 來訓練模型。
呢個設計可以讓 AI 研究團隊測試漏洞發現與修復技術,同時避免洩露企業程式碼或私密安全報告。
雖然平台高度自動化,但 Bugcrowd 強調 AI 並唔係要取代安全研究員。
公司將呢個方向稱為 Human‑Augmented Security(人類強化安全):
兩者結合可以提高漏洞發現效率,同時保持專業判斷。
隨住攻擊者開始利用 AI 生成漏洞利用程式、掃描系統弱點甚至自動化入侵,網絡安全正逐步變成一場 AI 對 AI 嘅競賽。
Bugcrowd 認為,像 RL Environments 呢類平台,可以為 AI 安全模型提供更接近真實世界嘅訓練環境,幫助安全團隊更快發現問題並修復漏洞。
如果呢種訓練方式有效,未來 AI 可能可以自動完成大量早期漏洞發現工作,而人類專家則專注處理最複雜同策略性嘅安全問題。