許多 AI 資安模型目前主要依賴合成資料集或人工整理的漏洞範例來訓練。但 Bugcrowd 認為,這些資料往往過於理想化,與真實系統的複雜程度存在落差。
RL Environments 的設計目標就是縮小這個差距。平台提供 數十萬個訓練環境,這些環境來自開源專案,包含真實程式碼與可驗證的漏洞。
在這些模擬環境中,AI 代理(AI agents)會像人類資安研究員一樣與軟體互動,分析程式、測試輸入、觸發漏洞並觀察結果。
透過反覆嘗試與回饋,AI 能逐漸學習:
整個平台採用 強化學習(Reinforcement Learning) 機制。模型在完成任務後會得到明確評分,藉此不斷優化策略。
在每個訓練環境中,AI 可以嘗試完整的資安攻擊流程:
平台會對每一步提供客觀評分,讓模型根據成功或失敗的結果逐步改進。
這種方法與許多先進 AI 系統的訓練方式相同:成功策略會被「獎勵」,效果不佳的策略則會被「懲罰」,模型最終學會更有效的行為模式。
RL Environments 的技術基礎來自 Mayhem Security,這是一家專注於 AI 攻擊測試(offensive security)的新創公司,Bugcrowd 在 2025 年 11 月完成收購。
Mayhem 的平台原本就專注於自動化漏洞發現與利用,透過 AI 模擬攻擊者的思維來測試軟體安全性。
透過這次整合,Bugcrowd 希望把三種能力結合在一起:
這種組合的目標是加速漏洞被發現與修補的速度。
Bugcrowd 在設計 RL Environments 時的一個核心理念是:AI 必須在接近真實世界的條件下學習。
合成資料集雖然有助於模型辨識基本模式,但實際軟體系統通常更混亂、更複雜。漏洞往往來自:
透過真實軟體環境訓練,Bugcrowd 希望 AI 在實際部署時能更有效地發現問題。
資安測試平台最大的疑慮之一是敏感資料的使用。Bugcrowd 表示,RL Environments 完全由 開源軟體環境 建構。
公司強調:
這讓 AI 團隊能在安全的條件下訓練漏洞發現與修復能力,而不必接觸任何私有資訊。
儘管平台高度自動化,Bugcrowd 並不把它定位為「取代人類」。相反地,公司把這種模式稱為 human‑augmented security(人類增強型安全)。
AI 可以快速探索大量攻擊路徑,而人類研究員仍然在許多情境中不可或缺,例如:
Bugcrowd 在收購 Mayhem Security 時就強調,未來資安平台將結合 AI 的規模能力與人類駭客的創造力。
整體而言,網路安全正進入 AI 主導的競爭階段。攻擊者已開始利用 AI 自動生成攻擊、搜尋漏洞並擴大入侵效率。
這迫使防禦方也必須採用 AI 技術。Bugcrowd 的 RL Environments 就是其中一個例子——讓 AI 在接近真實世界的環境中接受訓練,以更快速度發現並修補漏洞。
如果這種方法成功,未來的 AI 安全系統可能能自動完成大量初期漏洞分析工作,而人類專家則能把時間集中在更複雜、更具策略性的安全問題上。