目前不少AI安全工具依赖合成数据集或人工整理的漏洞样本进行训练。但Bugcrowd认为,这类数据往往过于简化,与真实软件系统的复杂性存在明显差距。
RL Environments试图弥补这一差距。该平台提供 数十万个基于开源项目构建的训练环境,其中包含真实源代码以及刻意保留的漏洞,让AI模型在更接近真实攻击场景的环境中进行训练。
在这些环境中,AI代理与软件系统互动的方式类似于安全研究人员:阅读代码、触发行为、测试漏洞并尝试修复问题。通过不断重复这些过程,模型可以逐渐学习漏洞在真实代码库中的出现方式,以及如何有效利用或修复它们。
RL Environments采用强化学习(Reinforcement Learning)方法。模型通过执行任务并根据结果获得反馈,从而逐步改进策略。
在每个训练环境中,AI代理可以执行完整的攻防流程:
系统会对每一步提供可量化的评分反馈,让模型根据成功或失败不断调整策略。
这种训练方式类似于AI在游戏或机器人领域的强化学习机制:通过奖励成功行为、惩罚无效策略,让模型逐渐形成更有效的解决方案。
Bugcrowd的RL Environments建立在 Mayhem Security 的技术基础上。Bugcrowd在2025年11月收购了这家AI攻防安全公司,将其自动化漏洞发现和利用技术整合进自身平台。
Mayhem Security最初由卡内基梅隆大学研究人员创立,其核心技术是让AI像攻击者一样对软件进行自动化安全测试,包括漏洞发现、触发和验证。
通过这次整合,Bugcrowd希望把三种能力结合起来:
目标是加快漏洞从发现到修复的整个过程。
RL Environments的一项关键设计,是使用真实软件而不是合成训练数据。
在现实世界中,软件漏洞往往来自复杂代码结构、组件依赖关系以及意外的系统交互。合成数据虽然有助于识别基本模式,但通常难以复现这种复杂性。
通过在更接近真实环境的系统中训练AI模型,Bugcrowd希望这些安全模型在生产环境中的表现更加可靠。
安全测试涉及敏感信息,因此数据治理尤为关键。
Bugcrowd表示,其RL训练环境 完全由开源软件构建,平台不会使用客户代码或安全研究人员提交的数据进行训练。
这种设计使AI研究团队能够安全地实验漏洞发现与修复技术,而无需暴露企业的专有代码或真实漏洞报告。
尽管平台高度自动化,Bugcrowd强调它的目标并不是取代安全研究人员,而是打造 “人机协同”的安全模式。
AI代理能够快速探索大量潜在攻击路径,但在理解复杂系统、发现全新攻击方式以及判断真实安全风险方面,人类专家仍然至关重要。
换句话说,AI更像是安全研究员的“加速器”,而不是替代者。
网络安全领域正逐渐演变成一场AI对抗的竞赛。攻击者已经开始使用AI工具来寻找漏洞、自动生成利用代码,并加速攻击流程。
这迫使防御方也必须使用AI进行防御。像Bugcrowd RL Environments这样的训练平台,试图为AI安全模型提供更真实的训练场景,从而帮助企业更快地发现并修复漏洞。
如果这种方法取得成功,未来AI系统可能能够自动完成大量基础漏洞发现工作,而安全专家则可以把精力集中在更复杂、更战略性的安全问题上。