Bugcrowd推出RL Environments,让AI在数十万个含真实漏洞的开源软件环境中训练,学习发现、利用并修复漏洞。[1][3] 平台基于强化学习机制,为AI代理在漏洞发现、利用和修复的每一步提供客观评分反馈。[1][3] 该技术建立在Bugcrowd 2025年收购的AI攻防安全公司Mayhem Security技术之上,并明确不使用客户或研究人员数据。[1][2][4]

Create a landscape editorial hero image for this Studio Global article: How does Bugcrowd’s new Reinforcement Learning Environments platform train AI security models using hundreds of thousands of real vulnerable. Article summary: Bugcrowd says its new Reinforcement Learning Environments platform gives AI labs a way to train security models on real vulnerable software, not synthetic benchmarks, by exposing agents to large numbers of intentionally . Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "Title: Job Application for Reinforcement Learning Infrastructure (Cybersecurity) at Bugcrowd The Bugcrowd RL and Reasoning Team focuses on pushing the boundaries of autonomous cybe" source context "Careers | Bugcrowd" Reference image 2: visual subject "Title: Job Application for Reinforcement Learning Infrastruct
人工智能正迅速成为网络安全攻防战中的关键力量。随着攻击者开始利用AI工具寻找漏洞、生成利用代码并自动化攻击流程,防御方也在加速部署AI安全系统,以更快地发现并修复软件漏洞。
Bugcrowd推出的 Reinforcement Learning Environments(RL Environments) 平台,正是为此而设计。它通过让AI直接在存在真实漏洞的软件环境中训练,帮助安全模型学习更接近真实世界的漏洞发现与修复能力。
目前不少AI安全工具依赖合成数据集或人工整理的漏洞样本进行训练。但Bugcrowd认为,这类数据往往过于简化,与真实软件系统的复杂性存在明显差距。
RL Environments试图弥补这一差距。该平台提供 数十万个基于开源项目构建的训练环境,其中包含真实源代码以及刻意保留的漏洞,让AI模型在更接近真实攻击场景的环境中进行训练。
在这些环境中,AI代理与软件系统互动的方式类似于安全研究人员:阅读代码、触发行为、测试漏洞并尝试修复问题。通过不断重复这些过程,模型可以逐渐学习漏洞在真实代码库中的出现方式,以及如何有效利用或修复它们。
RL Environments采用强化学习(Reinforcement Learning)方法。模型通过执行任务并根据结果获得反馈,从而逐步改进策略。
在每个训练环境中,AI代理可以执行完整的攻防流程:
系统会对每一步提供可量化的评分反馈,让模型根据成功或失败不断调整策略。
这种训练方式类似于AI在游戏或机器人领域的强化学习机制:通过奖励成功行为、惩罚无效策略,让模型逐渐形成更有效的解决方案。
Bugcrowd的RL Environments建立在 Mayhem Security 的技术基础上。Bugcrowd在2025年11月收购了这家AI攻防安全公司,将其自动化漏洞发现和利用技术整合进自身平台。
Mayhem Security最初由卡内基梅隆大学研究人员创立,其核心技术是让AI像攻击者一样对软件进行自动化安全测试,包括漏洞发现、触发和验证。
通过这次整合,Bugcrowd希望把三种能力结合起来:
目标是加快漏洞从发现到修复的整个过程。
RL Environments的一项关键设计,是使用真实软件而不是合成训练数据。
在现实世界中,软件漏洞往往来自复杂代码结构、组件依赖关系以及意外的系统交互。合成数据虽然有助于识别基本模式,但通常难以复现这种复杂性。
通过在更接近真实环境的系统中训练AI模型,Bugcrowd希望这些安全模型在生产环境中的表现更加可靠。
安全测试涉及敏感信息,因此数据治理尤为关键。
Bugcrowd表示,其RL训练环境 完全由开源软件构建,平台不会使用客户代码或安全研究人员提交的数据进行训练。
这种设计使AI研究团队能够安全地实验漏洞发现与修复技术,而无需暴露企业的专有代码或真实漏洞报告。
尽管平台高度自动化,Bugcrowd强调它的目标并不是取代安全研究人员,而是打造 “人机协同”的安全模式。
AI代理能够快速探索大量潜在攻击路径,但在理解复杂系统、发现全新攻击方式以及判断真实安全风险方面,人类专家仍然至关重要。
换句话说,AI更像是安全研究员的“加速器”,而不是替代者。
网络安全领域正逐渐演变成一场AI对抗的竞赛。攻击者已经开始使用AI工具来寻找漏洞、自动生成利用代码,并加速攻击流程。
这迫使防御方也必须使用AI进行防御。像Bugcrowd RL Environments这样的训练平台,试图为AI安全模型提供更真实的训练场景,从而帮助企业更快地发现并修复漏洞。
如果这种方法取得成功,未来AI系统可能能够自动完成大量基础漏洞发现工作,而安全专家则可以把精力集中在更复杂、更战略性的安全问题上。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Bugcrowd推出RL Environments,让AI在数十万个含真实漏洞的开源软件环境中训练,学习发现、利用并修复漏洞。[1][3]
Bugcrowd推出RL Environments,让AI在数十万个含真实漏洞的开源软件环境中训练,学习发现、利用并修复漏洞。[1][3] 平台基于强化学习机制,为AI代理在漏洞发现、利用和修复的每一步提供客观评分反馈。[1][3]
该技术建立在Bugcrowd 2025年收购的AI攻防安全公司Mayhem Security技术之上,并明确不使用客户或研究人员数据。[1][2][4]