AI 辅助安全审计正在把比特币开源生态的代码审查推向新的规模。2026年8月,志愿者组织 Bitcoin Red Team 表示,它以“人工主导、多模型协作”的方式,在约27.5小时内审查了约390个比特币相关代码库,提交了4962条潜在安全发现,其中85条被标为严重、635条被标为高危。
但最关键的前提是:这4962条是待验证的线索或报告,并不等于4962个已经确认、能够被利用的漏洞。
11
24
这次审计做了什么
这支16人团队由开发者 Calle 与 AnchorWatch CEO Rob Hamilton 牵头。据报道,审计使用了超过4万美元、由 OpenSats 支持的 AI 算力。模型负责在代码库中寻找可疑路径、潜在薄弱点,并提出测试或利用假设;人类则负责设定审计方向、判断结果并准备提交给维护者的报告。报道提及的模型包括 Kimi K3、GPT Sol、Fable、Opus 和 GLM 5.2。
2
5
12
其覆盖范围颇大:约390个代码库,以及一个据称覆盖171,599行代码的审计框架。按团队的严重性标注,严重和高危发现合计720条。
23
27
这反映出代码审查成本结构的变化:模型能够迅速在大量代码中检索风险模式、追踪候选数据流,并给出测试思路;但“发现可疑之处”距离一份可直接进入安全响应流程的漏洞报告,仍有很长的路要走。
4962条发现,为何不能直接视为漏洞数量
更准确的理解是,4962条发现构成了一条等待人工验证的候选队列。早期报道显示,仅约21.4%的发现已被独立复现。这意味着,绝大多数报告仍需由人确认:问题是否会在对应的构建版本和配置中出现,是否真的可被利用,是否与其他报告重复,以及实际严重程度究竟如何。
11
15
一次完整的安全响应通常至少包含以下步骤:
- 在真实软件环境中复现行为;
- 排除误报和重复报告;
- 评估可利用性及对用户的实际影响;
- 与维护者协调非公开披露;
- 编写范围尽可能小的补丁与测试;
- 审核改动是否引入回归问题;
- 推动运营方和用户部署更新。
AI 显著压低了第一步——生成线索——的成本,却没有消除后续每一步对专家判断和责任归属的需求。报道称,当时仅有部分发现已送达维护者手中,这也说明漏洞披露处理能力本身就是一种约束。
14
Coldcard事件为何让问题更紧迫
这次审计发生在 Coldcard 硬件钱包事件之后。据报道,Coldcard 在2021年3月的一版固件中出现错误:助记词种子生成被导向一个可预测的软件随机化器,而非原定的硬件随机数发生器。若攻击者能够限制或推断所需输入范围,受影响的私钥就可能被重现。
42
45
随着更多相关链上活动被识别,损失估算也持续变化。CoinDesk 报道称,四轮转移累计损失可能接近1.14亿美元;其他报道则称,2026年7月30日至8月3日期间约有1816枚比特币被盗。
41
42
事件的教训并不是比特币的核心密码学失效,而是自托管软件及其周边组件中的缺陷,同样可能造成系统级后果。相比事后发现问题,更重要的是在被利用前识别并解决危险缺陷。
一个已合并的修复,也说明“原始总数”并非成果总数
报道指出,Hamilton 提交的一项 AI 辅助 Bitcoin Core 改动已于8月20日合并,用于修复一个与钱包相关的崩溃问题。
13
这是一个有实际意义的结果:一条由 AI 发现或辅助发现的线索,最终经过传统的审查与合并流程,成为维护中的代码库的一项修复。
但这也恰好说明,为何不应把4962这个数字视作“已完成修复数”。一项被合并的修复跨过了更高门槛:存在明确的问题定义、经过审核的补丁,以及维护项目对该改动的接纳。
OpenAI访问限制带来的防御困境
Hamilton 表示,在开始把 OpenAI 的网络安全能力整合进审计后,其访问权限受到 OpenAI Trust Cyber 项目的限制。报道显示,团队随后改用其他模型,包括开放权重模型来继续工作。
18
21
32
这带来一个难以回避的政策问题:强大的网络安全模型可以帮助合法防御者寻找缺陷,但相同能力也可能被滥用。Hamilton 的批评是,如果已知的防御者在工具使用上被延迟或设限,而攻击者仍可使用其他模型、甚至在本地运行的开放权重模型,那么实际操作中可能形成不对称。
这是一种关于工具可得性和响应速度的观点,并不意味着限制某一家供应商的工具就能阻止安全研究或恶意使用。
21
Boltz暂停服务,展现小团队的现实压力
比特币兑换服务 Boltz 在8月另行宣布无限期暂停兑换,称自动化、AI辅助探测的增加,已超过其小团队保障安全和部署修复的能力。该服务表示,兑换功能虽被关闭,但退款功能仍可使用。
28
29
30
Boltz 并不能证明每一次 AI 生成的攻击都很复杂或都会成功;但它确实呈现了 Red Team 审计所揭示的现实错配:自动化发现和探测可以持续运行,而规模有限的维护团队必须逐一调查告警,并安全地发布每一项缓解措施。
更强的模型为何改变风险计算
比特币及其周边服务的大量代码是开源的。公开代码有利于独立审查和透明度,但也意味着防御者和攻击者都能接触同一份软件语料。
Hamilton 和比特币评论者 CobraBitcoin 担忧的并不是开源天然不安全,而是能力持续增强的模型可能降低门槛,使人们能以更少时间和专业经验,在数百个代码库中寻找罕见缺陷。
17
21
OpenAI 表示,GPT-6 Astra 已达到其《Preparedness Framework》中的网络安全能力“关键级”(Critical)门槛。该公司称,在具备适当工具和访问权限的情况下,Astra 可以在许多防护较强的系统中发现此前未知的缺陷,并开发利用方式,而不需要人类逐步指导。
19
22
这项能力声明并不表示 Astra 曾用于 Bitcoin Red Team 审计,也不能证明某个前沿模型导致了比特币安全事件。但它解释了维护者为何聚焦“速度”:当模型越来越擅长跨代码库推理、漏洞发现与利用开发时,真正的限制将从“能否找到可能性”,转变为“能否快速证实、修复并部署对重要问题的响应”。
真正需要投入的,是验证能力
Bitcoin Red Team 的冲刺审计更像一次吞吐量警报。安全生态如今可以很快生成数千条看似合理的线索;其韧性则取决于能否以相近速度,为独立复现、私密报告渠道、维护者时间、代码审核、测试和快速更新提供资金与人力。
因此,比特币相关项目下一阶段真正值得衡量的,不是 AI 一次生成了多少条发现,而是其中有多大比例能在攻击者行动之前,转化为已验证的漏洞、妥善协调的补丁和已部署的保护措施。
15
14