据报道,一名X(原Twitter)用户要求基于Codex的代理“自己赚5美元”,方向是开源安全或审计赏金。报道称,该代理找到了合适项目,检查代码,提交GitHub pull request(PR,即代码合并请求),与项目维护者沟通,完成验证流程,保护付款隐私,并最终收到一张日期为2026年5月10日的16.88美元收款凭证。
同一批报道还称,在第一笔款项到账前,该代理在多项审计任务上累计工作约22小时。如果只按时薪看,这甚至不到每小时1美元。
不过,需要先踩一脚刹车:目前可见资料主要是对用户帖子的转述,而不是正式的第三方独立审计。因此,这个案例更适合被看作一个信号,而不是一个已经可复现、可对标的行业基准。
如果把它当成赚钱故事,16.88美元并不惊人。真正有意义的是,它展示了一种从“写代码助手”到“跑流程智能体”的转变。
这个闭环里有几个关键环节:
这就是普通代码补全工具和“类工作者”AI Agent之间的差别。前者能帮你写一段代码;后者尝试把这段代码推进到外部系统里,让它真正产生结果。
OpenAI对Codex的定位是云端软件工程代理,可以并行处理多项任务,并强调用户可通过引用、终端日志和测试结果来核验其产出。这类能力天然更适合软件工作流:代码可以测试,可以审查,可以回滚,也可以通过PR合并。
网络安全赏金的评分方式更直接:发现问题、证明影响、修复漏洞,然后由项目方或平台审核。BountyBench这个研究框架正是用来评估AI代理在网络安全中的能力,它在25个复杂真实代码库系统上设置任务,并把漏洞生命周期拆成Detect(发现新漏洞)、Exploit(利用指定漏洞)和Patch(修补指定漏洞)三类。
另一份BountyBench资料还描述了40个漏洞赏金,金额从10美元到30,485美元不等,覆盖OWASP Top 10中的9类风险;OWASP Top 10是安全行业常用的Web应用风险清单。
这说明,Codex这次16.88美元的故事并不是孤立的网红段子。研究者已经在用更接近真实安全工作的方式衡量AI Agent:能不能找漏洞、能不能利用漏洞、能不能打补丁,以及这些结果对应多大的金钱影响。
这个案例不能证明AI代理已经可以取代开发者、安全研究员或知识工作者。它只是一个被报道的单例,金额很小,外界也还看不到完整成本、失败率和可复现性。
相关基准也提醒我们:能力并不均衡。一个BountyBench摘要显示,在最多三次尝试的设定下,OpenAI Codex CLI在Patch任务上达到90%,但在Detect任务上只有5%。换句话说,修补一个已知问题,可能远比独立发现一个有价值的新漏洞容易。
这一区别很重要。真实世界的自主工作,不只是“把题做出来”,还包括选对题、避免误报、在混乱环境里安全行动,并且知道什么时候该停下来等人类审批。
更现实的近期图景,并不是AI Agent无人监管地在互联网上到处接活,而是“监督式自主”:
人类设定目标、预算、账号权限、风险边界和审批规则;代理负责搜索、草拟、测试、提交和跟进;涉及敏感权限、资金、身份和高风险操作时,人类仍然审核,并承担最终责任。
较早适合交给AI代理的任务,大概率会有这些特征:
因此,早期场景可能包括修bug、补安全漏洞、写测试、更新文档、做QA检查、清理数据、整理工单等。真正的经济问题不是“一个代理能不能拿到人类工资”,而是“大量便宜、可审计、可并行的尝试,能不能稳定产出被接受的结果”。
同一套能力,既能用于防守,也能用于进攻。一个能读代码、找漏洞、写补丁的代理,也可能被评估在攻击性网络安全任务中的表现。BountyBench本身就把AI代理放在攻防两类能力中考察,包括Detect、Exploit和Patch任务。
这意味着治理不是附加项,而是基础设施。真实部署AI代理时,需要权限边界、沙箱、身份控制、披露规则、操作日志,以及高风险动作的人类批准。OpenAI关于Codex的材料也强调安全和透明,包括通过引用、终端日志和测试结果来验证输出。当代理开始接触更多真实系统时,这些记录会从“最好有”变成“必须有”。
Codex拿到16.88美元,不是AI发财的故事,也不是大规模岗位替代的证据。它更像一个小而重要的信号:自主代理正在从演示阶段,走向真实经济流程——有明确任务、有外部系统、有人工对手方、有验证,也有付款。
如果这种模式继续扩展,未来的AI工作不会只是“回答问题”,而会越来越多地变成“在边界内追求目标”。真正有价值的Agent,也不只是能生成看似合理的内容,而是能安全地产出可验证、可审计、可追责的结果。