Anthropic、NCBI、Broad 研究所和 Chan Zuckerberg Initiative 的里程碑式研究发现,顶级 AI 模型在获取病毒序列数据时惨遭滑铁卢,由于公共数据库缺乏可复现的接口,准确率最低仅 16.9%。 核心症结在于生物数据基础设施的“非确定性”:同一个查询在 Claude Sonnet 4 上三次运行,竟返回了 106、15 和 5 个截然不同的结果,这直接导致系统发育分析将埃博拉疫情起源时间错误地推算到了 1922 年。

Create a landscape editorial hero image for this Studio Global article: What do researchers from Anthropic, NCBI, the Broad Institute, and the Chan Zuckerberg Initiative reveal about why AI agents fail at retriev. Article summary: In a collaboration between Anthropic, NCBI, the Broad Institute, and the Chan Zuckerberg Initiative (CZI), researchers demonstrated that state-of-the-art AI agents fail at retrieving biological data from public databases. Topic tags: general, government, academic, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Artificial Intelligence agents for biological research: a survey. A **.gov** website belongs to an official government organization in the United States. Inclusion in an NLM data" source context "Artificial Intelligence agents for biological research: a survey - PMC" Reference image 2: vis
由 Anthropic、NCBI、Broad 研究所和 Chan Zuckerberg Initiative(CZI)联手进行的一项重磅合作,揭露了 AI 驱动科学的一个“肮脏秘密”:当今最强大的 AI 智能体,在一个极其简单的任务上——从公共数据库抓取病毒 DNA 序列——表现得完全不可靠。这项 2026 年 6 月发布的研究发现,像 Claude Sonnet 4 这样的模型在这项常规工作上的准确率低至 16.9%。
然而,罪魁祸首并非 AI 的智力不足,而是“管道”出了问题。这些基础设施是为人类点击网页表单设计的,而不是为自主智能体打造的。通过构建一个名为 gget virus 的确定性检索层,团队瞬间将准确率提升至接近 100%,证明了修复数据管道是通往可信赖 AI 生物学的最快路径。
Laura Luebbert 及其同事用一个强有力的类比来框定这个问题:让 AI 智能体来导航生物数据,就像开着现代汽车在中世纪的城市里穿行。车辆本身技术先进,但道路压根不是为它设计的。
这个合作团队测试了多个领先的 AI 系统——包括 Claude、基于 GPT 的模型、Biomni Open Source 和 Edison Analysis——任务是看似简单的从 NCBI Virus 数据库检索病毒序列数据。NCBI Virus 是病毒学家追踪疫情和开发诊断方法时的首选资源库,但结果令人震惊。
NCBI Virus 和许多其他公共生物数据库是为交互式、基于浏览器的操作流程构建的。科学家们通过点击筛选、手动检查结果并依赖视觉提示来完成工作。这种界面逻辑与期望结构化、程序化命令的自主智能体完全不兼容。
最致命的发现是不一致性。当研究人员让 Claude Sonnet 4 重复三次检索埃博拉病毒序列(经过验证的准确结果应为 266 条)时,它第一次返回了 106 条,第二次 15 条,第三次仅剩 5 条。提示词没有任何改变——变的只有输出结果。
这不仅仅是遗漏几条记录那么简单。在一次模拟中,一个错误的检索严重扭曲了系统发育分析,导致它估算出的埃博拉疫情起源时间为 1922 年,而非正确的 2014 年。AI 并未在科学上产生“幻觉”——它只是被灌输了损坏的数据集,然后忠实地在其之上构建了一个错误的结论。
生物数据分散在数十个数据库中,这些数据库的标识符互不兼容,元数据标准各异,也没有版本控制的 API。软件工程师有包管理器和版本化的端点可用;而计算生物学家通常只能对着不一致的网络界面编写脚本,这些界面还可能会在没有通知的情况下改变。
与其训练一个更好的模型,团队选择构建一个更好的检索层。gget virus 是一个轻量级的确定性框架,它将 NCBI Virus 的筛选逻辑规范化,变为了一个可复现的程序化系统。
它的工作原理是先应用元数据约束,然后再下载序列,只选择性获取匹配的结构化 GenBank 记录,在处理大批量查询时能将数据传输量减少 98% 以上,同时保留精确匹配的语义。其结果是,每次都能得到相同的数据集——这是 AI 智能体极度需要,但旧基础设施无法提供的特性。
其影响立竿见影且效果惊人。当自主 AI 系统使用 gget virus 作为其检索后端时:
结论很明确:限制 AI 赋能生物学发展的关键瓶颈不是模型的推理能力——而是确定性的数据访问。加上正确的检索层,当今的智能体已经能够胜任可靠的工作。
gget virus 的成功故事是一个更大转变的概念验证。研究人员认为,这种模式并不仅限于病毒学——仅 NCBI 就托管着 30 多个数据库,它们都能从类似的确定性包装器中获益。
生物数据库必须进化,以暴露出有详尽文档、版本化的 API,并具备标准化的筛选和可复现的查询语义。这相当于软件开发者从包管理器和版本控制系统中所获得的东西——是生物科学目前所缺乏的关键基础设施。
在并行的工作中,Chan Zuckerberg Initiative 发布了一份路线图,呼吁实现可互操作、汇集的生物数据集,这些数据集可以通过命令行界面(CLI)和机器可读的标准进行查询。他们的愿景是:科学家能够在一个单一的联邦查询中搜索、分析和下载多模态数据,从而在没有混乱检索的情况下实现 AI 规模的发现。
CZI 已经付诸行动,正在开发用于联邦数据访问的 CLI,并启动了“十亿细胞项目”(Billion Cells Project),这是一个具有里程碑意义的单细胞数据集,旨在训练下一代 AI 模型。其目标是打造基础性的基础设施,让生物数据对机器来说,就像代码仓库对开发者一样触手可及。
核心洞察——即旧有的以人为本的界面会破坏 AI 智能体——适用于整个科学计算领域。确定性的、程序化的访问层不是奢侈品,而是让自主系统能够可靠地参与研究的先决条件。解决问题的办法不是坐等一个更聪明的模型出现,而是升级“道路”。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Anthropic、NCBI、Broad 研究所和 Chan Zuckerberg Initiative 的里程碑式研究发现,顶级 AI 模型在获取病毒序列数据时惨遭滑铁卢,由于公共数据库缺乏可复现的接口,准确率最低仅 16.9%。
Anthropic、NCBI、Broad 研究所和 Chan Zuckerberg Initiative 的里程碑式研究发现,顶级 AI 模型在获取病毒序列数据时惨遭滑铁卢,由于公共数据库缺乏可复现的接口,准确率最低仅 16.9%。 核心症结在于生物数据基础设施的“非确定性”:同一个查询在 Claude Sonnet 4 上三次运行,竟返回了 106、15 和 5 个截然不同的结果,这直接导致系统发育分析将埃博拉疫情起源时间错误地推算到了 1922 年。
影响远超病毒学领域:研究团队指出 NCBI 旗下 30 多个数据库都需要面向智能体重建,而 CZI 也在同步推进联邦化、AI 规模化的数据计划,以驱动下一代计算生物学。