Anthropic、NCBI、Broad Institute與陳和祖克柏倡議的一項指標性研究發現,頂尖AI模型在擷取病毒序列資料時表現慘不忍睹,準確率低至16.9%,因為公共生物資料庫的設計是給人用的,不是給機器讀的。 核心問題在於生物資料基礎設施缺乏具確定性、可重現的程式化介面,迫使AI代理在不一致的網頁表單中迷航,導致完全相同的查詢,可能一次吐給你106筆,下一次只剩5筆。

Create a landscape editorial hero image for this Studio Global article: What do researchers from Anthropic, NCBI, the Broad Institute, and the Chan Zuckerberg Initiative reveal about why AI agents fail at retriev. Article summary: In a collaboration between Anthropic, NCBI, the Broad Institute, and the Chan Zuckerberg Initiative (CZI), researchers demonstrated that state-of-the-art AI agents fail at retrieving biological data from public databases. Topic tags: general, government, academic, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Artificial Intelligence agents for biological research: a survey. A **.gov** website belongs to an official government organization in the United States. Inclusion in an NLM data" source context "Artificial Intelligence agents for biological research: a survey - PMC" Reference image 2: vis
一場由Anthropic、美國國家生物技術資訊中心(NCBI)、博德研究所(Broad Institute)與陳和祖克柏倡議(Chan Zuckerberg Initiative, CZI)聯手進行的重磅合作,揭露了AI驅動科學的一個骯髒小秘密:當今最強大的AI代理,連「從公開資料庫擷取病毒DNA序列」這項基本任務都做得亂七八糟。這項於2026年6月發表的研究發現,像Claude Sonnet 4這類頂尖模型,在這項例行工作中的準確率可低至16.9%。但罪魁禍首不是AI的智慧,而是「管線」。整套基礎設施是為了讓人類點擊網頁表單而設計的,不是為了讓自主代理使用的。研究團隊證明了,只要建構一個名為gget virus的確定性檢索層,就能將準確率瞬間拉到逼近100%,清楚揭示:修好資料水管,才是通往可信賴AI生物學的最快路徑 。
Laura Luebbert和她的同事用一個強而有力的比喻來描述這個問題:使用AI代理來導航生物資料,就像開著一輛現代汽車穿越一座中世紀古城。車子本身技術先進,但道路從一開始就沒為它設計過 。
這個合作團隊測試了多個領先的AI系統——包括Claude、GPT系列模型、Biomni開源工具,以及Edison Analysis——任務看似簡單:從「NCBI病毒」這個病毒學家用來追蹤疫情與開發診斷工具的核心資源庫中,擷取病毒序列資料 。結果令人擔憂。
「NCBI病毒」以及許多其他公共生物資料庫,都是為了互動式、瀏覽器為基礎的工作流程而建造的。科學家透過點擊篩選器、手動檢視結果,並依賴視覺提示來操作。這種介面邏輯,與期望結構化、程式化指令的自主代理完全不相容 。
這項研究最致命的發現是「不一致」。當研究人員要求Claude Sonnet 4「三次」分別擷取伊波拉病毒序列(已驗證的正確答案為266筆)時,它第一次回傳了106筆,第二次15筆,第三次只剩5筆。指令完全沒變,只有輸出結果變了 。
這不只是漏掉幾筆資料的問題。在一項模擬中,一次錯誤的資料擷取嚴重扭曲了系統發生學分析,將某次伊波拉疫情的起源估計為1922年,而非正確的2014年。AI並未在科學層面上產生幻覺——它只是被餵養了一組殘破的資料集,然後忠實地在這基礎上建構出錯誤的結論 。
生物資料分散在數十個資料庫中,彼此之間的識別碼互不相容、中繼資料標準各異,且缺乏具版本控制的API。軟體工程師習慣依賴套件管理器與具版本控管的端點;但計算生物學家往往被困在得寫腳本去對抗那些隨時可能無預警變動、且不一致的網頁介面 。
與其訓練一個更聰明的模型,團隊選擇打造一個更好的資料檢索層。gget virus是一個輕量級、具確定性的框架,它將「NCBI病毒」的篩選邏輯正規化,使其成為一套可重現的程式化系統 。
它的運作方式,是在下載序列前先套用中繼資料限制條件,僅選擇性地擷取符合條件的結構化GenBank紀錄,並為高流量查詢減少超過98%的資料傳輸量,同時確保精準匹配的語意。最終產出的,是每次都能得到完全相同的資料集——這是AI代理迫切需求,但老舊基礎設施卻無法提供的關鍵特性 。
這項工具的影響立竿見影。當自主AI系統採用gget virus作為其資料檢索後端時:
箇中道理再明確不過:限制AI驅動生物學發展的瓶頸,不是模型的推理能力——而是「確定性的資料存取」。只要加上正確的檢索層,當今的AI代理已經能夠執行可靠的工作 。
gget virus的成功故事,只是一個更宏大轉變的概念驗證。研究人員主張,這種模式並不限於病毒學——光是NCBI本身,就還有超過30個資料庫能因類似的確定性包裝器而受益 。
生物資料庫必須進化,對外公開具備完善文件、版本控管的API,並提供標準化的篩選機制與可重現的查詢語意。這就好比軟體開發者從套件管理器與版本控制系統所獲得的東西——是生物科學目前嚴重缺乏的關鍵基礎設施 。
與此同時,陳和祖克柏倡議(CZI)也發布了一份藍圖,呼籲建立可互通、匯集式的生物資料集,使其能透過命令列介面(CLI)和機器可讀的標準來查詢。他們的願景是:打造一個科學家能在單一聯邦式查詢中,同時搜尋、分析並下載多模態數據的世界,讓AI規模的發現在沒有當前這種檢索混亂的狀態下得以實現 。
CZI已開始為此付諸行動,不僅開發了用於聯邦數據存取的命令列工具,更啟動了「十億細胞計畫」(Billion Cells Project)——這項指標性的單細胞資料集,旨在訓練下一代的AI模型。其目標是打造基礎性設施,讓生物數據對機器來說,就像程式碼倉庫對開發者一樣容易取得 。
「為人類設計的舊式介面會癱瘓AI代理」這項核心洞見,可普遍應用於整個科學計算領域。具確定性、程式化的存取層不是奢侈品,而是讓自主系統能可靠參與研究的先決條件。解決方案不是等待更聰明的模型出現,而是著手升級道路本身。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Anthropic、NCBI、Broad Institute與陳和祖克柏倡議的一項指標性研究發現,頂尖AI模型在擷取病毒序列資料時表現慘不忍睹,準確率低至16.9%,因為公共生物資料庫的設計是給人用的,不是給機器讀的。
Anthropic、NCBI、Broad Institute與陳和祖克柏倡議的一項指標性研究發現,頂尖AI模型在擷取病毒序列資料時表現慘不忍睹,準確率低至16.9%,因為公共生物資料庫的設計是給人用的,不是給機器讀的。 核心問題在於生物資料基礎設施缺乏具確定性、可重現的程式化介面,迫使AI代理在不一致的網頁表單中迷航,導致完全相同的查詢,可能一次吐給你106筆,下一次只剩5筆。
這套「gget病毒」輕量級包裝器,為NCBI病毒資料庫提供了一套確定性的存取層,幾乎消除了所有隨機性誤差,讓AI代理總算能穩定地執行科學任務。