由Anthropic、NCBI、Broad Institute同CZI聯手嘅研究發現,頂尖AI模型喺擷取病毒序列數據時表現極唔穩定,Claude Sonnet 4嘅準確率可以低至16.9%,同一個Query做三次竟然會出106、15同5個完全唔同嘅結果 [3][16]。 元兇唔係AI蠢,而係成個生物數據基礎設施缺乏「確定性」——NCBI Virus呢啲數據庫嘅設計係畀人類撳掣用,唔係畀AI程式化存取,搞到AI Agent好似「揸住架林寶堅尼喺中世紀古城入面行」咁狼狽 [10][7]。

Create a landscape editorial hero image for this Studio Global article: What do researchers from Anthropic, NCBI, the Broad Institute, and the Chan Zuckerberg Initiative reveal about why AI agents fail at retriev. Article summary: In a collaboration between Anthropic, NCBI, the Broad Institute, and the Chan Zuckerberg Initiative (CZI), researchers demonstrated that state-of-the-art AI agents fail at retrieving biological data from public databases. Topic tags: general, government, academic, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Artificial Intelligence agents for biological research: a survey. A **.gov** website belongs to an official government organization in the United States. Inclusion in an NLM data" source context "Artificial Intelligence agents for biological research: a survey - PMC" Reference image 2: vis
當全世界都喺度吹捧AI Agent可以自動寫Code、做研究嘅時候,一個由Anthropic、NCBI、Broad Institute同埋Chan Zuckerberg Initiative (CZI) 聯手嘅重磅研究,就好似一盆冷水照頭淋落嚟。佢哋發現,今日最頂尖嘅AI模型,對住一個連研究生都嫌簡單嘅工作——由公共數據庫NCBI Virus下載病毒DNA序列——竟然錯到離晒大譜,準確率最低可以去到16.9% 。
更令人震驚嘅係,個問題唔係出喺AI「蠢」,而係出喺科研界啲數據「水管」實在太殘舊。成個基礎設施嘅設計,仲係為咗方便人類研究員用滑鼠逐吓逐吓撳,冇諗過會有AI Agent要嚟程式化存取。研究團隊用咗一個好貼切嘅比喻:「叫AI Agent去生物數據庫拎數據,就好似揸住架現代跑車喺中世紀嘅古城入面行。架車技術上係先進嘅,但條路根本唔係為咗佢而起。」。
Laura Luebbert帶領嘅研究團隊,測試咗包括Claude、GPT、Biomni Open Source同Edison Analysis在內嘅多個頂尖AI系統,叫佢哋做一個病毒學家日常工作:由NCBI Virus數據庫擷取病毒序列數據。結果簡直係一場災難 。
NCBI Virus同好多其他公共生物數據庫一樣,佢哋嘅工作流程係為咗「互動式、瀏覽器操作」而設計。科學家會用滑鼠撳選項、用肉眼檢查結果、靠視覺提示去判斷。呢種介面邏輯,同AI Agent需要嘅「結構化、程式化指令」完全唔夾 。
研究入面最得人驚嘅發現,係AI嘅表現完全冇一致姓。研究員叫Claude Sonnet 4做同一個工作三次,就係「擷取伊波拉病毒序列」,對照組嘅標準答案應該係266條。結果呢?第一次佢俾返106條,第二次得15條,第三次更只得返5條。成個過程冇改過任何指令,但結果就好似擲骰仔咁 。
呢啲錯漏唔單止係「拎少咗幾個檔案」咁簡單。喺一次模擬測試入面,一個出錯嘅數據擷取,直接扭曲咗成個病毒演化分析,令到分析結果估算嘅伊波拉疫情起源年份,由正確嘅2014年,一下子推前咗去1922年。AI冇幻覺,冇老作啲科學出嚟——佢只係忠心耿耿咁,基於一份殘缺不全嘅數據,砌咗個錯晒嘅結論出嚟 。
而家嘅生物數據,散落喺幾十個唔同嘅數據庫,每個庫嘅識別碼唔相通、元數據標準又唔同,仲要好多時連一個有版本控制嘅API都冇。軟件工程師有Package Manager同版本控制系統,但計算生物學家好多時仲係要寫Script去對住啲唔知幾時會改嘅網頁介面,痛苦到極點 。
與其訓練一個更聰明嘅模型,研究團隊揀咗一條更直接嘅路:砌一個更好嘅數據存取層。佢哋開發嘅 gget virus 係一個輕量級、確定性嘅框架,將NCBI Virus嘅過濾邏輯,變成一套可以重複執行嘅程式化系統 。
佢嘅運作原理,係喺下載序列數據之前,先精準咁套用元數據嘅限制條件,只選擇性拎返符合要求嘅GenBank結構化記錄。對於數據量龐大嘅查詢,呢個方法可以減少超過98%嘅數據傳輸量,同時確保每一次拎出嚟嘅數據都一模一樣——呢種「確定性」,就係AI Agent最需要,但舊有基建偏偏俾唔到嘅嘢 。
效果係立竿見影嘅。當AI系統改用gget virus做佢哋嘅數據擷取後台之後:
結論非常清晰:**限制AI生物學發展嘅樽頸位,唔係模型嘅推理能力,而係有冇一個確定性嘅數據存取方式。**只要加返啱嘅數據擷取層,今日嘅AI Agent已經可以做到可靠嘅工作 。
gget virus嘅成功,只係一個大趨勢嘅概念驗證。研究人員指出,呢個模式並唔局限喺病毒學——單係NCBI就已經有超過30個數據庫,都可以透過類似嘅「確定性封裝層」獲益 。
生物數據庫必須進化,要提供有完善文檔、有版本控制嘅API,配以標準化嘅過濾同可重複執行嘅查詢語意。呢個就等於軟件開發人員用開嘅Package Manager同版本控制系統,係一種科研領域目前仲未普及嘅關鍵基礎設施 。
同時間,Chan Zuckerberg Initiative (CZI) 亦都發表咗一份路線圖,呼籲建立可互通、可整合嘅生物數據集,等科學家可以透過命令行介面 (CLI) 同機器可讀嘅標準去查詢。佢哋嘅願景係:科學家可以用一個「聯邦式查詢」,就搜尋、分析同下載到多模態嘅數據,令AI規模嘅科學發現得以實現,而唔使再深陷喺目前嘅擷取混亂之中 。
CZI已經坐言起行,開發緊一個用嚟聯邦式存取數據嘅CLI工具,同時開展咗「十億細胞計劃」(Billion Cells Project),呢個係一個標誌性嘅單細胞數據集,目的就係用嚟訓練下一代AI模型。終極目標,係要建立一個基礎設施,等生物數據對於機器嚟講,可以好似代碼庫對於開發人員咁方便存取 。
呢個核心洞見——「為人類而設嘅舊式介面會令AI Agent崩潰」——係可以喺成個科學計算領域通用嘅。確定性、程式化嘅存取層,並唔係乜嘢奢侈品,而係要讓自主系統能夠可靠咁參與科研工作嘅先決條件。解決方法,唔係等一個更聰明嘅模型出現。而係要即刻開始,將啲路起好佢。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
由Anthropic、NCBI、Broad Institute同CZI聯手嘅研究發現,頂尖AI模型喺擷取病毒序列數據時表現極唔穩定,Claude Sonnet 4嘅準確率可以低至16.9%,同一個Query做三次竟然會出106、15同5個完全唔同嘅結果 [3][16]。
由Anthropic、NCBI、Broad Institute同CZI聯手嘅研究發現,頂尖AI模型喺擷取病毒序列數據時表現極唔穩定,Claude Sonnet 4嘅準確率可以低至16.9%,同一個Query做三次竟然會出106、15同5個完全唔同嘅結果 [3][16]。 元兇唔係AI蠢,而係成個生物數據基礎設施缺乏「確定性」——NCBI Virus呢啲數據庫嘅設計係畀人類撳掣用,唔係畀AI程式化存取,搞到AI Agent好似「揸住架林寶堅尼喺中世紀古城入面行」咁狼狽 [10][7]。
解決方法唔係等個更聰明嘅模型出現,而係要重建數據「水管」。研究團隊開發咗一個叫「gget virus」嘅確定性擷取層,即刻令準確率飆升到近100%,證明只要條路起好,今日嘅AI已經做到可靠嘅科研工作 [3][9]。