Anthropic 的示範有力證明,前沿通用 AI 模型可以自主執行一輪具生產力的早期蛋白質結合器研究,但未證明 Claude 能獨立發現、優化或完成臨床藥物開發。 Claude Mythos Preview 及 Claude Opus 4.8 為 15 個接受實驗評估的目標設計結合器,成功命中其中 14 個。
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Anthropic’s demonstration of Claude’s autonomous protein design capabilities show about its performance, methodology, validation, l. Article summary: Anthropic’s demonstration is credible evidence that a frontier generalist model can autonomously run a productive early protein binder campaign—but it is not evidence that Claude can autonomously discover, optimize, or c. Topic tags: general web, ai safety, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Anthropic 今次示範提供咗相當可信嘅證據,顯示一個前沿通用模型可以自主執行一輪有實際產出的早期蛋白質結合器研究。不過,呢個結果並唔代表 Claude 已經可以自主發現新藥、逐步優化候選藥物,或者處理臨床開發。整個研究的核心數據由 Anthropic 公布,但蛋白質的實際製造及結合測試則由外部實驗室完成。
Claude Mythos Preview 同 Claude Opus 4.8 為 15 個接受實驗評估的目標設計蛋白質結合器,當中 14 個目標最終找到成功結合的設計。
在同時處理多個目標、限時 48 小時的測試中,Mythos 的命中率為 26.7%,Opus 4.8 為 22.6%。Anthropic 引述目前業界一般命中率約為 10% 至 15%;如果 Mythos 分開處理單一目標,每個目標進行獨立 24 小時測試,命中率更達 35.1%。
但平均數字容易令人誤會。逐個目標計算,結果由 0% 到 90% 不等,反映 Claude 並非對所有蛋白質都同樣有效。14/15 的總結論,唔應該被解讀成模型具備普遍而穩定的蛋白質設計能力。
研究合共測試了 1,320 個 Claude 設計的蛋白質,其中 354 個能夠與原定目標結合,整體比例為 26.8%。唯一完全搵唔到結合器的目標是 MBP。
驗證流程由 Adaptyv Bio 負責其中一部分:公司以匿名方式收到 Claude 的設計,合成相關 DNA、表達蛋白質,再以表面等離子共振技術(surface plasmon resonance,SPR)測量結合情況,並進行重複及質量控制測試。Twist Bioscience 亦獨立製造及測試另一批設計。
呢一點比純粹以電腦分數作比較的 benchmark 更有分量,因為設計最終要在真實實驗室中製造出來,並且能夠同目標蛋白質結合。不過,測到「會結合」仍然只是早期研究的一關,並未證明它有治療作用。
整個流程並唔係完全冇人參與。Anthropic 先由一位蛋白質設計專家提供約 30,000 個 token 的初始提示,之後只作很少的人手介入。
在工作流程中,Claude 可以:
換句話講,今次展示的重點唔單止係模型「諗出一條蛋白質序列」,而係能夠將多個現成的結構預測、設計及分析工具組織成一套較完整的研究流程。
測試大部分採用已有的 benchmark 目標,另外亦加入兩個較新的比賽目標,目的是降低模型只係重現已知例子的可能性。
Anthropic 表示,至少有六個目標得到高親和力結合器,至少四個目標的結果達到或超過過往公布的親和力水平;部分最出色設計的結合能力,據報更是過去最佳已發表結果的數倍。
以 RBX1 為例,Claude 報稱取得約 40% 的命中率,而過往參加相關比賽的設計者合計約為 3.7%,Claude 的表現亦超過之前的冠軍設計。
不過,「超過過往比賽參賽者」同「全面勝過人類蛋白質工程師」並唔係同一件事。實驗設定、目標選擇、候選數量、評分方法及外部驗證流程,都會影響最後比較結果,因此最穩妥的解讀係:Claude 在特定設計任務上展現出相當強的自動化能力,而唔係已取代整個專業領域。
蛋白質結合器可以理解為一種經設計、能夠黐住特定目標的小型蛋白質。呢類分子可以成為藥物、診斷工具或研究試劑的起點。
但單靠結合親和力,並不足以證明一個候選分子有藥用價值。後續仍然要確認:
所以,今次實驗比較準確的定位,是 AI 協助完成藥物開發早期的一部分工作,而唔係已經建立一套由設計直達上市藥物的系統。
Martin Shkreli 認為,部分公布的親和力對於外界可能聯想到的製藥用途而言仍然偏弱;他亦指出,今次計劃主要集中在細胞外目標,因為蛋白質結合器處理呢類目標相對實際,而非更棘手的細胞內目標。
呢些批評指出咗真正限制,但並不會推翻另一個已測量到的事實:大量 Claude 設計的蛋白質確實在實驗室與指定目標結合。較合理的結論係,模型已經將早期候選設計的效率推高,但距離處理最困難的生物學問題,仍然有明顯距離。
Anthropic 將蛋白質結合器設計、化學數據分析等工作,視為一個更大目標的組成部分:最終建立涵蓋不同生物及化學模態的端到端系統,縮短藥物開發所需的時間、專業門檻及成本。
公司亦表示,剩餘障礙唔只係模型能力,還包括實驗操作、資料、基礎設施及政策規管等問題。現時 Anthropic 對最強的生命科學能力仍有限制,並表示會建立面向科學家的受控使用計劃;至於一般可取得的模型,Opus 5 被形容為目前生命科學工作的最強通用選擇。
同一套可以加快良性蛋白質設計的自主工作流程,亦可能降低進行有害生物研究所需的專業門檻及時間。正因如此,Anthropic 對其最強模型的進階生物研究任務設有限制,並傾向採用受控或經審核的存取方式,而非全面開放。
真正的管治難題,在於如何讓合資格研究人員推進治療及藥物研究,同時避免模型協助病原體工程、毒素相關工作或其他具有雙重用途的生物活動。模型愈能夠自行規劃、呼叫工具及反覆執行實驗流程,安全審核就愈不能只靠攔截幾個關鍵字。
今次實驗最值得注意的地方,是 Claude 能夠有效自主串連現有蛋白質設計工具,並在真實濕實驗中取得明顯高於 Anthropic 所引述業界基準的結合命中率。
但它尚未證明三件事:Claude 可以自主創造一隻藥、已經解決細胞內目標問題,或者可以消除由「結合器」走到「藥物」之間漫長的實驗及監管流程。呢個結果更像係把藥物研發的起跑線向前推咗一截,而唔係已經衝過終點。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Anthropic 的示範有力證明,前沿通用 AI 模型可以自主執行一輪具生產力的早期蛋白質結合器研究,但未證明 Claude 能獨立發現、優化或完成臨床藥物開發。
Anthropic 的示範有力證明,前沿通用 AI 模型可以自主執行一輪具生產力的早期蛋白質結合器研究,但未證明 Claude 能獨立發現、優化或完成臨床藥物開發。 Claude Mythos Preview 及 Claude Opus 4.8 為 15 個接受實驗評估的目標設計結合器,成功命中其中 14 個。
在同時處理多個目標的 48 小時測試中,Mythos 命中率為 26.7%,Opus 4.8 為 22.6%;Anthropic 引述的業界一般水平則為 10% 至 15%。