2026 年 5 月 27 日,由馬克·祖克柏(Mark Zuckerberg)與普莉希拉・陳(Priscilla Chan)共同創立的非營利研究機構 Biohub,正式對外公開了一套稱為「蛋白質生物學世界模型」的開源 AI 引擎 。這套引擎,本質上是「演化尺度模型」(Evolutionary Scale Modeling,ESM)的第四代版本,其任務是預測蛋白質結構、繪製橫跨生命之樹的蛋白質圖譜,並設計出在實驗室中真的有效的新型蛋白質結合劑
。
這次釋出,絕非單純的模型版本更新。它是 Biohub 於 2026 年 4 月 29 日公布的 5 億美元「虛擬生物學倡議」(Virtual Biology Initiative) 的第一項重大科學產出,這項倡議的終極目標,是打造人類細胞的預測模型 。以下,我們將抽絲剝繭,看清這次釋出的核心組件、它們如何加速藥物發現、迄今達成的實驗室成果,以及該如何取得使用。
這次釋出由三大核心組件構成,各自在蛋白質研究的工作流程中扮演特定角色。
ESMC 是一款蛋白質語言模型,其訓練資料涵蓋了大約 28 億條蛋白質序列,這些序列來自廣袤的生命領域,包括嗜極生物(在極端環境中生存的生物)以及人體內超過 2 萬種類型的蛋白質 。
它與 Biohub 的旗艦級生成式模型 ESM3 屬於平行發展的模型家族。兩者的分工在於:ESM3 專注於為治療等應用進行可控的蛋白質生成,而 ESMC 則側重於創造能捕捉蛋白質底層生物學機制的表徵(representation)。Biohub 將 ESMC 定位為 ESM2 等早期模型的無縫替代方案 。
ESMFold2 是內建於 ESM3 架構中的結構預測核心。它能直接從蛋白質序列,以業界頂尖的速度與精確度,預測出原子層級的蛋白質結構,而且完全不需要傳統方法中耗時的多序列比對 。這種速度,正是讓大規模結構分析從理論變為現實的關鍵。
ESM 圖譜(ESM Atlas)經歷了一場戲劇性的擴張。最初由 Meta FAIR 釋出的 ESM 宏基因體圖譜,涵蓋了約 6 億個蛋白質結構 。而 Biohub 更新的圖譜,如今繪製了 68 億種蛋白質,其中有 11 億個預測結構,這是數量級上的飛躍,為蛋白質宇宙中更廣闊的疆域提供了結構覆蓋
。
此外,這次釋出還包含 esm3-sm-open-v1,這是一款生成式模型,在 27.8 億個天然蛋白質的基礎上進行訓練,並透過合成資料擴增至 31.5 億條序列、2.36 億個結構與 5.39 億個功能註釋,總計使用了 7710 億個標記(token)進行學習 。該模型以非商業授權釋出,供學術與非營利使用
。
這套工具的實際價值,在於速度與規模。傳統上,設計並驗證一個治療性的蛋白質結合劑,需要經歷數月甚至數年的反覆濕實驗室工作。Biohub 的工具可透過以下三種能力,將這個過程壓縮到數週甚至數天:
對於 AI 設計的蛋白質,一個反覆出現的質疑是:它們在電腦上看起來很完美,但在實驗室中卻往往失效。Biohub 通報的情況顯示,這並非這次的瓶頸。完全透過電腦模擬設計的結合劑,已在真實的實驗室實驗中獲得驗證——這些 AI 設計的蛋白質,確實成功地結合了它們的預期標靶 。
Biohub 科學長亞歷克斯·里夫斯(Alex Rives)表示:「這些模型已經對生物過程獲得了極其精確的表徵能力,讓我們得以透過計算設計蛋白質介面,並在實驗室中獲得符合預期的測試結果。」 這段話的弦外之音是,模型已經捕捉到足夠深厚的基礎生物學知識,足以產出功能性的設計,無須再仰賴反覆的濕實驗室優化。
2026 年 4 月 29 日,Biohub 宣布了 虛擬生物學倡議(Virtual Biology Initiative,VBI),這是一項為期五年、總額 5 億美元的承諾,旨在為建立人類細胞的預測模型,構建所需的多模態資料集與 AI 模型 。在這筆資金中,1 億美元被分配用於協調全球的資料生成工作,其餘 4 億美元則專門用於大規模生成資料,以及開發用於測量、成像和工程化生物學的次世代技術
。
蛋白質生物學的釋出,正是 VBI 旗下的第一個重大科學成果。這項倡議的合作夥伴網絡,涵蓋了許多生物學與科技領域最具指標性的機構:布羅德研究所(Broad Institute)、艾倫研究所(Allen Institute)、Arc 研究所(Arc Institute)、惠康桑格研究所(Wellcome Sanger Institute)、人類細胞圖譜計畫(Human Cell Atlas)、人類蛋白質圖譜計畫(Human Protein Atlas)、輝達(NVIDIA)以及文藝復興慈善基金會(Renaissance Philanthropy)。
ESM 家族的起源並非始於 Biohub。它最初誕生於 Meta AI 的 FAIR 實驗室,該實驗室曾發表了最初的 ESM-1 模型,並於 2023 年在《科學》(Science)期刊上釋出了原始的 ESMFold,生成了第一批超過 6 億個蛋白質結構預測 。那項工作產出了原始的 ESM 宏基因體圖譜,該圖譜在當時是最大的高解析度預測結構資料庫,規模大約是當時現有蛋白質結構資料庫的三倍
。
當 EvolutionScale(由原始 FAIR ESM 團隊成立的初創公司)從 Meta 拆分出來時,Biohub 吸納並延續了這項研究。這次第四代的釋出,直接建立在該技術脈絡之上,而 Biohub 則是以一個開放的公益科學事業之姿,主導了當前的發展 。
研究人員可以透過多個平台,對這些工具進行實驗與部署:
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
2026 年 5 月 27 日,Biohub 釋出 ESMC、ESMFold2 及涵蓋 68 億種蛋白質的 ESM 圖譜,這套開源 AI 工具能純粹透過電腦模擬設計蛋白質結合劑,並已在實驗室中成功驗證,將藥物發現的探索週期從數月縮短至數日 [17][18][20]。
2026 年 5 月 27 日,Biohub 釋出 ESMC、ESMFold2 及涵蓋 68 億種蛋白質的 ESM 圖譜,這套開源 AI 工具能純粹透過電腦模擬設計蛋白質結合劑,並已在實驗室中成功驗證,將藥物發現的探索週期從數月縮短至數日 [17][18][20]。 此釋出是 Biohub 耗資 5 億美元的「虛擬生物學倡議」旗下首個重大科學成果,技術血統直接承襲自 Meta FAIR 實驗室原始開發的 ESM 系列,現已轉型為一項公益性的開源科學事業 [2][8][47]。
研究人員可透過 Hugging Face、GitHub、AWS SageMaker、Biohub 官方入口網站,以及名為 Forge 的託管式 API 取得模型,所有工具均採用非商業授權,供學術與非營利目的使用 [19][21][23]。