Shazeer 係 Transformer 架構嘅共同發明人,亦係 Google Gemini 模型嘅共同負責人,絕對係呢個年代最具影響力嘅 AI 研究員之一。佢離職嘅導火線據報係 Google 內部嘅運算資源重新分配——公司將佢團隊嘅算力撥咗畀 DeepMind 倫敦預訓練團隊,佢所負責嘅 Transformer 變體項目因此被迫擱置 。呢件事特別諷刺嘅係,Google 早喺 2024 年先至用 27 億美元收購佢初創公司 Character.AI,先至請得佢返嚟 。
Jumper 因為共同開發 AlphaFold 而獲得 2024 年諾貝爾化學獎。佢喺 X(前 Twitter)宣布離開 DeepMind,話「差唔多九年啦」。佢最後喺 Google 嘅工作係集中喺 AI 編碼工具,而唔係幫佢贏得諾貝爾獎嘅科學研究 。Jumper 同 Shazeer 一齊離職嘅消息,令 Alphabet 喺一個交易日內市值蒸發約 2700 億美元 。
Adler 被內部視為 Gemini 同 Google AI 編碼項目嘅關鍵貢獻者。知情人士話佢係想喺更加靈活嘅 AI 初創公司工作 。
Pritzel 負責 Gemini 預訓練同 AlphaFold 相關工作。佢嘅離職同 Adler 一齊報導,同樣係追求更快節奏嘅工作環境 。
被譽為 DeepMind「推理王」嘅周登尼,係 Google Brain 推理研究組嘅創辦人。佢嘅離職極之低調,冇公開告別,係 HTX 報導佢更新 LinkedIn 之後先知佢已經喺 Meta 做咗四個月 。周登尼同 Meta 都冇解釋原因。
多個來源都描述 DeepMind 喺 2026 年全年都面對人才流失問題,主要有三大原因 :
周登尼同佢嘅團隊開發咗三項基礎提示技術,已經成為大型語言模型推理嘅核心方法。呢三項技術係層層遞進嘅。
原理: 傳統嘅提示係直接叫模型由「輸入 → 輸出」,但 CoT 就引導模型先產生一串中間嘅自然語言推理步驟,然後先畀最終答案(輸入 → 推理步驟 → 輸出)。
主要好處: 喺算術、常識推理同象徵推理任務上大幅提升表現。而且可以睇到模型嘅「思考過程」,方便解釋。配合大型模型好似 PaLM-540B,CoT 只需要 0.1% 嘅標記例子已經可以達到頂尖水準 。
原理: 呢個係一種解碼策略,改良自 CoT。唔係只行一條推理鏈,而係叫模型用較高嘅溫度抽樣,產生 多條獨立嘅 CoT 推理路徑,然後揀出 最多路徑一致認同嘅答案(多數投票)。
主要好處: 減少單一推理鏈嘅隨機誤差。一條 CoT 路徑可能因為一步出錯就錯晒;Self-Consistency 透過多樣性平均,喺數學同推理基準測試上明顯更加穩陣 。周登尼特別強調,Self-Consistency 唔應該簡單理解為「多數投票」,而係邊緣化(marginalization)嘅實證實現 。
原理: 一個兩階段提示策略,專門處理比提示例子更難嘅問題。首先,模型 拆解 原本嘅難題,變成一系列簡單嘅子問題。然後,順序解答 呢啲子問題,每個子問題嘅答案都會用嚟幫助解答下一個子問題 。
主要好處: 做到「由易到難」嘅泛化——模型可以解決比任何示範例子更難嘅問題。已經喺象徵操作、組合泛化基準(例如 SCAN 同 CFQ)同數學推理任務上得到驗證 。周登尼形容呢個技術係「規劃 + 推理」。
六人名單中嘅五位可以確認喺 2026 年 6 月離開 DeepMind,分別去咗 Meta、OpenAI 或 Anthropic,原因包括挖角、算力分配爭議、以及追求更快嘅工作節奏。Dawn Song 嘅離職無法證實,唔屬於呢次事件。周登尼嘅三項提示技術——Chain-of-Thought、Self-Consistency 同 Least-to-Most——形成一套層層遞進嘅推理方法論:CoT 加入推理步驟,Self-Consistency 加入跨路徑投票,Least-to-Most 加入問題拆解同順序求解。