Sampura Research 由前 Google DeepMind 研究員 Rishub Jain 與 Josh Jacob 創辦;根據官方公告,Alex Adams 並非創辦人。組織於 2026 年 8 月 25 日公開亮相,獲 Coefficient Giving 承諾提供 1,100 萬美元資助。[4] Sampura 不主張讓 AI 完全取代人類評估者,而是研究由人類、AI 或兩者組成的混合「裁判」,把人力集中在最需要安全判斷的案例。 首階段計畫建立超過 20 個子資料集與持續更新的公開排行榜,測試欺騙偵測、文化偏見、不安全代理行為,以及模型是否會鑽評估漏洞。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Sampura Research, the London based nonprofit launched on August 24, 2026 by former Google DeepMind researchers Rishub Jain, Joshua J. Article summary: Sampura Research is a London AI safety nonprofit founded by former Google DeepMind researchers Rishub Jain and Josh Jacob—not, based on its own announcement, by Alex Adams.. Topic tags: general web, ai safety, openai, llm, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and
Sampura Research 是一家位於倫敦、專注 AI 安全的非營利組織,由前 Google DeepMind 研究員 Rishub Jain 與 Josh Jacob 創辦。根據 Sampura 自己的公告,組織是在 2026 年 8 月 25 日對外宣布成立,而不是 8 月 24 日;公告也沒有把 Alex Adams 列為創辦人,只提到他曾為公告提供意見。4
Sampura 表示,組織獲 Coefficient Giving 提供一筆初始 1,100 萬美元資助,其中 700 萬美元用於第一年,另有 400 萬美元承諾日後提供。4部分報導則將已到位資金寫成 650 萬美元、另有 420 萬美元承諾;這些數字與 Sampura 官方公告的 1,100 萬美元說法並不完全一致,因此以官方資訊為主要依據較為穩妥。
先進 AI 研究常談到「可擴展監督」(scalable oversight):當模型的能力超過一般人直接檢查的範圍,就讓另一個大型語言模型充當評估者或裁判,以較低成本、更快速度檢查被監督模型的答案與行為。
Sampura 認為,這種做法雖然有效率,卻不應成為唯一方案。人類仍可能保有幾項 AI 難以穩定取代的功能:
換句話說,Sampura 的立場不是「所有工作都交給人類」,而是不要預設 AI 必然能安全地監督另一個 AI。
Sampura 所說的 judge(裁判),可以是人類、AI,或由兩者組成的系統,用來判斷 AI 回應或代理程式行動是否正確、是否符合安全與對齊要求。
其規劃中的人機互補方法包括:
目標不是讓人類逐一審查所有 AI 輸出,而是在成本、速度與安全性之間取得更好的平衡,把有限的人力用在最能增加安全價值的地方。4
Sampura 表示,成立後首六個月將優先改善「裁判」能力,建立一個公開且持續更新的排行榜,內容涵蓋 20 多個子資料集。研究範圍包括欺騙行為偵測、文化偏見,以及 AI 代理執行不安全行動等情境。4
它計畫公開發表論文、程式碼、資料集與排行榜,讓外部研究者能夠檢查不同評估方法的表現,而不只依賴 AI 開發公司的內部測試。
更重要的是,Sampura 不只打算用靜態題目測試裁判。它也希望檢驗:當被監督的模型在強化學習過程中,能夠針對評估標準進行最佳化時,裁判是否仍然可靠。這直接對應到 AI 安全領域的「獎勵駭客」(reward hacking)問題——模型可能學會最大化評分,卻沒有真正完成原本想要的目標。4
Sampura 的研究範圍也不局限於傳統想像中的「AI 反叛」或模型脫離控制。官方公告提到的風險還包括:
後續工作還可能從「評估模型輸出」延伸到產生與檢驗背後的指令、評分規則與測試案例。這有助於提前找出評估盲點,但必須保持界線:Sampura 目前提出的是研究方向與測試方法,不代表它已展示能遏制先進 AI 的實際能力。
Sampura 將面對的關鍵問題,不是能否打造一個看起來更聰明的裁判,而是更好的裁判能否在實際部署中降低風險。它提出的驗證方向包括:
如果這些測試無法證明人機協作比純 AI 評估更可靠,Sampura 的核心主張就仍停留在合理假設,而不是已驗證的工程方案。
AI 安全研究的瓶頸不只在資金,也在於是否找得到具備模型評估、資安與實驗設計經驗的人才。非營利研究組織 METR 的「評估執行」職缺曾列出每年 285,548 至 503,116 美元的基本薪酬,並表示對極優秀、經驗非常豐富的候選人,待遇可能高於這個範圍。9
這反映出高階 AI 評估人才的稀缺程度,也讓 Sampura 在倫敦招聘創始技術團隊具有戰略意義。不過,目前沒有足夠的一手資料證實 Sampura 一定會招聘「至少 6 人」,或提供年薪 10 萬至 29 萬英鎊;官方公告只確認正在倫敦招聘創始技術人員。4
2026 年 7 月,超過 1,100 名來自前沿 AI 公司的從業者簽署公開信,呼籲建立國際性的技術與治理機制,以便在 AI 發展速度超過人類安全監督能力時,能夠有意識地放慢進度。1
Sampura 的工作可以提供其中一項可能的技術基礎:更可信、可稽核、能持續更新的 AI 評估工具。但它本身無法創造法律授權、國際協調、模型存取權或執法能力。因此,Sampura 的研究是治理機制的補充,不是治理機制的替代品。
Jain 的離職發生在 Google DeepMind 一連串人事變動期間。不過,「六天內流失五名核心研究員」這種說法主要見於可信度較低的二手報導,目前不應視為已獲獨立確認的事實。5
同樣地,現有資料也不足以支持「AI 公司還無法遏制自己打造的系統」這種廣泛結論。較穩妥的判斷是:隨著模型能力提升,可靠監督仍未被證明足夠穩健;具備相關經驗的評估人才十分稀缺;而 Sampura 正嘗試讓人類參與變得更具規模、更能抵抗模型與評估者互相適應的風險。
它真正提出的問題,並不是人類是否要完全取代 AI,而是:在 AI 變得更快、更自主之前,我們能否設計出一套讓人類仍然能有效介入、質疑與踩煞車的監督系統?
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
Sampura Research 由前 Google DeepMind 研究員 Rishub Jain 與 Josh Jacob 創辦;根據官方公告,Alex Adams 並非創辦人。組織於 2026 年 8 月 25 日公開亮相,獲 Coefficient Giving 承諾提供 1,100 萬美元資助。[4]
Sampura Research 由前 Google DeepMind 研究員 Rishub Jain 與 Josh Jacob 創辦;根據官方公告,Alex Adams 並非創辦人。組織於 2026 年 8 月 25 日公開亮相,獲 Coefficient Giving 承諾提供 1,100 萬美元資助。[4] Sampura 不主張讓 AI 完全取代人類評估者,而是研究由人類、AI 或兩者組成的混合「裁判」,把人力集中在最需要安全判斷的案例。
首階段計畫建立超過 20 個子資料集與持續更新的公開排行榜,測試欺騙偵測、文化偏見、不安全代理行為,以及模型是否會鑽評估漏洞。