Sampura Research 是一家位於倫敦、專注 AI 安全的非營利組織,關注一個愈來愈迫切的問題:當 AI 系統變得更強大,究竟該由誰判斷它是否正確且安全?
這家組織的答案不是把人類排除在外,而是設計由人類與 AI 共同分擔監督工作的系統。Sampura 表示,已獲得 Coefficient Giving 提供的 1,100 萬美元初始資助,包括第一年 700 萬美元,以及另行承諾的 400 萬美元。
1
Sampura 的正式公開公告日期是 2026 年 8 月 25 日,並非 8 月 24 日。公告列出 Rishub Jain 與 Josh Jacob 為創辦人。
1 早期社群媒體貼文曾提到 Alex Adams 參與相關工作,但現有公告不足以證明三人都以正式創辦人身分成立該非營利組織。
12
Sampura 所說的 AI「評審」是什麼?
在 Sampura 的術語中,「評審」(judge)可以是人類、AI 模型,或人機混合系統,負責判斷另一個 AI 系統的行為是否正確且符合預期。被評估的對象可能是一個單一答案、一段對話,或 AI 代理人執行任務時的一連串步驟。
1
這個概念之所以重要,是因為監督能力往往被視為模型能力之外的另一個問題。模型可以寫出流暢答案、完成複雜任務,卻同時誤導評估者、利用獎勵函數的漏洞,或在多步驟操作中採取不安全行動。Sampura 想研究的,正是如何改善偵測這些失誤的系統。
該組織將這套方向稱為「以人機互補實現可擴展監督」(Human–AI Complementarity for Scalable Oversight):在自動化可靠的地方使用自動化,但在需要判斷、詮釋或涉及價值取捨的地方保留人類參與。
1
為什麼不接受只靠 AI 監督 AI?
AI 評估者的優勢很明顯:速度快、成本較低,也能大規模運作。但 Sampura 認為,速度並不等於可信。其公開聲明特別指出幾項風險:
- 能力不均勻: AI 的表現可能十分「鋸齒狀」,在部分任務上很強,換到另一類任務卻意外地脆弱。
- 錯誤模式重疊: 人類與 AI 評估者可能犯下相似錯誤,尤其當模型開始針對評估流程進行最佳化時。
- 操弄與串通: 被監督的系統可能利用、欺騙,或以其他方式影響自動化評估者。
- 面對新情境的限制: 新穎或含糊的案例,可能需要人類針對價值進行討論,而不只是套用從資料中學到的偏好。
這些疑慮不代表人類評審永遠比 AI 好,而是說明 Sampura 想實際測試:在壓力下,哪種人機組合最可靠,而不是預設所有情況都應交給人類或 AI 單獨處理。
1
研究會如何測試這些「評審」?
Sampura 最初六個月的計畫,是建立一個多元的評審排行榜,涵蓋超過 20 個子資料集。測試範圍包括欺騙偵測、文化偏見,以及 AI 代理人採取不安全行動等情境。
1
評估不會只停留在靜態問答。Sampura 也計畫設計一種情境:讓受監督模型在強化學習過程中,直接針對評審進行最佳化。這樣可以觀察,當模型有動機找出並利用評估漏洞時,評審是否仍能維持效力。
1
研究將比較三大類方法:
- 人類評審: 由人直接判斷模型行為。
- 純 AI 評審: 以速度和規模取勝。
- 混合評審: 由人類與 AI 分工或協同完成評估。
目標不是只在某一項狹窄基準測試取得高分,而是找出能在廣泛測試中保持穩健、即使受監督模型變得更善於鑽評估漏洞也仍然有效的評審系統。
1
混合監督可能如何運作?
Sampura 提出的設計包括:
- 由 AI 估計自己的信心程度,把不確定的案例交由人類處理。
- 由路由系統判斷整項監督任務應交給人類或 AI 評估者。
- 把複雜任務拆成較小的部分,再將不同子任務分配給人類或機器。
- 為人類評分者提供專門介面,讓困難評估更快速、更一致。
這種做法把人類參與視為一項需要最佳化的資源,而不是「全部由人做」或「完全自動化」的二選一。有些案例適合低成本、自動化審查;另一些案例則值得投入較慢但更審慎的人類判斷。真正要權衡的,不是「人類對 AI」,而是準確度、成本、速度,以及抵抗刻意鑽漏洞能力之間的組合。
1
後續研究:從判斷輸出到設計規則
在建立更強的評審後,Sampura 表示,下一步將測試這些系統能否降低模型訓練中的「獎勵駭客」(reward hacking)問題。組織也希望研究:需要多少人力才足夠、當基礎模型學會利用監督漏洞時評審應如何調整,以及評審能否不只分類輸出,還能協助草擬或評估模型的規格、指令、評分規準與測試案例。
1
Sampura 表示,未來將透過論文、程式碼、資料集及排行榜公開研究成果。
1
不過,目前可查證的公開材料只支持其資料集、基準測試、任務分流與人類輔助等大方向。外界提到的特定「前瞻性傷害」資料集,以及已確認的開源人類評分平台,尚未被現有公告證實,因此不應視為已宣布的產品。
為什麼招募人才是關鍵?
Sampura 表示,正在倫敦招募創始階段的技術團隊。其研究需要機器學習、評估設計、人機互動、資料作業與部署等多方面能力。
1 早期公開貼文曾提到招募至少 6 名研究人員,薪資約為 10 萬至 29 萬英鎊,但這些確切數字並未獲非營利組織正式公告確認。
12
13
AI 評估領域同時也在爭奪有限的專業人才。METR 一個「技術團隊成員・評估執行」職位的基本年薪範圍為 285,548 至 503,116 美元,並表示對經驗極為豐富的候選人可能提供更高待遇。
18
這個對比突顯了 Sampura 的挑戰:可靠的 AI 監督不只需要技術研究,也需要細緻的真實世界評估;而投入這類工作的機構,往往正爭奪同一批專業人才。
AI 發展速度,是否已超越監督能力?
Sampura 成立之際,外界對 AI 發展可能超越監督機制的疑慮也在升溫。2026 年 7 月,超過 1,100 名主要 AI 公司的員工簽署公開信,要求美國政府支持建立國際性的技術與治理工具;如果有需要,這些工具可以刻意放慢前沿 AI 的發展速度。公開信並不是要求立即停止 AI 開發。
40
同一時期,AI 研究人才也出現明顯流動。路透社報導 Google AI 部門進行領導層調整,並有多名知名工程師與研究人員轉往其他公司或新創企業。
49 這些事件提供了 Sampura 成立的背景,但不代表該非營利組織已經解決 AI 安全問題。
Sampura 現階段能主張什麼?
目前最有力的證據顯示,Sampura 是一家早期研究組織,正在建立 AI 監督所需的測量與決策基礎設施。其基準測試與混合評估方法,未來或可供 AI 實驗室、獨立評估者及其他測試模型行為的機構使用。
1
但這與證明 Sampura 能夠控制前沿 AI 系統,是兩回事。它眼前的工作,是研究當受監督模型具備高度能力、能適應環境,甚至有動機通過評估時,監督機制應如何設計與測試。
Sampura 的核心押注很清楚:要讓 AI 安全監督擴大到足以應付更強大的模型,勢必需要自動化;但這種自動化,不應把人類從最重要的判斷中完全移除。