Sampura Research 是一間位於倫敦、專注 AI 安全的非牟利機構。它要處理的問題其實相當直接:當 AI 越來越叻,究竟由誰判斷它做得對不對、安不安全?
Sampura 的答案不是將人類完全踢出監督流程,而是設計一套由人類和 AI 分工、共同把關的系統。機構表示,已獲 Coefficient Giving 提供首筆 1,100 萬美元資助,其中 700 萬美元用於第一年,另有 400 萬美元已承諾撥款。
1
機構的公開成立公告日期是 2026 年 8 月 25 日,並非 8 月 24 日。公告列出 Rishub Jain 和 Josh Jacob 為創辦人。較早的社交媒體帖文曾提到 Alex Adams 參與相關工作,但單憑成立公告,未能確認三人都是正式創辦人。
1
12
Sampura 所說的「裁判」是甚麼?
在 Sampura 的用語中,「裁判」(judge)可以是人類、AI 模型,或者人機混合系統,負責評估另一個 AI 系統的行為是否正確及符合預期。被評估的對象可以是一個答案、一段對話,亦可以是 AI 智能體完成多個步驟的整段過程。
1
這個分別很重要。一般人可能只看見模型能否流暢回答問題、完成複雜任務,但一個看似能幹的模型,仍可能誤導評審、鑽獎勵函數的漏洞,或者在一連串操作中採取不安全行動。Sampura 的研究重點,就是改善負責找出這些問題的監督系統。
機構將這套方向稱為 「以人機互補實現可擴展監督」(Human–AI Complementarity for Scalable Oversight):在自動化可靠的地方交由機器處理,但在需要理解語境、作價值判斷或處理高風險決定時,保留人類參與。
1
點解不可以只靠 AI 監督 AI?
用 AI 監督 AI,最大吸引力是快,而且可以低成本大規模運行。不過,Sampura 認為「快」不等於「可信」。它在成立公告中提出幾項風險:
- 能力不平均: AI 的表現可能相當「鋸齒狀」,即是某些任務做得非常好,換一個看似相近的任務卻突然失準。
- 錯誤模式重疊: 人類和 AI 評審可能犯上相似錯誤,尤其當模型正針對評審流程進行優化時。
- 操控及串通風險: 被監督的系統或會鑽自動評審的漏洞、欺騙評審,甚至設法影響監督者。
- 遇上全新情況時失靈: 新奇或含糊的案例,可能需要人類討論價值取捨,而不是照搬從既有數據學到的偏好。
這些風險並不代表人類評審在任何情況下都一定勝過 AI。它們反而說明,Sampura 想測試的是:在壓力及模型刻意鑽漏洞的情況下,哪一種人機組合最可靠。
1
研究會點樣測試這些「裁判」?
Sampura 首 6 個月的計劃,是建立一個多元化的「裁判」排行榜,涵蓋超過 20 個子數據集。初步範圍包括欺騙行為偵測、文化偏見,以及 AI 智能體作出不安全行動等。
1
測試不會只停留在靜態問答。Sampura 亦計劃設計一類情境:讓被監督的模型在強化學習過程中,直接針對評審進行優化。這樣可以觀察,當模型有動機找出並利用評審弱點時,評審是否仍然有效。
1
研究會比較三大方向:
- 人類評審:由人直接判斷模型表現。
- 純 AI 評審:速度較快,也較容易擴大規模。
- 人機混合評審:由人和 AI 分工,或者協調完成監督工作。
目標不是在某一個狹窄基準測試取得高分,而是要找出能夠在廣泛測試中維持穩定表現的評審系統;即使受監督的模型日後更擅長利用評估漏洞,這些系統仍然要頂得住。
1
人機混合監督可以點運作?
Sampura 提到幾種可能的設計:
- AI 先估計自己有幾大把握,遇到不肯定的個案就升級交由人處理。
- 由分流系統決定,整項監督工作交給人類或 AI 評審其中一方。
- 將複雜任務拆成較細的部分,再將不同子任務分派給人或機器。
- 為人類評分員提供專門介面,令困難評估做得更快、更一致。
換句話說,人類參與不是「全部由人做」或「完全不用人」的二選一,而是需要設計得更精準。有些簡單個案適合自動審查;另一些個案雖然慢一點,卻值得花人力仔細判斷。真正要衡量的,是準確度、成本、速度,以及抵抗模型刻意取巧的能力。
1
之後想研究甚麼?
Sampura 表示,當較強的評審系統建立後,下一步會測試它們能否減少模型訓練期間的「獎勵投機」(reward hacking)。機構亦想研究:監督流程究竟需要多少人手;當基礎模型學懂攻擊監督系統後,評審應如何調整;以及評審能否由單純分類輸出,擴展至起草或評估 AI 系統所用的規格、指令、評分準則及測試案例。
1
Sampura 表示,研究成果預計會透過論文、程式碼、數據集及排行榜公開。
不過,目前可核實的成立資料,支持的是上述數據集、基準測試、分流及人類輔助研究方向;它並未確認所有流傳中的具體項目名稱,包括一個名為「前瞻性傷害」(forward-looking harm)的數據集,或已確定推出的開源人類評分平台。因此,這些描述應視為未經核實,而不是已公布產品。
1
點解招聘會成為關鍵?
Sampura 表示,正於倫敦招聘創辦初期的技術團隊成員。要做這項工作,除了機器學習,還要兼顧評估設計、人機互動、數據運營及實際部署等範疇。
1
較早的公開帖文曾提到會招聘至少 6 名研究人員,並列出 10 萬至 29 萬英鎊的薪酬範圍;不過,這些確切數字未獲機構成立公告確認。
12
13
整個 AI 評估領域都在爭奪一批有限的專才。以另一間 AI 評估機構 METR 為例,其「評估執行」技術職位列出的基本年薪為 285,548 至 503,116 美元,並表示對經驗極為豐富的候選人,可能考慮提供更高薪酬。
18
這反映 Sampura 面對的現實:要建立可靠監督,既需要尖端技術研究,也需要仔細的真實世界評估;但正在處理同一類問題的機構,往往都在搶同一批人才。
這場賭注,放在更大的 AI 安全焦慮之中
Sampura 成立之際,外界正越來越擔心 AI 發展速度會超越監察和治理能力。2026 年 7 月,逾 1,100 名來自大型 AI 公司的員工簽署公開信,促請美國政府支持一套國際技術及治理工具;如果有需要,這些工具可以刻意調節前沿 AI 的發展速度。公開信並不是要求立即叫停 AI 發展。
40
AI 研究人才流動亦相當活躍。路透社報道,Google 的 AI 部門出現領導層變動,亦有知名工程師及研究人員轉投其他公司和初創企業。
49 這些背景有助理解 Sampura 為何在此時成立,但並不代表這間非牟利機構已經解決 AI 安全的根本問題。
Sampura 現階段可以聲稱甚麼?
現有資料最有力支持的,是 Sampura 正在成為一間早期研究機構,專門建立 AI 監督所需的測量及決策基礎設施。它的基準測試及人機混合評估方法,日後或可供 AI 實驗室、獨立評估機構及其他測試模型行為的組織使用。
1
但這和證明自己能夠控制前沿 AI,仍然是兩回事。Sampura 近期真正要做的,是研究當受監督模型具備適應能力、懂得鑽評估漏洞,甚至有動機欺騙評審時,監督系統應該如何設計及測試。
它押注的核心想法是:要讓 AI 安全監督擴大至足夠規模,必然需要自動化;但自動化不應等於將人類從最關鍵的判斷中完全剔除。