Sampura Research由前Google DeepMind研究员Rishub Jain和Josh Jacob创办,并非其公告所称的Alex Adams;该机构于2026年8月25日公开启动。 机构获得Coefficient Giving承诺提供1100万美元资金,其中首年为700万美元,另有400万美元后续承诺。[4] Sampura反对把“AI监督AI”作为唯一方案,主张在人类判断与AI效率之间建立更有针对性的协作机制。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Sampura Research, the London based nonprofit launched on August 24, 2026 by former Google DeepMind researchers Rishub Jain, Joshua J. Article summary: Sampura Research is a London AI safety nonprofit founded by former Google DeepMind researchers Rishub Jain and Josh Jacob—not, based on its own announcement, by Alex Adams.. Topic tags: general web, ai safety, openai, llm, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and
Sampura Research是一家总部位于伦敦的AI安全非营利机构,由前Google DeepMind研究员Rishub Jain和Josh Jacob创办。根据该机构自己的公告,Alex Adams并非联合创始人,而是为公告提供了反馈。Sampura于2026年8月25日正式对外宣布成立,并获得Coefficient Giving承诺提供1100万美元资助:首年计划使用700万美元,另有400万美元承诺用于后续工作。4
AI行业近年来常谈“可扩展监督”(scalable oversight):当模型能力和任务数量不断增长,仅靠人类逐条检查输出既昂贵又缓慢,因此研究者往往让大型语言模型充当“评审员”,自动判断另一个AI系统的回答、行动轨迹是否正确且符合安全要求。
Sampura并不认为这种自动化没有价值,但它质疑让AI评判AI成为默认答案。该机构认为,人类仍然拥有几项不应轻易被替代的优势:
因此,Sampura提出的并不是“所有内容都由人类审核”,而是在人类判断真正能增加安全价值的环节,保留并放大人的参与。
Sampura所说的“裁判”(judge),可以是人类、AI,也可以是两者组成的混合系统。它的任务是评估某个AI回答或智能体行动过程是否正确、是否符合对齐和安全要求。
该机构计划探索几种协作方式:
理想状态下,机器负责速度和规模,人类负责处理模糊、异常或高风险案例。这种设计的关键,不是简单地把人类放在流程末端“盖章”,而是找出人类判断最不可替代的位置。4
Sampura表示,成立后的前六个月将优先用于改进“裁判”系统,并建设一个公开且持续更新的排行榜。平台计划包含20多个子数据集,覆盖包括欺骗检测、文化偏见和不安全智能体行为在内的测试场景。4
它还计划把测试从静态问答推进到更接近真实训练过程的环境:当被监督的模型能够在强化学习中“针对”评审员进行优化时,评审员是否仍然可靠?
这是检验“奖励投机”(reward hacking)的重要环节。所谓奖励投机,是指模型学会利用评估规则获得高分,却没有真正完成任务,甚至通过钻规则漏洞掩盖危险行为。一个只在静态样本上表现良好的评审系统,未必能经受住这种主动规避。
按照Sampura的计划,相关论文、代码、数据集和排行榜将公开发布。开放平台有望让外部研究者复核结果、比较不同评审方法,并更早发现评估标准本身的缺陷。4
Sampura关注的风险并不局限于传统意义上的“AI反叛”或模型完全失控。其公告提到的方向还包括偏见、与儿童互动时的不安全行为,以及用户对陪伴型AI产生过度依赖等问题。4
后续研究还将从“评判模型输出”扩展到更基础的环节:如何生成和评估监督指令、评分标准以及测试案例。换句话说,研究对象不仅是模型答案是否安全,也包括决定“什么算安全”的整套评估基础设施。
这可能帮助研究者更早预判风险,但必须区分研究目标与已验证能力:Sampura目前公布的是一套研究路线,而不是已经证明能够遏制前沿模型的技术系统。4
Sampura计划进一步检验三件事:
该机构可能先让第三方评估人员进行压力测试,再争取将相关方法用于前沿AI实验室的训练、评估和部署监控。不过,从“排行榜上表现良好”到“在真实模型开发流程中持续有效”,中间仍有很长距离。4
这项工作的现实瓶颈之一,是很难找到足够多、同时理解模型能力和安全评估的专业人才。模型评估与威胁研究机构METR公开发布的一份评估执行岗位信息显示,年基本薪资为285,548至503,116美元,并表示对特别优秀的候选人可以进一步提高,这从侧面反映了相关人才的稀缺程度。9
Sampura表示正在伦敦招聘创始阶段的技术团队,因此其招聘动作具有一定战略意义。但目前没有足够的一手来源证明它一定会招聘“至少6人”,且薪资范围为每年10万至29万英镑;Sampura自己的公告只确认了伦敦创始技术岗位正在招聘。4
2026年7月,超过1100名前沿AI从业者签署公开信,呼吁建立国际协调机制:如果前沿AI的发展速度超过人类安全监督能力,国际社会应具备有意放慢开发速度的技术和治理工具。1
Sampura的工作可以被视为这一设想的潜在技术前提之一。更可靠、可审计的评估,能够帮助人们判断模型是否仍在可控范围内,也有助于为“何时需要放慢”提供证据。
但Sampura本身无法创造法律授权、国际协调机制、模型访问权限或执行手段。它的研究最多是治理体系的补充,而不是治理体系的替代品。
Jain的离职发生在Google DeepMind多名研究人员相继离开的背景下。不过,“六天内失去5名核心研究员”的说法主要来自可信度较低的二手报道,目前不应视为已经被独立证实的事实。5
同样,现有材料也不足以支持“AI公司还无法遏制自己造出的东西”这一宽泛结论。更稳妥的判断是:随着模型能力提升,可靠监督仍未得到充分证明;高水平AI评估人才非常稀缺;而Sampura试图让人类参与变得更具规模、更能抵抗模型规避,而不是假设AI可以单独安全地监督AI。
这也是Sampura最值得关注的地方:它没有承诺让人类检查每一次机器行为,而是在尝试回答一个更实际的问题——当AI速度和规模都超过人工审核能力时,人类应当如何继续保有真正有效的控制权?
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Sampura Research由前Google DeepMind研究员Rishub Jain和Josh Jacob创办,并非其公告所称的Alex Adams;该机构于2026年8月25日公开启动。
Sampura Research由前Google DeepMind研究员Rishub Jain和Josh Jacob创办,并非其公告所称的Alex Adams;该机构于2026年8月25日公开启动。 机构获得Coefficient Giving承诺提供1100万美元资金,其中首年为700万美元,另有400万美元后续承诺。[4]
Sampura反对把“AI监督AI”作为唯一方案,主张在人类判断与AI效率之间建立更有针对性的协作机制。