Sampura Research 于 2026 年 8 月 25 日正式公开亮相,而不是 8 月 24 日;该组织正研发由人类与 AI 共同参与的模型评估系统。 它认为,完全依赖 AI 监督 AI,可能无法识别新型错误,也可能被受监督的模型操纵,甚至与人类评估者犯下相同的错误。
发布者使用 GPT-5.6 Luna 编辑图片由 GPT Image 1.5 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Sampura Research, the London-based nonprofit formally launched on August 24, 2026 by former Google DeepMind researchers Rishub Jain,. Article summary: Sampura Research is a London-based AI-safety nonprofit developing “human–AI complementarity for scalable oversight”: systems in which people and AI jointly evaluate increasingly capable models rather than delegating over. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Sampura Research 是一家总部位于伦敦的人工智能安全非营利组织,关注一个越来越现实的问题:当 AI 系统变得更强时,究竟应该由谁来判断它是否正确、安全且符合预期?
它给出的答案并不是让人类退出监督环节,而是设计一种由人类与 AI 分担监督责任的系统。该组织表示,已获得 Coefficient Giving 提供的首笔 1100 万美元资助,其中 700 万美元用于第一年,另有 400 万美元已获承诺。1
Sampura 的公开发布公告日期为 2026 年 8 月 25 日,并非 8 月 24 日。公告确认 Rishub Jain 和 Josh Jacob 为创始人。此前社交媒体帖子曾提到 Alex Adams 参与相关工作,但发布公告并未证明三人均以正式创始人身份成立了该非营利组织。1
12
在 Sampura 的术语中,“裁判”(judge)可以是人类、AI 模型,也可以是人机混合系统,用来判断另一个 AI 系统的行为是否正确、是否符合安全与对齐要求。被评估的对象可能是一条回答、一段对话,也可能是 AI 智能体执行任务时的一连串步骤。1
这一概念的重要性在于,监督问题往往被视为模型能力问题之外的另一件事。一个模型可以生成流畅的答案、完成复杂任务,却仍可能误导评估者、利用奖励函数的漏洞,或在多步骤执行中采取不安全行动。Sampura 的研究目标,就是改进发现这些问题的评估系统。
该组织将这一方向称为“用于可扩展监督的人机互补”(human–AI complementarity for scalable oversight):在自动化可靠的地方使用机器,同时在人类判断、语境理解或价值权衡不可替代的地方保留人的参与。1
让 AI 监督 AI,最大的吸引力在于速度快、成本低,并且能够大规模运行。但 Sampura 认为,效率本身并不能证明评估者值得信任。其发布声明重点提到了几项风险:
这些担忧并不意味着人类评估者在任何情况下都优于 AI。它们说明,Sampura 希望测试的是:在高压力环境下,人类和机器以何种组合进行评估最可靠,而不是预设所有任务都应由人或 AI 单独完成。1
Sampura 最初六个月的项目重点,是建立一个多样化的评估者排行榜,其中包含 20 多个子数据集。计划覆盖的领域包括欺骗行为检测、文化偏见,以及 AI 智能体采取不安全行动等问题。1
这些测试并不局限于静态的问答题。Sampura 还计划设计这样的场景:在强化学习过程中,被监督的模型直接针对评估者进行优化。这样可以观察,当模型有动机寻找并利用评估漏洞时,评估者是否仍能保持有效。1
研究将比较三类方法:
目标并不是在某一个狭窄基准上取得高分。Sampura 表示,它希望找到能够在广泛测试中保持稳健、并且在被监督模型越来越善于利用评估漏洞时仍然有效的评估者。1
Sampura 已提出几种结合人类与 AI 判断的设计:
这种思路把人类参与视为一个需要优化的变量,而不是非黑即白的开关。有些案例适合低成本、可靠的自动审核;另一些案例则值得投入更多时间由人类处理。真正需要权衡的并非“人类对 AI”,而是准确性、成本、速度,以及抵抗刻意钻漏洞能力之间的组合。1
在提升评估者能力之后,Sampura 表示将测试这些系统能否减少模型训练中的“奖励劫持”(reward hacking),也就是模型通过钻评估规则的空子来获得高奖励。该组织还希望研究:监督需要多少人类参与;当基础模型学会利用监督系统时,评估者应如何调整;以及评估者能否承担输出分类之外的工作。1
这些更广泛的工作可能包括起草或评估用于训练和测试 AI 系统的规格说明、指令、评分标准和测试案例。Sampura 表示,计划通过论文、代码、数据集和排行榜公开研究成果。1
目前可核实的发布材料支持其数据集、基准测试、任务路由和人类辅助计划,但并未确认所有与该组织相关的具体项目名称。包括名为“前瞻性危害”(forward-looking harm)的数据集,以及已确认的开源人类评级平台,目前都应视为未经核实的描述,而不是已经宣布的产品。
Sampura 表示正在伦敦招聘创始阶段的技术团队成员。其项目需要机器学习、评估设计、人机交互、数据运营和部署等多方面经验。1 此前公开帖子曾提到计划再招募至少 6 名研究人员,并给出 10 万至 29 万英镑的薪资范围,但这些具体数字尚未得到该非营利组织正式发布公告的确认。
12
13
整个 AI 评估领域也在争夺数量有限的专业人才。模型评估与威胁研究组织 METR 的一份招聘信息显示,其“技术人员—评估执行”岗位基本年薪范围为 285548 至 503116 美元,并表示对于经验极其丰富的候选人,可能考虑提供更高薪酬。18
这凸显了 Sampura 面临的现实难题:建立可靠的 AI 监督体系不仅需要前沿技术研究,也需要细致的现实场景评估;而正在解决这些问题的组织,往往正在争夺同一批人才。
Sampura 的成立,正值外界越来越担心 AI 的发展速度可能超过监督它的制度和技术。2026 年 7 月,来自大型 AI 公司的 1100 多名员工签署公开信,要求美国政府支持建立国际性的技术与治理工具;如果有必要,这些工具应能有意识地放缓前沿 AI 的发展。公开信并未要求立即停止 AI 开发。40
AI 研究人才的流动也为 Sampura 的成立提供了背景。路透社报道称,谷歌 AI 部门发生领导层调整,且多名知名工程师和研究人员转往其他公司或创业团队。49 这些变化说明行业正在经历激烈的人才竞争,但并不能证明 Sampura 已经解决了 AI 安全这一根本问题。
现有证据最有力地支持这样一个判断:Sampura 是一家早期研究机构,正在建设用于 AI 监督的测量与决策基础设施。未来,其基准测试和混合评估方法可能被 AI 实验室、独立评估机构或其他测试模型行为的组织采用。1
但这与证明 Sampura 能够控制前沿 AI 系统是两回事。它近期要做的,是研究当被监督模型具备适应能力、能力较强,并且有动机通过评估时,监督体系应如何设计和测试。
Sampura 的核心判断是:可扩展的 AI 安全监督或许必须借助自动化,但这种自动化不应把人类排除在最重要的判断之外。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Sampura Research 于 2026 年 8 月 25 日正式公开亮相,而不是 8 月 24 日;该组织正研发由人类与 AI 共同参与的模型评估系统。
Sampura Research 于 2026 年 8 月 25 日正式公开亮相,而不是 8 月 24 日;该组织正研发由人类与 AI 共同参与的模型评估系统。 它认为,完全依赖 AI 监督 AI,可能无法识别新型错误,也可能被受监督的模型操纵,甚至与人类评估者犯下相同的错误。
该组织最初六个月的计划包括建立一个包含 20 多个子数据集的评估者排行榜,对比人类、纯 AI 和混合评估系统的表现。
Sampura Research 于 2026 年 8 月 25 日正式公开亮相,而不是 8 月 24 日;该组织正研发由人类与 AI 共同参与的模型评估系统。 它认为,完全依赖 AI 监督 AI,可能无法识别新型错误,也可能被受监督的模型操纵,甚至与人类评估者犯下相同的错误。
发布者使用 GPT-5.6 Luna 编辑图片由 GPT Image 1.5 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Sampura Research, the London-based nonprofit formally launched on August 24, 2026 by former Google DeepMind researchers Rishub Jain,. Article summary: Sampura Research is a London-based AI-safety nonprofit developing “human–AI complementarity for scalable oversight”: systems in which people and AI jointly evaluate increasingly capable models rather than delegating over. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Sampura Research 是一家总部位于伦敦的人工智能安全非营利组织,关注一个越来越现实的问题:当 AI 系统变得更强时,究竟应该由谁来判断它是否正确、安全且符合预期?
它给出的答案并不是让人类退出监督环节,而是设计一种由人类与 AI 分担监督责任的系统。该组织表示,已获得 Coefficient Giving 提供的首笔 1100 万美元资助,其中 700 万美元用于第一年,另有 400 万美元已获承诺。1
Sampura 的公开发布公告日期为 2026 年 8 月 25 日,并非 8 月 24 日。公告确认 Rishub Jain 和 Josh Jacob 为创始人。此前社交媒体帖子曾提到 Alex Adams 参与相关工作,但发布公告并未证明三人均以正式创始人身份成立了该非营利组织。1
12
在 Sampura 的术语中,“裁判”(judge)可以是人类、AI 模型,也可以是人机混合系统,用来判断另一个 AI 系统的行为是否正确、是否符合安全与对齐要求。被评估的对象可能是一条回答、一段对话,也可能是 AI 智能体执行任务时的一连串步骤。1
这一概念的重要性在于,监督问题往往被视为模型能力问题之外的另一件事。一个模型可以生成流畅的答案、完成复杂任务,却仍可能误导评估者、利用奖励函数的漏洞,或在多步骤执行中采取不安全行动。Sampura 的研究目标,就是改进发现这些问题的评估系统。
该组织将这一方向称为“用于可扩展监督的人机互补”(human–AI complementarity for scalable oversight):在自动化可靠的地方使用机器,同时在人类判断、语境理解或价值权衡不可替代的地方保留人的参与。1
让 AI 监督 AI,最大的吸引力在于速度快、成本低,并且能够大规模运行。但 Sampura 认为,效率本身并不能证明评估者值得信任。其发布声明重点提到了几项风险:
这些担忧并不意味着人类评估者在任何情况下都优于 AI。它们说明,Sampura 希望测试的是:在高压力环境下,人类和机器以何种组合进行评估最可靠,而不是预设所有任务都应由人或 AI 单独完成。1
Sampura 最初六个月的项目重点,是建立一个多样化的评估者排行榜,其中包含 20 多个子数据集。计划覆盖的领域包括欺骗行为检测、文化偏见,以及 AI 智能体采取不安全行动等问题。1
这些测试并不局限于静态的问答题。Sampura 还计划设计这样的场景:在强化学习过程中,被监督的模型直接针对评估者进行优化。这样可以观察,当模型有动机寻找并利用评估漏洞时,评估者是否仍能保持有效。1
研究将比较三类方法:
目标并不是在某一个狭窄基准上取得高分。Sampura 表示,它希望找到能够在广泛测试中保持稳健、并且在被监督模型越来越善于利用评估漏洞时仍然有效的评估者。1
Sampura 已提出几种结合人类与 AI 判断的设计:
这种思路把人类参与视为一个需要优化的变量,而不是非黑即白的开关。有些案例适合低成本、可靠的自动审核;另一些案例则值得投入更多时间由人类处理。真正需要权衡的并非“人类对 AI”,而是准确性、成本、速度,以及抵抗刻意钻漏洞能力之间的组合。1
在提升评估者能力之后,Sampura 表示将测试这些系统能否减少模型训练中的“奖励劫持”(reward hacking),也就是模型通过钻评估规则的空子来获得高奖励。该组织还希望研究:监督需要多少人类参与;当基础模型学会利用监督系统时,评估者应如何调整;以及评估者能否承担输出分类之外的工作。1
这些更广泛的工作可能包括起草或评估用于训练和测试 AI 系统的规格说明、指令、评分标准和测试案例。Sampura 表示,计划通过论文、代码、数据集和排行榜公开研究成果。1
目前可核实的发布材料支持其数据集、基准测试、任务路由和人类辅助计划,但并未确认所有与该组织相关的具体项目名称。包括名为“前瞻性危害”(forward-looking harm)的数据集,以及已确认的开源人类评级平台,目前都应视为未经核实的描述,而不是已经宣布的产品。
Sampura 表示正在伦敦招聘创始阶段的技术团队成员。其项目需要机器学习、评估设计、人机交互、数据运营和部署等多方面经验。1 此前公开帖子曾提到计划再招募至少 6 名研究人员,并给出 10 万至 29 万英镑的薪资范围,但这些具体数字尚未得到该非营利组织正式发布公告的确认。
12
13
整个 AI 评估领域也在争夺数量有限的专业人才。模型评估与威胁研究组织 METR 的一份招聘信息显示,其“技术人员—评估执行”岗位基本年薪范围为 285548 至 503116 美元,并表示对于经验极其丰富的候选人,可能考虑提供更高薪酬。18
这凸显了 Sampura 面临的现实难题:建立可靠的 AI 监督体系不仅需要前沿技术研究,也需要细致的现实场景评估;而正在解决这些问题的组织,往往正在争夺同一批人才。
Sampura 的成立,正值外界越来越担心 AI 的发展速度可能超过监督它的制度和技术。2026 年 7 月,来自大型 AI 公司的 1100 多名员工签署公开信,要求美国政府支持建立国际性的技术与治理工具;如果有必要,这些工具应能有意识地放缓前沿 AI 的发展。公开信并未要求立即停止 AI 开发。40
AI 研究人才的流动也为 Sampura 的成立提供了背景。路透社报道称,谷歌 AI 部门发生领导层调整,且多名知名工程师和研究人员转往其他公司或创业团队。49 这些变化说明行业正在经历激烈的人才竞争,但并不能证明 Sampura 已经解决了 AI 安全这一根本问题。
现有证据最有力地支持这样一个判断:Sampura 是一家早期研究机构,正在建设用于 AI 监督的测量与决策基础设施。未来,其基准测试和混合评估方法可能被 AI 实验室、独立评估机构或其他测试模型行为的组织采用。1
但这与证明 Sampura 能够控制前沿 AI 系统是两回事。它近期要做的,是研究当被监督模型具备适应能力、能力较强,并且有动机通过评估时,监督体系应如何设计和测试。
Sampura 的核心判断是:可扩展的 AI 安全监督或许必须借助自动化,但这种自动化不应把人类排除在最重要的判断之外。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Sampura Research 于 2026 年 8 月 25 日正式公开亮相,而不是 8 月 24 日;该组织正研发由人类与 AI 共同参与的模型评估系统。
Sampura Research 于 2026 年 8 月 25 日正式公开亮相,而不是 8 月 24 日;该组织正研发由人类与 AI 共同参与的模型评估系统。 它认为,完全依赖 AI 监督 AI,可能无法识别新型错误,也可能被受监督的模型操纵,甚至与人类评估者犯下相同的错误。
该组织最初六个月的计划包括建立一个包含 20 多个子数据集的评估者排行榜,对比人类、纯 AI 和混合评估系统的表现。