据 404 Media 报道,Project Lily 是一项由人工评审员评价 ChatGPT 回复、以帮助改进后续模型行为的项目。也正因此,使用生成式 AI 来完成评价的外包人员会被据报清退:该流程所需的数据价值,本应来自独立的人类判断。若判断由模型代写,系统便无法再清晰衡量人们真正偏好什么。
19
20
Project Lily 的评审员据报在做什么?
报道所述的工作流程中,评审员会看到真实的 ChatGPT 提示词,有时还会看到完整对话。他们需要概括用户意图、比较候选回复,并按 1 至 7 分打分。每项任务最多可包含 4 个候选答案;重点并非单纯核验事实是否正确,而是考察语气、是否过度奉承或迎合(即“谄媚”)、是否作出过度拟人化表述等行为特征。
8
19
这些评分可形成“偏好数据”——即在特定语境下,人类认为哪一种回复更好的结构化记录。只有这些判断足够一致、知情且独立,它们才适合用于把模型调校到预期行为。
Project Lily 据报涉及数百名外部评审员,人员通过 Crossing Hurdles 招募,并由 Mercor 支付报酬;一名评审员称时薪超过 50 美元。另有关于 OpenAI 更广泛评估业务的报道提及,其评分流程中有超过 1 万名承包人员;这一数字不应被理解为 Project Lily 单个项目的规模。
19
6
为什么 AI 生成的评分会违背“人类反馈”的初衷?
AI 评估器速度可能很快,在内部测试中也可能有用,但它回答的是另一个问题,而非“人类偏好如何”。模型往往会复现其训练中学到的模式,并可能偏好措辞、风格或隐含假设都更熟悉的回答。
如果一个模型,或与其密切相关的模型,被反复用于奖励未来模型的输出,可能形成反馈回路:
- 评估模型偏爱更接近其既有偏好的答案;
- 训练过程奖励这些答案;
- 下一代模型更倾向于生成同类模式;
- 不同的表达风格、少数偏好,或评估模型本就无力正确判断的答案,得到的有效反馈会更少。
这并不意味着每一次使用 AI 评估都会让模型变差。只要经过与人类判断的验证,并在明确边界内使用,自动化评估可以发挥作用。但在一个明确委托为收集人类偏好数据的任务中,用 AI 取代人工,会削弱训练信号的独立性——这看来正是相关规定禁止此举的原因。
据报如何识别疑似使用 AI 的情况?
报道显示,主管人员被要求不要依赖 GPTZero 等 AI 文本检测工具,而是通过人工审查工作模式和书面产出作判断,包括措辞异常一致、标点或格式习惯相似、完成任务速度不合常理等信号。
6
这种方法有明显局限:任何单一信号都不能证明某位员工使用了 AI。写得快的人可能只是经验丰富;语言相似也可能源于共用的评分规范。因此,这些信号至多应成为启动调查的线索,而不是直接清退人员的充分证据。可靠的流程必须能区分“值得进一步核查”和“证据足以移出项目”。
为什么具体检测标准不会公开?
机构通常不会公布详细的反规避标准,因为精确清单很容易变成规避指南。承包人员可以刻意改写措辞、延迟提交或改变格式,同时仍把判断外包给模型。
不过,保密也会带来风险:如果工作人员不知道质量判定如何做出,错误就更难申诉。要让诚信机制长期有效,保密的检测方法必须与清晰规则、留痕决策及有实际意义的申诉或纠错渠道并行。
Mercor 据报采取什么政策?
Mercor 据报表示,使用 AI 执行这类评估工作违反其政策;一旦确认违规,相关人员将被立即移出对应项目。报道还称,规则更广泛地禁止使用 AI 辅助,包括利用工具撰写反馈或评论。
6
40
问题不止于“是否用了 AI”:人类反馈本身也会失真
关于故意给出低质量评分的报道说明了更大的问题:“人类反馈”不会因为由人提交,就天然可靠。评审员可能赶工、误解评分标准、为了吞吐量而优化、出于恶意行动,或试图钻不透明质检系统的空子。
这既是技术问题,也是激励问题。模型开发者需要的是经过校准、善意且能预测现实使用体验的判断;而承包人员获得的激励,可能更多指向速度、完成量或避免被淘汰。当两者不一致时,数据就可能充满噪声,甚至出现系统性偏差。
更可靠的评估体系应有哪些护栏?
对于高度依赖语境、带有主观性或难以自动验证的判断,人类审查仍很重要。但它更适合作为一套相互制衡的系统,而非单纯汇集个人评分。可行的保障措施包括:
- 独立交叉评审: 让多位评审员评价部分相同任务,并分析分歧。
- 校准任务: 通过已有明确答案的示例,确认评审员理解评分标准。
- 质量审计: 调查可疑模式,但不把单一文风特征当作确证。
- 角色清晰分离: 区分生产性评审、质量保证和申诉处理。
- 结果验证: 检验高评分数据是否真的改善了用户面对的模型行为。
- 隐私控制: 尽量减少评审员能看到的信息,并持续测试过滤机制是否遗漏敏感内容。Project Lily 的报道指出,尽管采取匿名化措施,对话中仍可能含有个人信息。
19
核心结论很直接:偏好训练是否可信,取决于产生偏好的流程是否可信。人类评审员并不是质量的自动保证;当目标是理解人们实际重视什么时,AI 生成的判断也不能简单替代独立的人类反馈。