404 Media对OpenAI内部项目“Project Lily”的调查称,该项目通过一套结构化的人工反馈流程,使用真实ChatGPT对话来改进模型。隐私争议不只是“对话可能被用于模型改进”:按报道说法,外部承包商能够阅读已移除用户名的对话内容,而其中仍可能包含高度私密的个人背景。
2
“Project Lily”据报如何运作
据404 Media查阅的泄露材料,OpenAI通过人力服务机构招募了数百名承包商,审阅真实用户的提示词及ChatGPT回答。相关工作据称时薪超过50美元。审阅员需要概括用户意图,对比4个候选回答,并按1至7分进行评分。
2
报道所述目标是提升回答质量:让ChatGPT少一些机械腔调,避免过度拟人化表述,并减少一味附和或奉承用户的倾向。人工反馈本就是AI开发中的常见方法;但若审阅素材来自真实消费者对话,隐私问题就更直接了。
2
审阅员可能看到哪些内容
404 Media报道称,审阅员可能收到完整对话,在部分情况下还会看到“用户记忆摘要”(user memories summary)。报道指用户名不会显示,但上下文仍可能暴露大致所在地、职业、过去兴趣及个人处境等信息。
2
这里的关键在于:删除姓名,并不等于在实际层面让对话变得无害或真正匿名。工作经历、家庭情况、健康困扰,或某个独特人生事件等细节组合,即使不能直接对应某个账户,也可能十分敏感。
OpenAI的Privacy Filter能做什么,又有什么局限
OpenAI称,其Privacy Filter是一种用于在文本中检测并遮盖个人可识别信息(PII)的模型。
46
47
在“Project Lily”的报道中,OpenAI表示,在内容交给承包商前会移除用户名,并使用自动过滤器。但404 Media报道称,即使经过这些步骤,受审对话中仍可能保留敏感细节。
2
这也说明自动脱敏的边界:系统或许能识别姓名、电子邮箱、电话号码等明显标识符,但对隐含于语境中的身份线索,可靠识别要困难得多。
审阅员据报需要标记什么问题
报道描述的审阅准则不只关注答案是否正确。承包商据报还要识别以下问题:
- 套话化、不自然的“AI腔”
- 暗示自己拥有人的情感或亲身经历的说法
- 过度认同、奉承或其他迎合性行为
- 事实错误
- 个人信息暴露
- 安全风险
2
其中,对“迎合性”的关注尤其值得留意。一个过于急于认同用户的模型,回答或许显得贴心,却可能不会质疑错误、危险或有害的前提。“Project Lily”据称部分目的正是帮助调整这类行为。
2
在对话里说“这事只在我们之间”不是隐私设置
在提示词中要求保密,不会改变账户的数据控制规则。它只是对话内容的一部分,并不是能覆盖OpenAI数据使用设置的技术指令。
对于个人ChatGPT工作区,OpenAI提供的相关开关是**“为所有人改进模型”(Improve the model for everyone)。开启时,对话可能被用于改进模型;关闭后,OpenAI表示不会用新的**对话训练模型。
21
30
如何阻止新的ChatGPT对话被用于模型改进
已登录用户可按以下路径操作:
- 打开ChatGPT中的个人资料菜单。
- 选择**“设置”**。
- 打开**“数据控制”**。
- 关闭**“为所有人改进模型”**。
19
21
这一设置跟随账户,而不是某一台设备。关闭后,既有聊天记录仍可保留在历史记录中;但OpenAI表示,新的对话不会被用于训练模型。
19
30
OpenAI的隐私门户还提供**“不要用我的内容训练”**(Do not train on my content)选项。该公司称,对ChatGPT和Codex任务而言,使用该选项或在产品内关闭数据控制开关,二者任选其一即可。
21
哪些ChatGPT方案默认有更严格的训练数据保护?
OpenAI称,个人工作区中的Free、Plus和Pro方案,默认启用用于模型训练的数据共享,但用户可以选择退出。对于ChatGPT Business、Enterprise、Edu及API Platform,OpenAI称默认不会将提供的输入和输出用于训练模型。
23
不过,这不代表所有企业对话在任何用途下都天然无风险。机构仍应在将机密内容输入任何AI工具前,核查工作区设置、数据保留方式、分享控制及内部合规政策。
实用结论:把消费级AI聊天当作可配置的服务,而非天然保密渠道
按404 Media的报道,“Project Lily”提醒用户:消费级AI聊天服务应被视作带有数据使用设置的产品,而不是天然保密的通信渠道。若提示词涉及高度敏感的个人、法律、医疗、财务或商业专有信息,最直接的做法是在开始新对话之前关闭**“为所有人改进模型”**。
2
21
退出后,OpenAI对新对话的模型改进使用将受到控制。这不是在提示词里写一句保密请求所能实现的效果;OpenAI的文档也没有把它描述为可撤回此前已经提交内容的机制。
21
30