可识别个人信息、商业秘密、未公开政府文件,不应直接贴进一般公开型 AI。即使只是让 AI 摘要、翻译、润色、改写或排查代码,只要输入内容可能暴露个人、客户、内部决策、凭证或受保护信息,就应先做去标识化、删除敏感字段,或改用组织批准的受控环境。
最稳妥的判断标准不是 AI 品牌,而是四件事:资料是否敏感,服务如何留存或使用资料,组织是否明确允许,出事后能否追踪和处置。NIST 将数据保护、数据留存、监控、事件响应、退出选项和基于风险的控制列为生成式 AI 治理项目;如果这些问题没有答案,就不应上传原文。
| 资料类型 | 基本原则 | 上传前要确认 |
|---|---|---|
| 个人信息 | 不要直接上传能识别个人的原文。确有必要时,先做数据最小化、遮蔽或去标识化,并确认服务条款和组织规则允许。 | EDPB 将 LLM 隐私风险与缓解措施列为专门议题;NIST 也把数据保护、数据留存、影响评估和监控纳入生成式 AI 治理。 |
| 商业秘密 | 不要上传到未获批准的公共 AI。合同、客户名单、投标或并购资料、法务文件、源代码、密钥和凭证,都应按高风险资料处理。 | NIST 的治理项目涵盖商业使用、数据来源、数据保护、数据留存、事件响应、监控和安全软件开发。 |
| 政府文件 | 先区分已公开、低敏感、依法可再利用的资料,与未公开公文、内部签报、政策草案、调查或执法资料。后者不应放进一般公开型 AI。 | JRC 报告把公共部门使用生成式 AI 列为专门领域;欧洲议会附件中的案例摘要也提到,使用官方 Bundestag(德国联邦议院)数据时应避免个人或敏感信息。 |
只要有一个问题答不出来,就先不要把原文放进一般公开型 AI。
不要把提示词里一句请保密当成安全控制。真正需要确认的是:资料会怎样保存,谁能访问,是否可以退出再利用,出事时谁负责处理,以及你的组织是否允许这样做。
下面的清单,是把数据保护、数据留存和基于风险的控制原则,转成日常可用的判断方式。它不是法律意见,仍应以你所在组织的网络安全、法务、个人信息保护和公文管理规则为准。
公开不等于零风险。如果公开资料中仍含个人信息或敏感信息,仍要回到隐私风险和数据保护规则来处理。
这类资料不一定永远不能用 AI 处理,但不应在没有审批、没有留存规则、没有监控和事件响应机制时,直接丢进一般公开型 AI。
如果身份证号、手机号、邮箱、地址、账号、案号、罕见职务、日期地点组合仍能指向特定个人或案件,隐私风险可能依然存在。EDPB 文件的核心关切之一,就是 LLM 系统中的隐私风险与缓解;因此,上传前应把识别信息、可回推细节和非必要字段一并移除或改写。
更稳妥的做法是:用代称替代真实姓名和公司名;只提供任务所必需的片段;把原始文件改写成抽象场景;对名单、记录或表格先做汇总;如果确实需要处理原文,改走组织批准的工具和流程。
公共部门使用生成式 AI,不是简单的允许或禁止二选一。JRC 的生成式 AI Outlook 报告把公共部门应用列为专门讨论领域;欧洲议会附件中的案例摘要也提到,使用官方 Bundestag 数据时避免个人或敏感信息。
通常较可考虑的是已公开、低敏感、可依法使用的官方资料;需要特别保守处理的,是未公开公文、内部签报、政策草案、调查资料、执法资料、采购评审资料,以及任何含个人信息或敏感信息的文件。前者仍要检查使用条件;后者不应直接放进一般公开型 AI。
如果资料外泄会伤害个人、组织、公共利益或合规状态,就不要把原文交给一般公开型 AI。先遮蔽、摘要、最小化;如果任务确实需要原文,改走审批流程和受控工具,并确认数据保护、数据留存、访问权限、监控和事件响应机制。