在一些案例中,聊天机器人从公共记录、训练数据或分散在互联网上的信息中提取细节,然后在对话中直接给出结果。原本需要大量时间才能找到的信息,如今可能在一次提问中就被展示出来 。
这会把“理论上公开但难以查找”的信息,变成现实中的骚扰、诈骗或跟踪风险。
传统意义上的“doxxing”(人肉搜索)通常指有人故意在网上公开他人的私人信息,以骚扰或威胁对方。
而在AI时代,这个过程可能变得自动化。
用户只需要向聊天机器人提出自然语言问题,例如:
在部分测试或案例中,聊天机器人给出的答案里出现了真实个人的电话号码或住宅地址 。
这并不一定意味着AI“存储”了某个人的信息。更常见的情况是,模型通过不同来源拼接或复现数据,例如:
当AI把这些信息组合成一个回答时,它就可能让个人信息比以往更容易被找到 。
调查和研究发现,AI泄露联系方式通常来自几种途径。
大型语言模型在训练时会使用海量文本数据,包括网页、公开文件和档案。有些数据本身就包含电话号码或地址,在特定问题下模型可能复现这些信息 。
即使信息本来就是公开的,AI也能把它们迅速整合。例如,本来需要在房地产登记、政府文件和目录网站之间反复搜索的信息,聊天机器人可能一次回答就给出结果 。
部分事件并不是AI检索到真实信息,而是生成错误答案。例如把某个普通人的电话号码误认为企业客服号码 。
研究人员发现,通过一步步缩小问题范围,有时可以绕过AI的安全限制,从而得到敏感信息 。
虽然系统性研究仍然有限,但已有多起报告展示了AI doxxing可能带来的现实后果。
• “AI给了我你的号码”:一名受害者表示,陌生人打电话给他时称电话号码是从聊天机器人获得的,因为AI把他的号码当成某些服务的联系方式 。
• 大量误拨电话:有人报告说,他们不断接到寻求法律咨询或开锁服务的电话,而对方表示是从AI查询到这个号码 。
• 软件开发者被误认为客服:一名以色列软件开发者开始频繁接到客户服务电话,因为AI系统把他的私人号码当成企业联系方式 。
• 研究人员提取个人信息:大学研究人员测试发现,通过特定提示,有时可以从聊天机器人回答中获取同事的手机号码或教授的家庭住址 。
• AI提供住宅地址:一些调查还发现,某些聊天机器人在简单提示下会返回普通人的家庭住址,这引发了严重的安全担忧 。
这些案例说明,即使是无意的错误,也可能迅速影响现实生活。
在AI出现之前,很多个人信息处于一种被称为**“实际上的隐匿”(practical obscurity)**的状态。
也就是说:
例如,要查到某人的地址,可能需要浏览多个政府数据库或旧网页。
AI聊天机器人极大降低了这种搜索成本。用户只需一句自然语言提问,系统就能自动检索并总结信息 。
因此,一些研究者担心:AI实际上正在扮演自动化“数据经纪人”的角色,让敏感信息更容易被规模化获取。
一旦个人数据进入AI生态系统,修复问题并不简单。
同一个电话号码或地址可能存在于多个地方,例如:
删除一个来源,并不代表模型不会从其他来源再生成类似信息 。
语言模型并不像数据库那样存储清晰记录,而是通过统计方式学习模式。因此,在训练完成后精准删除某条数据非常困难。
很多AI系统会阻止用户直接询问个人联系方式,但不同措辞或多轮提问可能绕过这些限制 。
研究人员指出,AI公司的隐私政策往往复杂难懂,用户很难知道自己的数据是否被使用或如何申请删除 。
面对不断增加的担忧,研究人员和AI公司正在尝试多种解决方案:
减少敏感数据进入训练集:尽量排除可能包含个人联系方式的数据来源 。
加强安全测试:通过模拟“doxxing”提示来测试模型漏洞,并改进防护机制 。
限制敏感输出:一些系统即使信息公开,也会拒绝提供个人电话号码或家庭住址 。
建立举报和删除渠道:专家建议建立更清晰的申诉和数据删除流程,帮助受影响的人快速处理问题 。
不过,由于训练数据规模巨大、AI模型结构复杂,专家普遍认为:完全消除这种风险仍然非常困难。
AI doxxing暴露了一个更深层的问题:生成式AI正在改变信息获取的方式。
很多数据并不是秘密,但当搜索变得即时、自动化并且像聊天一样简单时,隐私风险也被放大了。
随着AI助手逐渐嵌入搜索引擎、聊天应用和办公工具,研究人员警告说,未来可能需要更严格的数据保护规则和更清晰的隐私标准,以避免个人信息被意外曝光 。