这并不一定意味着AI“存储”了某个人的信息。更常见的情况是,模型通过不同来源拼接或复现数据,例如:
调查和研究发现,AI泄露联系方式通常来自几种途径。
虽然系统性研究仍然有限,但已有多起报告展示了AI doxxing可能带来的现实后果。
这些案例说明,即使是无意的错误,也可能迅速影响现实生活。
在AI出现之前,很多个人信息处于一种被称为**“实际上的隐匿”(practical obscurity)**的状态。
也就是说:
例如,要查到某人的地址,可能需要浏览多个政府数据库或旧网页。
因此,一些研究者担心:AI实际上正在扮演自动化“数据经纪人”的角色,让敏感信息更容易被规模化获取。
一旦个人数据进入AI生态系统,修复问题并不简单。
同一个电话号码或地址可能存在于多个地方,例如:
语言模型并不像数据库那样存储清晰记录,而是通过统计方式学习模式。因此,在训练完成后精准删除某条数据非常困难。
面对不断增加的担忧,研究人员和AI公司正在尝试多种解决方案:
不过,由于训练数据规模巨大、AI模型结构复杂,专家普遍认为:完全消除这种风险仍然非常困难。
AI doxxing暴露了一个更深层的问题:生成式AI正在改变信息获取的方式。
很多数据并不是秘密,但当搜索变得即时、自动化并且像聊天一样简单时,隐私风险也被放大了。