原本「理論上公開」但難以搜尋嘅資料,一旦被 AI 整合,就可能變成實際風險,例如騷擾電話、詐騙或跟蹤行為。
傳統所講嘅「起底」(doxxing),通常係有人故意將他人私隱資料公開,目的是騷擾或威嚇。
而喺 AI 時代,過程可以變得自動化。
用戶只需要用自然語言問一句,例如某人嘅聯絡方法,或者某地址住邊個,部分聊天機械人曾經回覆真實個人的電話號碼或住宅地址 。
AI 模型未必真係「記得」某個人嘅資料,但有可能透過以下來源重建出來:
當 AI 將呢啲碎片整合成一個完整答案時,個人資料就會比以往更容易被找到 。
調查同用戶報告指出,AI 出現資料曝光通常有幾種途徑。
大型語言模型需要用大量數據訓練,包括網頁、檔案存檔或政府公開文件。其中部分資料可能包含電話或地址,因此 AI 有時會喺特定問題下重現呢啲資訊 。
即使資料 technically 係公開,但以前要逐個資料庫搜尋。AI 可以瞬間整合,例如地產記錄、電話名錄或公開文件,然後直接回覆 。
有些事件其實係錯誤答案,而唔係真正搜尋到資料。例如 AI 將某個真人電話號碼錯誤地當成公司客服或服務熱線 。
研究人員發現,如果一步一步縮窄問題,有時可以繞過安全限制,令 AI 最終透露敏感資料 。
雖然目前系統性統計仍然有限,但多宗報道案例顯示問題已經影響現實生活。
• 陌生人打電話騷擾:有人表示接到陌生來電,對方聲稱係從聊天機械人得到電話號碼,原本只係搜尋鎖匠或法律服務 。
• 「AI 畀咗我你個電話」:有受害者表示,多名來電者都話係 AI 提供佢嘅號碼作為服務聯絡,導致持續騷擾電話 。
• 以色列程式員被誤當客服:一名軟件開發者開始接到大量求助電話,原因係 AI 把佢個私人號碼當成服務聯絡電話 。
• 研究人員成功提取聯絡資料:大學研究測試發現,一些提示可以令聊天機械人透露同事電話或教授住址 。
• AI 回覆私人住宅地址:調查亦發現,有 AI 系統喺輸入姓名後回覆普通市民嘅住宅地址,引起嚴重私隱憂慮 。
呢啲例子顯示,即使只係「意外」披露,都可能迅速造成現實世界影響。
喺 AI 出現之前,很多個人資料處於一種叫**「實際上的模糊」(practical obscurity)**嘅狀態。
意思係:資料 technically 公開,但要花大量時間先找到。例如要逐個政府資料庫或舊網站查。
AI 聊天機械人將自然語言問題變成自動搜尋同整理,令呢種搜尋成本幾乎消失 。
結果係:原本埋喺文件入面嘅資料,可以喺一個聊天回覆入面即時出現。
有私隱研究員因此形容,AI 有可能變成一種自動化資料經紀(data broker),令敏感資訊更容易被取得。
即使公司想解決 AI 起底問題,技術上亦相當困難。
同一個電話或地址可能出現在多個地方,例如網頁存檔、政府記錄、資料集或電話名錄。刪除其中一個來源未必足夠 。
大型語言模型係以統計方式學習語言模式,而唔係以表格形式儲存資料,因此很難精準刪除某條特定資訊。
不少 AI 平台已經加入安全過濾,阻止查詢個人電話或地址,但不同提示方式或語境下,限制效果未必一致 。
研究指出,AI 私隱政策通常難理解,普通人未必知道自己資料點樣被使用,亦唔清楚如何要求刪除 。
私隱研究員同 AI 公司正研究多種方法減低風險:
減少收集個人資料:盡量避免把含有電話或地址嘅資料來源納入訓練數據 。
更嚴格測試:用專門設計嘅提示測試 AI 是否會洩露個人資料,以改善安全措施 。
封鎖敏感輸出:有些系統會直接拒絕提供私人電話或住宅地址,即使資料可能係公開 。
更快嘅投訴機制:建立清晰渠道,讓被曝光資料嘅人士可以申請移除或更正 。
不過,由於訓練數據規模巨大,加上模型運作方式複雜,研究人員普遍認為要完全消除風險仍然非常困難。
AI doxxing 其實揭示咗一個更深層問題:生成式 AI 可以令原本難以搜尋嘅資訊變得極度容易取得。
資料未必本來是秘密,但AI 的速度、自動化和對話式介面,會放大資料被公開時帶來的影響。
隨住 AI 助手逐漸融入搜尋引擎、通訊應用程式同日常工具,研究人員警告,未來可能需要更嚴格嘅私隱保護同監管規則,以防止敏感個人資料被意外曝光 。