OpenAI將今次做法形容為一個**「多層、由整個生態系統推動」的溯源模式**。
簡單講,每張由OpenAI模型生成的圖片會帶有兩種不同識別訊號:
兩種技術同時使用,等於建立一個「雙重驗證」機制,就算其中一個訊號消失,另一個仍有機會被偵測到。
C2PA(Coalition for Content Provenance and Authenticity)係一個開放技術標準,用嚟記錄數碼媒體的來源與編輯歷史。
當圖片加入C2PA內容憑證後,檔案會附帶一段可驗證的元數據,可能包括:
由於C2PA採用加密簽名與溯源記錄(provenance manifests),支援這個標準的工具可以讀取並驗證圖片歷史,讓用戶知道內容是如何產生及修改的。
目前除了AI公司外,相機製造商、新聞機構及軟件平台都開始採用C2PA,目標係提升數碼媒體的透明度。
不過,單靠元數據有一個很大的弱點:容易消失或被移除。
當圖片在網絡上流傳時,以下情況都可能令元數據消失:
一旦元數據被移除,原本的來源訊號就可能完全消失。
這正正是OpenAI加入第二層識別技術的原因。
SynthID係Google DeepMind開發的隱形水印技術,會將訊號直接嵌入圖片像素之中。
同一般元數據不同,SynthID並唔係附加在檔案外層,而係改動圖片像素中的細微結構。呢個訊號:
由於水印藏在圖像本身,即使圖片經過裁剪、壓縮、轉檔甚至截圖,訊號仍有機會被保留下來。
因此,當C2PA元數據消失時,SynthID仍可能提供另一條證據鏈。
配合上述溯源訊號,OpenAI亦展示了一個公開圖片驗證工具(Verify)。
用戶可以將圖片上傳,系統會檢查是否存在相關識別訊號,從而判斷圖片是否由OpenAI模型生成,例如:
如果圖片含有C2PA元數據或SynthID水印,工具就能顯示來源資訊。
不過這個工具並非萬能。報導指出,如果圖片被大幅修改或訊號被移除,系統可能無法準確識別。
生成式AI令「超逼真」圖片變得極容易製作,假圖在社交媒體上散播的速度亦越來越快。
OpenAI希望透過這個溯源系統,令不同群體更容易核實圖片來源,包括:
雖然這些技術無法完全杜絕假圖片,特別是來自其他沒有溯源標準的AI工具,但至少可以令由OpenAI系統生成的圖片更透明、更容易追蹤來源。
OpenAI這一步其實反映一個更大的行業趨勢:科技公司與媒體機構正嘗試建立標準化的內容溯源機制。
與其依賴單一檢測方法,業界開始結合多種技術,例如:
如果這些技術被平台和工具廣泛採用,未來互聯網上每一張圖片,都可能帶有可追溯的來源資訊。屆時,在生成式AI時代辨別真假內容,或許會變得容易得多。