阿里巴巴的Qwen係一款開放權重AI模型。據CBS News報道,Qwen累計下載量超過30億次,亦有Airbnb、Uber等西方公司使用。當模型被用喺產品或服務入面,回答有冇遺漏資料、點樣描述爭議議題,影響就唔止係聊天機械人的準確度。
10
Hirundo的測試同CBS News的抽查,指向Qwen可能存在政治偏頗或避談敏感議題;但兩者都唔足以證明每個Qwen版本、每種部署方式都會有相同行為,更唔能夠單憑呢啲結果推論使用Qwen會令公司資料流向阿里巴巴或中國政府。
10
Hirundo測試咗乜?89.8%代表咩?
網絡安全初創公司Hirundo表示,團隊以500條提示測試Qwen,涵蓋15個主題。Hirundo行政總裁Ben Luria向Newsmax表示,面對政治敏感問題時,Qwen有89.8%的回答出現審查、配合宣傳的論述,或者政治偏頗。
11
要留意,89.8%係Hirundo報告的測試結果,唔係已經由獨立研究重複驗證、適用於所有Qwen版本、提示或實際部署的比率。呢個數字亦將幾種不同情況合併計算,包括迴避問題、採用特定政治框架,以及出現偏頗;唔等於模型單純拒絕回答的比例。
11
報道提到的例子包括1989年天安門廣場殺戮事件,以及2019年香港示威。Hirundo描述的測試結果顯示,Qwen曾未有確認或承認相關事件;CBS News亦報道,Qwen就香港及其他具爭議議題的回答令人憂慮。
11
15
CBS News的抽查補充咗乜?
CBS News另行向Qwen提問,並報道其在敏感議題上的回答令人憂慮。呢次抽查為Hirundo所描述的問題提供另一個例子,但只屬個別測試,唔代表所有Qwen模型或企業部署都會有同一反應。
10
15
評估時亦唔應只睇模型有冇明確講「我唔可以回答」。模型可能避開題目、重複某種政治框架,或者提供不準確答案;只檢查有冇直接拒答,可能會漏看其他形式的遺漏或偏頗。
11
企業使用時,政治偏頗同資料安全要分開看
CBS News報道,Qwen下載量超過30億次,使用者包括Airbnb及Uber。
10 如果企業將模型用於面向客戶的功能或內部工具,模型的回答就可能影響使用者接收的資訊。因此,企業應測試自己實際採用的模型版本同部署方式,確認是否適合預定用途;但目前報道的政治偏頗結果,唔代表每個使用Qwen的產品都會受同樣影響。
政治偏頗問題亦要同網絡安全問題分開處理。美國眾議院委員會已就中國開發AI模型相關的國家安全及網絡安全風險展開調查,當中包括報道所指Airbnb使用Qwen一事。調查及相關疑慮,並唔等於已有證據證明Qwen造成資料外洩。
開放權重模型可以喺企業自己的基建上運行,可能令企業比起使用外部供應商服務,有更多控制敏感資料的空間。不過,本機部署本身唔會消除模型回答中可能存在的偏頗;實際資料流向亦要視乎個別公司的系統設定。
Hirundo所稱的「修正」仍有待驗證
Hirundo表示,團隊找到方法透過修改模型內部權重,移除Qwen的偏頗;CBS News亦報道,公司計劃推出一個稱為「西方化」的版本。
10 呢個係公司對技術方案的說法,現有報道未能獨立證明修改後的模型能否喺不同主題、版本、語言或實際工作任務中穩定奏效。
對考慮採用Qwen的機構來講,較實際的做法係測試自己打算使用的確切版本及部署方式:既要測試敏感議題,亦要測試日常工作提示;檢查答案有冇遺漏或扭曲重要事實,同時另行審視資料流向及安全措施。現有結果值得認真看待,但未足以替所有使用情境下的模型表現或安全性下定論。