據 404 Media 報導,Project Lily 是一項由人工審查員評估 ChatGPT 回覆、用以改善未來模型表現的作業。這也說明了為何傳出有外包人員因使用生成式 AI 進行評估而被移除:這套流程的價值,原本就應來自獨立的人類判斷。若評斷本身交由模型產生,資料便不再能清楚反映人們真正偏好的內容。
19
20
Project Lily 的審查員據稱在做什麼?
報導指出,審查員會接觸真實的 ChatGPT 提示詞,部分任務還會提供完整對話。他們須摘要使用者意圖、比較候選回覆,並以 1 至 7 分進行評分。每項任務最多可有四個候選答案;評估重點是語氣與行為,例如是否過度奉承、迎合(sycophancy),或作出過於擬人化的說法,而不只是答案是否正確。
8
19
這些評分可形成「偏好資料」:也就是在特定情境下,人類認為哪一則回覆較好的結構化紀錄。這類資料可用來讓模型朝理想行為調整,但前提是判斷必須夠一致、理解任務,而且彼此獨立。
Project Lily 據稱有數百名外部審查員參與,由 Crossing Hurdles 招募、透過 Mercor 支付報酬;一名審查員表示時薪超過 50 美元。另有關於 OpenAI 整體評估作業的報導提到,其各類評分流程合計有超過 1 萬名外包人員;這個數字不應被解讀為僅屬於 Project Lily 的人數。
19
6
為什麼由 AI 撰寫的評分會違背「人類回饋」的目的?
AI 評審或許很快,在內部測試中也可能派得上用場,但它回答的是與人類偏好審查不同的問題。模型傾向重現訓練資料中學到的模式,可能偏好熟悉的措辭、風格或既有假設。
若持續用某個模型、或與其密切相關的模型來評賞未來模型的輸出,就可能形成回饋迴圈:
- 評估模型偏好與既有偏好相似的答案。
- 訓練機制獎勵這些答案。
- 下一代模型更常產生相同模式。
- 不同寫法、少數偏好,或評估模型難以正確判斷的答案,較難獲得有用回饋。
這不代表所有 AI 評估都必然讓模型變差。只要經過人類判斷驗證,並有清楚使用邊界,自動化評估仍可能很有價值。然而,若任務原本就是為蒐集人類偏好資料而設,直接以 AI 取代人類,就會削弱訓練訊號的獨立性;這似乎正是相關規範禁止此作法的原因。
據稱如何查核疑似使用 AI 的情況?
報導稱,主管被要求不要依賴 GPTZero 等 AI 寫作偵測工具;相反地,應透過人工檢視工作模式及文字產出,例如異常一致的措辭、標點或格式特徵,以及不合理地快速完成任務等訊號。
6
但這種方式有明顯限制:任何單一訊號都不能證明某位工作者用了 AI。寫得快的人可能只是熟練,措辭相似也可能源於共用的評分準則。因此,這些訊號較適合作為啟動調查的線索,而非直接作為將人移出專案的充分證據。
為何具體偵測標準沒有公開?
機構通常不會公開反規避機制的細節,因為過於精確的檢查清單會變成規避說明書。外包人員可能只要改寫措辭、刻意延遲送件或更換格式,仍把判斷工作外包給模型。
不過,保密同樣帶來風險。當工作者不知道品質判定如何做出,錯誤也更難申訴。能長期運作的誠信制度,應在保護偵測方法的同時,提供明確規則、可追溯的決定紀錄,以及有實質意義的申訴或更正程序。
Mercor 據稱採取的政策
據報導,Mercor 表示,使用 AI 執行這類評估工作違反政策;一經確認,涉事者將立即被移出相關專案。報導也指出,規則對 AI 輔助的限制更廣,包括用於撰寫回饋或評論的工具。
6
40
問題不只在於「有沒有用 AI」
報導中提及刻意給出差評的案例,揭示了更大的問題:一份回饋由人提交,不代表它必然可靠。審查員可能趕工、誤解評分準則、為追求產量而犧牲品質、抱持惡意,或試圖操弄不透明的品質控管系統。
這既是技術問題,也是誘因問題。模型開發者需要的是經過校準、出於善意、能預示真實使用體驗會改善的判斷;但外包人員得到的回報,可能主要與速度、完成件數或避免被退件有關。當兩者誘因不一致,累積出的資料就可能充滿雜訊,甚至產生系統性偏差。
較可靠的評估防線應長什麼樣子?
對於高度依情境而定、帶有主觀性或難以自動驗證的判斷,人類審查依然重要。不過,它更適合作為一套相互制衡的制度,而非單純收集大量個別分數。可行措施包括:
- 獨立交叉評閱: 讓多名審查員評估一部分相同任務,並檢視分歧原因。
- 校準題: 以已有預期判斷的題目確認審查員是否理解準則。
- 品質稽核: 調查可疑模式,但不把單一文風特徵當成定論。
- 角色分工: 清楚區分正式評閱、品質保證與申訴機制。
- 結果驗證: 檢查高分資料是否真的能讓使用者得到更好的模型表現。
- 隱私控管: 盡量減少審查員可見的資訊,並持續測試過濾是否仍漏掉敏感內容。Project Lily 的報導指出,即使經過匿名化處理,對話仍可能含有個人資訊。
19
核心結論很簡單:偏好訓練是否值得信任,取決於產生偏好的流程是否值得信任。人類審查員不是品質保證的魔法解方;而當目標是理解人們真正重視什麼時,AI 產生的判斷也不能直接取代獨立的人類回饋。