Project Lily據報係一個人類審核流程:外判評審要評估ChatGPT回覆,協助改善之後模型嘅表現。正因為個流程要嘅係獨立人類判斷,有承辦者被發現用生成式AI代做評估後,據報就被移出項目。若果由模型提供判斷,份數據就唔再清楚反映人類真正偏好。
19
20
Project Lily嘅評審實際做啲乜?
報道指,評審會接觸真實嘅ChatGPT提示詞,部分個案更包括完整對話。他們要概括用戶意圖、比較候選回覆,並按1至7分評分;每項工作最多可有4個候選答案。重點唔只係事實啱唔啱,仲包括語氣、係咪過分奉承(sycophancy)、以及有冇過度扮成人類等行為表現。
8
19
呢類評分可變成「偏好數據」:即係某個情境下,人類認為邊個答案較好嘅結構化紀錄。要用呢些數據調整模型行為,前提係判斷要一致、有根據,而且由評審獨立作出。
Project Lily據報涉及數百名外部評審,由Crossing Hurdles招募、經Mercor支薪;其中一名評審稱時薪超過50美元。另一方面,關於OpenAI整體評估業務嘅報道提到,其評分流程合計有逾1萬名承辦者;呢個數字唔應該當成Project Lily單一項目嘅人數。
19
6
點解AI代寫評分,會令「人類回饋」失去意義?
AI評審可以好快,亦可能喺內部測試有用;但佢回答緊嘅,其實同「人類偏好評估」係兩個問題。模型通常會重現訓練中學到嘅措辭、風格同假設。
假如不斷用某個模型、或者相近模型嘅判斷,去獎勵下一代模型嘅輸出,就可能形成回饋循環:
- 評審模型較鍾意似自己原有偏好嘅答案;
- 訓練程序獎勵呢類答案;
- 下一代模型更傾向產生同類模式;
- 另類表達、少數偏好,或者評審模型本身判斷唔到嘅答案,收到嘅回饋就會較差。
呢個唔代表任何AI評估都必然令模型變差。自動化評估如果已經同人類判斷核對過、用途又有清晰界線,仍然可以有價值。但喺一項明確委託用嚟收集人類偏好數據嘅工作中,用AI取代人,就會削弱訓練訊號嘅獨立性——呢個似乎正係禁令背後嘅原因。
據報點樣識別疑似用AI嘅評審?
報道指,主管獲指示唔好依賴GPTZero之類嘅AI寫作偵測工具,而係由人手審視工作模式同文字成品,例如措辭異常一致、標點或格式模式、完成速度快得唔合理等跡象。
6
不過,單憑任何一項跡象,都唔足以證明某人一定用咗AI。寫得快可以係熟手;多人用相似語言亦可能只係跟同一份評分指引。因此,呢些訊號較適合作為啟動調查嘅提示,而唔應直接等同足以將人移出項目嘅證據。
點解具體偵測準則唔會公開?
機構通常唔會公開反規避機制嘅詳細清單,因為咁樣等於教人避開檢查:承辦者可以刻意改字眼、拖慢提交時間,或者改格式,但實際上仍然係將判斷外判畀模型。
但太過保密亦有風險。當工作者唔知道品質決定點樣得出,錯誤判斷就更難提出異議。一套較穩健嘅制度,要同時有保密嘅偵測方法、清楚嘅規則、可追溯嘅決定紀錄,以及有意義嘅申訴或更正機制。
Mercor據報嘅政策係點?
Mercor據報表示,用AI完成呢類評估工作違反政策;一旦確認違規,會即時從相關項目移除。報道亦指規則禁止更廣泛嘅AI協助,包括用工具撰寫回饋或評論。
6
40
真正難題:有「人」評分,唔等於數據可靠
報道提到有人故意畀差評,正好突顯一點:回饋由人提交,唔代表一定認真、獨立或者可信。評審可能趕時間、誤解準則、追求完成量、存心搗亂,或者嘗試摸索並利用不透明嘅品質制度。
呢個既係技術問題,亦係誘因問題。模型開發者要嘅係校準得宜、真誠而且能預測真實用戶體驗嘅判斷;承辦者得到嘅獎勵,卻可能主要同速度、完成任務或避免被淘汰有關。兩邊誘因一旦唔一致,數據就可能變得雜亂,甚至出現系統性偏差。
較可靠嘅評估保障可以點做?
對於講求語境、主觀取捨或難以自動核實嘅判斷,人類審核仍然重要;但最好唔係只靠一連串個別分數,而係配合多重檢查。可行做法包括:
- 獨立重疊評估:抽取部分相同任務交畀多名評審,分析分歧。
- 校準題目:以已有答案或已知例子,確認評審理解評分準則。
- 品質審計:調查可疑模式,但唔將單一文風特徵視為定罪證據。
- 角色分工:清楚分開一般評審、品質保證同申訴處理。
- 結果驗證:檢查高分數據係咪真係令模型對用戶表現更好。
- 私隱管控:盡量減少評審可見資料,並持續測試過濾系統有冇漏走敏感資訊。Project Lily報道指出,即使經過匿名化,對話仍可能包含個人資料。
19
最核心嘅教訓好直接:偏好訓練有幾可信,取決於產生偏好數據嘅流程有幾可信。人類評審唔係品質保證;而當目標係了解人真正重視乜嘢,AI生成嘅判斷亦唔可以直接冒充獨立人類回饋。