報道によれば、OpenAIの「Project Lily」は、将来のChatGPTの振る舞いを改善するために、契約者が回答を評価する人間レビューの運用だ。このため、評価そのものを生成AIに任せた契約者が外されたとされる。ここで価値を持つのは、モデルではなく人間が独立して下す判断だからである。モデルが判断を代行すれば、得られるデータは「人々が何を好むか」を素直に測るものではなくなる。
19
20
Project Lilyの評価者は何をしているのか
報道で伝えられた手順では、評価者は実際のChatGPTのプロンプトを受け取り、場合によっては会話全体を読む。利用者の意図を要約し、複数の候補回答を比べ、1〜7の尺度で点数を付ける。1件につき最大4つの候補回答を扱うとされ、焦点は単純な事実の正誤だけではない。口調、過度なお世辞や迎合(シコファンシー)、人間であるかのような表現といった、応答の振る舞いも評価対象になる。
8
19
こうした評価は、「この状況ではどの回答がより望ましいか」という人の選好を記録したデータになり得る。モデルを期待する方向へ調整するには、判断が一貫しており、基準を理解した上で、かつ独立に下されていることが重要だ。
Project Lilyには数百人の外部契約者が関わると報じられている。採用はCrossing Hurdlesを通じ、報酬支払いはMercorが担う形とされ、ある評価者は時給50ドル超だったと話している。なお、OpenAIの評価パイプライン全体には1万人超の契約者がいるとの報道もあるが、これはProject Lilyだけの人数ではない。
19
6
AIによる評価が「人間フィードバック」の目的を損なう理由
AI評価は高速で、社内テストなどでは役立つ場合もある。ただし、人間の選好を集めるレビューとは別の問いに答えるものだ。モデルは学習済みの表現、文体、前提に引きずられやすい。
あるモデル、あるいは近縁のモデルの出力を、同じ系統のモデルが繰り返し評価し、その結果で次のモデルを学習させると、次のような循環が起き得る。
- 評価モデルが、自身の既存の好みに似た回答を高く評価する。
- 学習工程は、その種の回答に報酬を与える。
- 次のモデルは同じパターンの回答を出しやすくなる。
- 異なる文体、少数派の選好、評価モデルが適切に判断できない回答には、有効なフィードバックが届きにくくなる。
もちろん、AI評価を使えば必ずモデル品質が下がるという意味ではない。人間の判断との一致を検証し、用途を明確に限定すれば、自動評価は有用になり得る。それでも、人間の選好データを作るために委託された仕事でAIを人間の代わりに使えば、学習信号の独立性は弱まる。報じられた禁止方針の狙いは、そこにあるとみられる。
AI利用の疑いはどう扱われたのか
報道によると、監督者にはGPTZeroのようなAI文章検知ツールに頼らないよう指示されていた。代わりに、人による作業パターンと文章の確認を行い、極端に均一な言い回し、句読点や書式の傾向、不自然なほど速い完了ペースといった兆候を見る方法が示されたという。
6
ただし、こうした兆候のどれか一つだけでAI利用を立証できるわけではない。熟練者なら速く書けることがあり、似た表現は共通の評価基準に沿った結果かもしれない。したがって、兆候は調査の端緒にはなっても、プロジェクトから外す根拠として十分かどうかは、個別に適切な審査を経る必要がある。
詳細な検知基準が公表されない理由
不正対策の細かな基準を公開すれば、回避策の手引きになりかねない。たとえば契約者は、表現を変える、意図的に時間を空ける、書式を調整するといった形で、判断自体はモデルに任せたまま検知を逃れようとできる。
一方で、判断理由が見えなければ、誤りを申し立てにくくなるリスクもある。実効性のある運用には、検知手法の秘匿と同時に、明確なルール、判断記録、異議申し立てや訂正の機会が求められる。
Mercorが示したとされる方針
Mercorは、こうした評価業務をAIに行わせることは規定違反であり、確認された場合は該当プロジェクトから直ちに外す方針だと報じられている。AIの利用禁止は、フィードバックやコメントの文章作成に使うツールも含む、より広い範囲に及ぶとされる。
6
40
問題はAI利用だけではない
意図的に低い評価を付けたとされる事例は、より大きな論点を示している。人が提出したからといって、そのフィードバックが自動的に信頼できるわけではない。評価者が急いで作業する、基準を誤解する、処理件数を優先する、不誠実に振る舞う、あるいは不透明な品質管理を攻略しようとする可能性がある。
これは技術だけでなく、インセンティブの問題でもある。開発側が必要とするのは、実際の利用場面でより良い振る舞いにつながる、慎重で調整された判断だ。しかし契約者側は、速さ、完了件数、却下回避を主な報酬上の目標にしてしまうことがある。両者の動機がずれれば、データにはノイズや体系的な偏りが入り込む。
より強い評価体制に必要なもの
文脈依存で主観性が高く、自動検証が難しい判断では、人によるレビューは依然として重要だ。ただし、個々の採点をただ集めるだけでは足りない。実務上の対策としては、次のようなものが考えられる。
- 独立した重複評価:一部の課題を複数の評価者に割り当て、判断の不一致を点検する。
- キャリブレーション課題:正解例・基準例を用い、評価者がルーブリックを理解しているか確認する。
- 品質監査:不審なパターンを調べつつ、単一の文体的特徴だけを決定的な証拠と扱わない。
- 役割の分離:通常の評価、品質保証、異議申し立てを別の役割として設計する。
- 成果の検証:高評価を得たデータが、実際に利用者にとってのモデルの振る舞いを改善するかを確かめる。
- プライバシー保護:評価者が閲覧する情報を必要最小限にし、フィルタリングで個人情報が取り切れているかを継続的に検証する。Project Lilyの報道では、匿名化の取り組みがあっても会話に個人情報が含まれる場合があると指摘されている。
19
要点は明快だ。選好学習の信頼性は、その選好を作る工程の信頼性を超えられない。人間の評価者は品質を保証する魔法の存在ではなく、また人が何を大切にするかを学ぶことが目的の工程では、AI生成の判断を独立した人間フィードバックの代わりにそのまま置くこともできない。