404 Mediaは、時給50米ドル超とされる数百人の外部委託者が、実際のChatGPT会話を読み、4つの回答を1〜7点で評価していたと報じた。[2] 個人用ワークスペースのFree、Plus、Proでは、「設定」→「データコントロール」→「Improve the model for everyone」をオフにすると、新規会話をモデル改善に使わないよう設定できる。[19][21] ChatGPT Business、Enterprise、Edu、およびAPI Platformでは、入力・出力をモデル学習に使わない設定がデフォルトだとOpenAIは説明している。[23]
公開者GPT-5.6 Terra で編集GPT Image 2 で画像を生成
研究の答え

Create a landscape editorial hero image for this Studio Global article: What did the 404 Media investigation reveal about OpenAI’s secret “Project Lily,” including how hundreds of contractors paid more than $50 p. Article summary: 404 Media reported that OpenAI’s internal “Project Lily” uses outside human reviewers to evaluate real ChatGPT exchanges for model improvement—not merely synthetic test data. The investigation raises a privacy concern be. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
404 Mediaの調査報道によると、OpenAIの社内取り組み「Project Lily」では、実際のChatGPT利用者の会話を使った人間によるフィードバック(評価)プログラムが運用されていたとされます。焦点は、会話がモデル改善に利用され得ることだけではありません。報道では、ユーザー名を外した会話であっても、外部委託の担当者が非常に個人的な文脈を読める場合があったと指摘されています。2
漏えい資料を確認した404 Mediaによれば、OpenAIは人材紹介会社を通じ、数百人の外部委託者を集めていたとされます。担当者の報酬は時給50米ドル超とされ、実際のユーザープロンプトとChatGPTの回答を確認。利用者の意図を要約したうえで、4つの候補回答を比較し、1〜7点で評価する作業が求められていたといいます。2
目的は回答品質の改善です。具体的には、ChatGPTの文体を機械的にしすぎないこと、人間の感情や実体験があるかのような表現を抑えること、必要以上に同意・迎合する傾向を減らすことなどが含まれていたと報じられています。2
人間の評価をAI開発に使うこと自体は珍しくありません。ただし、対象が合成データではなく消費者の実会話だったとすれば、プライバシー上の問題はより身近になります。
404 Mediaは、担当者が会話全体を受け取り、場合によってはユーザーメモリーの要約も見られたと報じました。ユーザー名は表示されない一方で、おおまかな居住地、職業、過去の関心事、私的な事情などをうかがわせる情報が含まれる可能性があったとされます。2
ここで重要なのは、氏名を削除することと、実質的に無害・匿名な会話にすることは同じではない、という点です。仕事、家族、健康上の悩み、特異な出来事といった複数の手掛かりの組み合わせは、アカウント名がなくてもセンシティブになり得ます。
OpenAIは「Privacy Filter」について、テキスト中の個人識別情報(PII)を検出し、伏せ字などで除去するためのモデルだと説明しています。46
47
Project Lilyに関する報道でOpenAIは、外部委託者に渡る前にユーザー名を削除し、自動フィルターをかけていると述べました。しかし404 Mediaは、そうした措置の後でも、レビュー対象の会話にセンシティブな詳細が残ることがあったと報じています。2
自動マスキングは、氏名、メールアドレス、電話番号のような明示的な識別子には対応しやすい一方、文脈に依存する情報の判別は難しくなります。職業、地域、家庭状況、固有の経験などが重なるケースを、機械的に完全に除外するのは容易ではありません。
報道で示されたガイドラインは、単なる正誤判定にとどまらないものでした。外部委託者は、次のような問題を確認するよう求められていたとされます。
とりわけ「迎合性(sycophancy)」への注目は重要です。利用者をすぐ肯定するモデルは、一見親身に感じられても、誤りや危険な前提を十分に問い直さないおそれがあります。Project Lilyは、こうした振る舞いの調整にも使われることが意図されていたと報じられています。2
プロンプト内で「誰にも言わないで」「ここだけの話にして」と書いても、アカウントに適用されるデータ利用設定は変わりません。それは会話の本文であって、OpenAIのデータ利用方針や技術的な設定を上書きする命令ではないためです。
個人用のChatGPTワークスペースでは、OpenAIが案内する設定は Improve the model for everyone です。オンの場合、会話はモデル改善に利用される可能性があります。オフにすると、OpenAIは新規の会話をモデルの学習に使わないと説明しています。21
30
ログイン中のChatGPTでは、OpenAIは次の手順を案内しています。
この設定は端末ごとではなく、アカウントに適用されます。オフにした後も既存のチャット履歴は残せますが、OpenAIによれば、新たな会話はモデル学習に利用されません。19
30
また、OpenAIのプライバシーポータルには Do not train on my content という選択肢もあります。ChatGPTとCodexのタスクについては、ポータルまたはアプリ内のデータコントロールのどちらか一方でオプトアウトすれば足り、両方を設定する必要はないとされています。21
OpenAIによると、個人用ワークスペースのFree、Plus、Proでは、モデル学習のためのデータ共有がデフォルトで有効です。ただし、ユーザーはオプトアウトできます。一方、ChatGPT Business、Enterprise、Edu、API Platformでは、提供された入力と出力をモデル学習に使わない設定がデフォルトだと説明されています。23
ただし、法人向けプランだからといって、あらゆる用途で自動的にリスクがなくなるわけではありません。機密情報をAIツールに入力する前に、組織としてワークスペース設定、保存期間、共有権限、社内ルールを確認する必要があります。
404 Mediaが報じたProject Lilyは、個人向けAIチャットを「当然に秘密が守られる連絡手段」と考えるべきではなく、データ利用設定を確認すべきサービスとして扱う必要があることを示しています。2
個人情報、医療・法律・金融に関する内容、営業秘密などを入力する可能性がある場合は、まず Improve the model for everyone をオフにしてから新しい会話を始めるのが、直ちに取れる対策です。2
21
ただし、このオプトアウトはOpenAIによる新規会話のモデル改善利用を止めるための設定です。プロンプト内の「秘密にして」という依頼ではなく、すでに送信済みの内容を取り消す仕組みとしては説明されていません。21
30
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
404 Mediaは、時給50米ドル超とされる数百人の外部委託者が、実際のChatGPT会話を読み、4つの回答を1〜7点で評価していたと報じた。[2]
404 Mediaは、時給50米ドル超とされる数百人の外部委託者が、実際のChatGPT会話を読み、4つの回答を1〜7点で評価していたと報じた。[2] 個人用ワークスペースのFree、Plus、Proでは、「設定」→「データコントロール」→「Improve the model for everyone」をオフにすると、新規会話をモデル改善に使わないよう設定できる。[19][21]
ChatGPT Business、Enterprise、Edu、およびAPI Platformでは、入力・出力をモデル学習に使わない設定がデフォルトだとOpenAIは説明している。[23]