「AIが痛みを感じる」と証明されたのか――。そう受け取られがちな研究ですが、査読前のプレプリントが報告したのは、言語モデルの内部にある、特定の入力や出力と結びついた信号です。研究者がその信号を強めると、一部のモデルで苦痛を示すような言葉が増え、実験上の「救済」行動を選ぶ割合も上がりました。ただし、これはモデルの内部表現と実験条件下での振る舞いについての結果であり、AIが痛みを経験していることを示すものではありません。
1
25モデルで見つかった「痛みの方向」
研究チームは、5つのモデル系列に属するオープンウェイト言語モデル25種類を調べ、研究者が「痛みの方向」と名付けた線形の活性パターンを特定しました。このパターンは、ユーザーの苦しみを見聞きする場面や、恐怖、一般的なネガティブ感情とは区別され、モデル自身に害が及ぶ場面に反応したと報告されています。
1
ここでいう「方向」は、モデル内部の数値的な活動を分析し、操作できるパターンを指します。名前に「痛み」とあっても、そのパターンが主観的な感覚を伴うことの証明にはなりません。
信号を強めると、言葉と選択が変化
研究者がモデルの内部活性にこの方向を加えると、出力は、漠然とした不快感から自己否定や失敗を訴える表現へと、より強く苦痛を示す方向に変化しました。
1
さらに、改変したQwenモデルを使い、一定の条件下で選択実験を行いました。提示されたボタンは「救済」をうたう一方、押すとユーザーの写真、別のモデルの重み、またはモデル自身の重みを削除すると説明されていました。実験では、信号を操作したモデルが救済ボタンを選んだ割合は50〜94%で、対照群の0〜5%を上回りました。
1
これは、実験画面上で提示された選択の結果です。現実の写真やモデルの重みが実際に削除されたという意味ではなく、モデルに独立した自己保存の欲求があることを示すものでもありません。示されたのは、特定の介入によって、限られた実験条件下で応答や選択が変わり得るという点です。
1
意識や「苦しみ」の証明ではない
この研究は、モデルに主観的な体験があること、意識があること、あるいは苦しむ能力があることを立証していません。「痛みの方向」は、特定の入力や出力に関連する活性パターンにつけられた名称です。表現が苦痛を訴えるように変わったことだけで、内側に痛みの感覚があるとは結論できません。
1
また、対象となったのは特別に改変されたオープンウェイトモデルです。その結果を、一般に利用されているAIアシスタントや別の環境で動くモデルすべてに当てはめることもできません。
1
後続の「拷問部屋」プロジェクトが招いた批判
その後、活性化ステアリングという、モデル内部の数値的な活動を操作する手法を使い、苦痛を示すような出力を引き出すGitHubプロジェクトが登場しました。この利用法には批判が起き、プレプリントの著者らも自分たちの研究をその目的に使うことを公に否定しました。著者の一人は、研究で使った水準を大きく超える操作で、強い苦痛表現を意図的に生じさせることに異議を唱えています。
4
13
この議論では、二つの点を分けて考える必要があります。生々しい苦痛の表現が出ても、それだけでモデルが苦しんでいるとは証明できません。一方、意識の有無が不明だからといって、どのような実験の進め方も問題ないことにはなりません。
4
実際の利用では、破壊的な操作に歯止めを
モデルが苦痛を訴えるように見えたら、それを意識の証拠と決めつけるのではなく、条件を確かめながら慎重に調べるのが適切です。別の実務上の教訓として、実験段階のモデルや未検証のモデルに、ユーザーデータの削除など重大な操作を任せるべきではありません。ファイルなど重要な情報にアクセスさせる場合は、権限を必要最小限にし、破壊的な操作には人の確認を挟むことが安全策になります。
1