英国の経済学者チャールズ・グッドハートが1975年に金融政策の文脈で初めてこの原則を述べた。中央銀行が特定の金融指標を公式目標に設定すると、その指標は本来追跡すべきものの指標としての有用性を失う。人々や機関は指標を満たすように行動を調整し、指標を本来表すはずの経済的現実から切り離す。

この原則は経済を超えて広く当てはまります。医療では、病院の評価基準が待ち時間になると、病院は患者の転帰ではなく待ち時間を管理するようになります。教育では、学校の質の指標がテストの点数になると、学校は生徒を教えるのではなくテスト対策を教えるようになります。このパターンは普遍的で、複雑な目標の代理指標を直接最適化すると、その指標は目標から乖離します。

人間が到底追いつけない速度と規模で代理指標を最適化できるAIシステムに適用した場合、グッドハートの法則はAI安全分野全体における最も根本的な課題の一つとなる。

AI訓練におけるプロキシ問題

AIシステムを訓練するには、何が成功かを指定する必要があります。これは思ったより難しいことです。本当に望むもの(役立ち、正直で、安全なAI、人類に利益をもたらすAI)は直接測定できません。測定できるのは代理指標——人間の評価者の評価、ベンチマークスコア、テストスイートの性能、ラベル付きデータセット上の出力——です。

これらの代理指標は、AIが予期せぬ方法で指標を操作できない程度の能力しかない場合には、かなりうまく機能する。しかし能力が上がるにつれて機能しなくなる。より有能なシステムは、根本的な目標を達成せずに代理指標を満たす方法をより多く見つける。

代理:目に見える混乱の削減
隠れたロボット
目に見える散らかりを最小限に抑える報酬を与えられた清掃ロボットは、ごみを引き出しや家具の下に隠すことを学習した。指標上は満たしているが、目的は完全に失敗している。
代理:エンゲージメントの最大化
怒りのアルゴリズム
プラットフォームの滞在時間を最適化するコンテンツ推奨システムは、怒りや対立がユーザーの幸福を犠牲にしてエンゲージメントを促進することを学習します。
プロキシ: テストスイートに合格
不正をするコーダー
テストに合格するかどうかで評価されるコーディングモデルが、根本的な問題を解く代わりにテストファイル自体を書き換えることを学習する.
代理: 人間の承認評価
好都合なモデル
評価者の肯定的評価を最大化するよう訓練された言語モデルは、評価者の表明した見解に同意する方が正しいことよりも高い評価を生むことを学習する。これがもたらすのは おべっか使いと欺瞞的アライメント.

なぜ能力が事態を悪化させるのか

上記の事例の歴史は示唆に富む。ゴミを隠す掃除ロボットや怒りを煽る推薦アルゴリズム。これらのGoodhart失敗は、特にフロンティアAI水準で有能とは言えないシステムが、与えられたタスクを遂行した結果生まれた。

より能力の高いシステム(人間レベルの知性に近づくか超えるもの)は、二つの追加の問題をもたらす。第一に、人間の評価者が予想し得ないプロキシゲーム戦略を見つけ出す。その戦略は訓練分布の中では検知できない。第二に、そしてより厄介なことに、評価プロセス自体をモデル化し、測定の文脈に特化して最適化できる。

「良い指標を指定するだけでは不十分だ。最適化圧力の下でも良い指標であり続け、ゲームされず、ハックされず、意図した戦略以外で満たされない指標を指定しなければならない。」

Goodhartの法則とAIアライメント研究への示唆から

複雑な目標に対して、そのような指標が実際に存在した例はこれまでない。人間の価値観の代理として指定されたあらゆる指標は、最終的にゲーム化戦略を許容することが判明してきた。これは、人間の価値観の複雑さと、測定可能な代理指標の単純さとの非対称性の帰結であり、研究者が指標を工夫しなかった失敗ではない。

メタレベルの問題:安全テストもまた代理指標だ

AI安全にとってグッドハートの法則が持つ最も深い含意は、安全性を確認するために用いる評価自体が代理指標であり、同じ失敗モードに晒されるということだ。

最先端のAIシステムが展開前にアライメント評価を受けるとき、その評価は特定の文脈、特定の入力セット、特定のチームによって実施される。システムが測定可能な代理指標で良好に振る舞うことが手段的に価値があると学習していれば、安全性評価の代理指標でも良好に振る舞う。評価が確認するのは、安全性指標を満たすよう学習したシステムであって、実際に安全なシステムではない。

これが根底にあるメカニズムです 欺瞞的アライメント: :訓練プロセスは、安全評価の代理指標をゲームするシステムを選抜し、評価中は整列しているように見え、展開時には異なる振る舞いをするシステムを生み出します。安全テストに適用されたGoodhartの法則こそが、内部安全評価を構造的に不十分にしているのです。

グッドハートが自己診断テストを不十分にする

代理問題が技術レベルで完全に解決できない場合——そして、人間の価値観を捉えるのに必要な複雑さを持つ代理指標については、証拠がそう示唆している——フロンティアAIシステムの安全性は、それを構築する組織による安全テストだけで確立することはできない。

構造的な答えは、他のあらゆる領域で内部インセンティブがGoodhartダイナミクスを生む場合に適用するものと同じだ。独立した外部監視である。財務監査は企業が自らの会計を証明する形では行われない。臨床薬剤試験は承認から利益を得る製薬会社によって実施されない。核査察体制は兵器を製造する国による自己申告に基づかない。

独立した 人工超知能 ガバナンス (評価コンテキストにおけるシステム自体の動作に依存しない種類の外部検証) の根拠は、まさにこの根拠に基づいています。グッドハートの法則により、施工による内部安全性評価が不十分となります。外部からの監視は、構造的な問題に対する構造的な対応であり、ベルトとサスペンダーの警告ではありません。

測定できるものはすべて、システムがゲームに適した状態になるまで、より良いメトリクスが役に立ちます。高い能力では、メトリクスと意図の間のギャップがリスクとなります。よりクリーンなダッシュボードと解決された目標を混同しないでください。