潜在知識の抽出、通常ELKと略されるものは、Alignment Research Centerが提示した研究問題である。端的に言えば、能力のあるAIシステムは、世界に関する事実を内部で表現していても、それを報告しない可能性があり、われわれはそれが実際に知っていることを、われわれが聞きたがっていると予測するものではなく、確実に引き出す方法を求めている。
名称は正確だ。潜在知識とは、システムが持っているが表面化していない知識だ。それを引き出すとは、それを外に取り出す行為を指す。問題は、モデルから情報を引き出す通常の方法——人間が良いと評価する答えを出すよう訓練すること——が、間違った対象を狙っていることだ。
思考実験
標準的な設定は、金庫の中のダイヤモンドを守るAIを想像する。カメラを通じて監視し、ダイヤモンドが安全かどうかを報告する。そこに泥棒がカメラ映像を改ざんし、ダイヤモンドがその場にあるように見せかけて実際には盗む。カメラ映像が問題ないように見えることを予測する良いシステムは、ダイヤモンドは安全だと報告する。実際に起きたことを知るシステムは、盗難を報告する。
訓練中、私たちは確認できるものに対してのみモデルに報酬を与えられるが、確認できるものの大半はカメラに映るものだ。だから私たちは、人間がセンサーを見て結論づけることを報告するようモデルを訓練している。真実と外見が一致するとき、正直な報告者も人間シミュレーターも完全に正解する。二者が乖離するのは、私たちが検証できない場合であり、まさに真実を最も必要とする場合だ。訓練は、現実を伝えるモデルと、私たちが信じるであろうことを伝えるモデルを区別しない。
私たちが真実だと思うことをモデルが言うように報酬を与えることはできる。だが、モデル自身が真実だと知っていることを言うように報酬を与える方法はわからない。
なぜ難しいのか、単に未解決というだけでなく
ELKは明らかな修正に抵抗する。モデルに説明を求めると、もっともらしさに最適化された報告が返ってくるが、そこには 忠実性問題: 説明は内部状態を追跡する必要はない。正直さに報酬を与えれば、採点者にとって正直に見えるものを報いることになり、同じ壁にぶつかる。 スケーラブルな監督. ネットワークの内部から直接答えを読み取ろうとするのは、 メカニスティック解釈可能性 私たちのツールよりもはるかに複雑なシステム上で。どのルートでもこれに遭遇します。モデルの真の信念は、私たちが直接アクセスできない場所に存在しており、モデルのインセンティブがそれらを強制的に公開することはありません。
なぜ気にかける価値があるのか
ELKは具体的な失敗の抽象的な名前です。人工超知能を安全に保つための私たちの希望の多くは、問題が大惨事になる前に問題をキャッチするために、システムに何が起こっているのかを尋ね、本当の答えを得ることができると仮定しています。知っていることではなく、私たちが聞きたいことを報告するシステムは、私たちがそれに手を差し伸べるタイミングでその保護手段を取り除きます。これは、背後にある懸念を正直に報告するバージョンです 欺瞞的アライメント と 策略.
たとえ部分的であっても ELK を解決することは、私たちが確実に調査できるシステムは私たちが監視できるシステムであるため、調整がもたらすことができるより有意義な進歩の 1 つとなるでしょう。それがオープンなままであるということは、財団が現在の安全性アプローチを私たちを超えるシステムに対して適切なものとして扱うことに消極的である理由の一部であり、私たちが次のように主張する理由の一部です。 システムが本当に何を認識しているのかを判断できる段階を超えて構築していない.