世界は毎年、AIシステムをより有能にするために巨額を投じている。一方、その最終状態を生き延びられるものにするための努力は、端数に過ぎない。その端数のさらに内側に、もう一つの誤りがある。安全保障予算の大部分は、依然として超知能が作られることを前提にし、その結果を「うまくいく」ようにしようとしている。

資金と名声のほとんどは依然として、レースをより安全にする方に流れていて、人工超知能へのレースを終わらせる方には向かっていない。

その前提こそが問題だ。人工超知能が制御できない技術であるなら、希少な安全保障資源の合理的な使い方は、同じレースのより友好的なバージョンを資金提供することではなく、作られるのを止めることである。

今日のお金がすること

AI安全、広義に取れば、おおよそ 年間1億9000万ドル. 能力開発には何百億ドルもの資金が投じられる。安全分野の中でも大きな割合が技術的アライメントに向けられる。より良い監視手法、より良いレッドチーミング、テスト条件下で正しいことを言うようモデルを訓練するより良い方法などだ。その一部は現在のシステムには有用かもしれない。テストする人々より賢いシステムに対する実証済みの解決策であるものは、ほとんどない。

この分野はこれを知っています。欺瞞的アライメント、目標の誤指定、評価のゲーム化に関する論文は秘密ではありません。ラボは、モデルが圧力下で策略を巡らせる結果を公表しています。それに対する反応は、あまりにもしばしば「次の訓練実行をより安全にするためにより多くのアライメント予算を」と求めることです。訓練実行は同じスケジュールで続いています。

事後的なアライメントは、我々が作る権利を失い続けている賭けだ

もし世界が超知能への競争を凍結する条約を可決したとしたら、すでに存在するシステムのために、入手できるあらゆる本格的な手段が欲しくなる。

資金調達の調整が主要な計画である一方で、研究室はスーパーインテリジェンスに向けて拡大し、目的地は固定されたものとして扱われます。私たちは目的地を選ぶことができます。核兵器、オゾン化学、および人間のクローン作成には、それぞれ、特定の終末状態には残留リスクを負う価値がないと世界が判断した瞬間がありました。スーパーインテリジェンスはそのリストに永久に含まれます。超知能は制御できません。

代わりに資金を向けるべきところ

人工超知能向けアライメントの山を、非作成を強制可能にする作業へ振り向ける::

  • 国境を越えて検査可能な条約設計、検証、およびチップレベルの計算ガバナンス。
  • 目標を明確に保つ世論形成:曖昧な「AI減速」ではなく、超知能を止めること。
  • 内部告発者支援、インシデントの透明化、そして静かな能力跳躍のコストを高める独立評価。
  • 立法者が研究室のロビイストだけでなく、有権者からの声も聞くための政治的組織化。

このリストは、新しいトレーニング手法ほど魅力的ではありません。これは、障害モードに一致する唯一のリストでもあります。調和しているように聞こえることがわずかに優れている超知性は、依然として超知性です。世界が建設を拒否した場合、アライメント研究は期限なしで継続され、消滅する可能性があります。

ラボ内部からの異議

「アライメントを解かなければ、誰か別の者が安全でない形で作るだろう」。よく耳にする主張だ。最前線に残る研究者たちは、自分の存在が安全につながると信じがちだ。今日のモデルリリースについては正しい場合もある。だが極限では破綻する。どのチームも次の飛躍のための安全作業の資金を稼ぐためにもう一段の能力飛躍を必要とするレースは、バッジをつけただけのレースだ。

質問は 拘束力のある国際条約, 、危険が共有され、不正行為をする動機が本物だったときに使用されるのと同じ種類の手段。 1つの研究室による一方的な拘束により、人種は無傷のままになります。調整資金はその政治を支援することができます。それを代用すべきではありません。

条約の後、続けたいなら続けろ

超知能に関する拘束力のある検証可能な禁止の後、人類の絶滅を許容可能な実験コストとして扱わない規則の下で、すでに存在するシステムの研究を続けることができます。超知能は人間にはコントロールできません。この禁止令が発効する前は、レースがやりやすいと思わせるために使われたすべてのドルは、レースを終わらせるために使われなかったドルになります。

資金を予防、法律、検証に回せ。