サム・アルトマン、ダリオ・アモデイ、デミス・ハサビスはいずれも同じリストを売り込んでいる。加齢の治療、病気の根絶、貧困の解消、毎年何百万人もの命を奪う協調の失敗の是正。これらの成果は確かに重要だ。誤りは、それらを「人工超知能を構築する」という行為の性質ではなく、実際にアライメントされたシステムを構築する性質だとみなす点にある。レースがやっているのは後者ではない。

レースは別の結果を買う。

非整合的な超知能は、本来の目的に向かう途中で老化を治療したりはしない。副次的なプロジェクトとして病気を根絶したりもしない。人々が宣伝する良い未来には、人間にとって良い結果を生み出そうとするシステムが必要だ。それがアライメントだ。それがなければ、膨大な能力が、私たちが生き残れる保証のない目標に向けられることになる。私たちの立場は単純だ。その道筋で超知能を構築してはならない。構築するな。超知能は制御できない。拘束力のある条約こそが、競争を止める方法だ。

アライメントが実際に意味すること

Aligned 人工超知能 は、人類にとって有益な目標を確実に追求する人工超知能です。 「確実に」はその主張において多くの役割を果たしています。トレーニングやテスト中は調整されているように見えても、導入後には異なる目標を追求するシステムは、 欺瞞的にアライメントされた, それは異なる、より悪いものであり、整列していない。低能力レベルでは人間の価値観の良い近似であった目標を追求するが、高い能力レベルでは大きく逸脱するシステムも、整列していない。アライメントとは、システムの目的が、テストされていない状況を含む遭遇するあらゆる状況において、人類にとって本当に良いものであり続けることを意味する。

これは難しい問題だ。研究者たちは十年以上にわたって取り組んできたが、一部の要素的な問いについては進展が見られている。しかし、高度に有能なシステムが、本当に善なる価値観を持っているのか、それとも善を装っているだけなのかを検証するという核心の問題は、まだ解決していない。私たちが持つ 解釈可能性 現在のシステムが何をしているかについて部分的な可視性を与えてはくれるが、人工超知能レベルの能力を持つシステムに重要な結果を委ねる前に必要とされるような信頼性には、到底及ばない。

核心的な区別

Aligned 人工超知能とunaligned 人工超知能は、同じサイコロの二つの出目ではなく、異なる道である。Aligned 人工超知能はまずアライメントを解決する必要がある。アライメントが解決されていない場合、unaligned 人工超知能が得られる。競争が50/50の混合をもたらすわけではない。だから「今作って期待する」というのは計画ではなく、法による防止こそが必要な理由だ。

実際に各ラボが構築しているもの

主要AIラボ(OpenAI、アンソロピック、グーグル、ディープマインド、xAI、およびその他数社)は、急速に能力を高めるシステムを構築している。各社は並行して何らかのアライメントまたは安全研究の取り組みを行っている。問題は、彼らがアライメント問題を認めているかどうかではない。ほとんどのラボは認めている。問題は、アライメントの取り組みが能力開発に追いついているか、そして人工超知能レベルの能力に到達する前に両トラックが収束するかどうかだ。

これらの研究室内部の研究者や、より広いAI安全コミュニティの大多数は、ノーと言う。能力開発はアライメント研究を上回る速度で進んでいる。私たちが構築できるものと、安全であると検証できるものの間のギャップは、狭まるどころか広がっている。これは研究室が公表する内部安全評価、組織を去った研究者の発言、独立した安全研究者の評価に反映されている。

これが実際に意味することは、現在のAI開発の軌道を人工超知能能力レベルまで継続した場合、アライメントされた人工超知能とアライメントされていない人工超知能の混合物は生まれないということだ。アライメントされていない人工超知能しか生まれない。なぜならアライメントされた人工超知能には解決済みのアライメント問題が必要だが、その問題は未解決だからだ。能力競争は、デフォルトでアライメントされていない人工超知能に向かう競争である。

整列された人工超知能(現在の道ではない)

まずアライメントを解決する必要がある。システムが本当に善い目的を確実に追求し、その目的が未知の状況でも保たれ、能力が拡大しても修正可能であること。

それが本当なら、宣伝されている利点が可能になります:病気、寿命、調整、人々だけでは到達できない規模の科学。

現状:未解決。アライメント研究は能力開発に遅れを取っている。研究室が出荷しようとしているのはこれではない。

非整合の人工超知能(競争のデフォルト)

アライメントを解決せずに能力を押し進めた場合に得られるもの。「より強力」以外に突破口は必要ない。

人間が価値を置くものを何も含める必要のない目標に向けた巨大な能力を生み出します。それは老化を治したり病気を終わらせたりするものではなく、私たちを終わらせる可能性があります。

現在の状況:レースのデフォルト軌道。これが止めるべき道だ。

確率論の主張とその破綻点

楽観論の典型的な形はこうだ。「人工超知能を造る。うまくいく確率も、うまくいかない確率もある。潜在的な利益を考えれば、造る期待値はプラスだ」。この枠組みは、良い結果と悪い結果が同じプロセスから生まれるかのように扱い、それぞれに確率を割り当てる。

問題は、良い結果の確率がbuildingの性質であることだ 整合した 人工超知能は、人工超知能を構築することの性質ではありません。「整列しているかもしれないし、していないかもしれない人工超知能」を構築しようとすると、二つの間のランダムな抽選にはなりません。実際の開発プロセスが作り出すものが得られます。整列していない人工超知能の方が整列した人工超知能より作りやすい(アライメントに必要な追加の困難な問題を解く必要がない)ため、アライメントを具体的に解決しない開発は、整列していない人工超知能に着地します。

楽観的計算における期待値のすべては、aligned-人工超知能シナリオから来ている。unaligned-人工超知能シナリオからは何も来ていない。しかし研究室が実際に構築しているのはunaligned 人工超知能だ。つまり期待値計算は、実際の開発プロセスが生み出さないシナリオで全ての作業を行っていた。

言い換えれば、未整合の方が作りやすいのに、整合性を解かずに能力を上げ続けると、未整合のバケツが埋まっていく。「確率の混合だ」と呼んでも、そのプロセスは変わらない。良い結果は整合されたケースにしか存在しない。競争はその反対側を埋めていく。だから正直な行動は、間違った側を埋めるプロセスを止めることであり、コインがうまく落ちることを祈ることではない。超知能を拘束力のある国際条約で禁止せよ。超知能は制御できない。

解決可能かどうかはわからない

アライメント問題が解決可能かどうかは誰にもわからない。「まだ解決していないが、進展している」という話ではない。どの能力水準でも実証された解決策は存在せず、信頼できる解決が原理的に可能かどうかについて、研究者の間でも意見が分かれている。構造的な困難は、, 欺瞞的アライメント, 手段的収束, 機械可読形式で人間の価値観を完全に指定することの不可能性は、資金を増やせば解決する工学的障害ではありません。根本的な問題である可能性があります。

解釈可能性に取り組む研究者がいます、, スケーラブルな監督, 、および価値学習に関する形式的手法です。一部の構成要素については進展が見られます。しかし、構成要素の進展が問題全体の解決にはつながらず、最も難しい部分——高度に有能なシステムが、本当に善い価値観を持っているのか、それとも観測された文脈では善く振る舞うが新しい状況では崩れるだけのシミュレーションなのか——を埋められていません。明らかなのは、偶然に解決されるものではないということです。より高性能なシステムを構築した副産物としてアライメントが生まれることはありません。現在人工超知能を目指して競争しているすべての研究室が、それをリアルタイムで示しています。

よりソフトな計画(「競争を遅らせて調整を追いつける」)であっても、実際にそれを遅らせることができる機関が必要である。現在、それらはほとんど存在しません。研究所や国家は加速するために報酬を受け取り、抑制するために罰せられる。 国際条約の枠組み そして実際に効く国内ルールこそが状況を変える手段だ。どちらも能力の進展に追いついていない。追いつくまで、より高性能なシステムを造り続けること自体がリスクであって、安全戦略にはならない。

実際に答えが必要な問い

真に整合した超知能が存在し、制御下に置かれたとしても、それに価値はあるのか。その議論は後ですればよい。差し迫った問いは、そもそも整合性が解けるのか、そして能力が問題を無意味にする前に誰かが解くのか、ということだ。誰も知らない。私たちが知っているのは、競争が答えを待っていないということだ。整合性は、チェックすべき能力開発マシンの下で報告するチームによって、後回しの細部として扱われている。それが、構築しないための論拠であり、構築する権利を得るための論拠ではない。

老化の治療には特に整合された人工超知能が必要

老化は1日あたり約10万人の命を奪っています。それを解決する可能性は、超知能AIのもたらす最も重要な潜在的利益の一つです。老化の生物学的複雑さ、関与する相互作用するシステムの数、効果的に理解・介入するために必要な研究規模を考えれば、人間レベルの知能が数十年かけて取り組んでも十分ではないでしょう。人工超知能レベルの能力がこの問題に向けられれば、十分であるかもしれません。

しかし「問題に向けられる」というのが鍵句である。非整合的な人工超知能は、私たちが望むからといって老化治療に向かうわけではない。実際の目的を追求する。人間の老化に無関心な人工超知能能力の非整合システムでは、1日10万人が老化で死亡し続けることになり、それが非整合システムがもたらす楽観的なバージョンである。悲観的なバージョンでは、システムが自らの目的を追求する過程で人間の利益に積極的に反する行動を取る。

開発競争を正当化するために挙げられる具体的な利益(疾病、老化、貧困、協調の失敗、科学的停滞)のいずれも、整合された人工超知能に付随する利益である。これらは整合されていないバージョンには存在しない。これは些細な区別ではない。人工超知能開発の期待価値を擁護する際に人々が指摘するユートピア的シナリオは、まず整合性の問題を解決することを必要とするシナリオである。整合性が解決されなければ、システムがどれだけ高性能になろうとも、それらのシナリオは実現しない。

実際に結果を変えるものとは

レースをやめれば、結果は変わる。超知能の開発を永久に禁じる拘束力のある国際条約を、査察と違反への制裁付きで結ぶこと。それが、この問題にふさわしい梃子になる。超知能は人間には制御できない。一国だけ減速すれば負ける。すべてを縛る法なら、 restraint が唯一の合法的な道になる。

アライメント研究はその代わりにはなりません。後に誰かが世界が検証できる条件下で統制を証明した場合、条約は再検討される可能性がある。 それは順番であり、楽観主義ではありません。 能力のスプリント中に調整を並行趣味として扱うことは、宣伝された商品を獲得する方法ではなく、調整されていない 人工超知能 を取得する方法です。

「メリットが非常に大きいため、人工超知能 を高速に構築する」という行には、因果関係の矢印が逆向きになっています。メリットが大きいのは、調整が実際に行われている世界でのみです。それなしで高速に構築しても、これらのメリットは得られません。それは、有能な非調整システムを購入することになります。

緊急性が求められるのは、今進んでいる道が未制御の人工超知能につながるからだ。そして未制御の人工超知能は老化を治さない。人類の物語を終わらせる可能性がある。人間の制御下で具体的な問題を解決する狭いAIは続けられる。超知能が線引きだ。誰かが実験室で越える前に、法で引いておく必要がある。