「AIリスク」という言葉を聞くと、人々は往々にして三つの異なるものを混同する。現在起きている通常の危害、文明を残したままの大災害、そして人類の物語を終わらせたり、人類を永続的に制御不能に陥れたりする結果である。このページが扱うのは第三の類型——人工超知能による実存的リスクだ。研究の背景は必要ない。必要なのは地図である。

実存的リスクは単なる「非常に悪い」ではない

壊滅的リスクは何百万人もの命を奪っても、人類の未来を残す可能性がある。一方、実存的リスクは絶滅か、人類が意味のある制御を永久に失うほどの完全な無力化を意味する。ブランディングが意図的にこれらの層を曖昧にすることがある。区別しておくこと。チャットボットやバイアスだけを扱う政策では、テーブルの最上位には届かない。

なぜAIは違うのか

小惑星や火山には戦略がありません。人工病原体は恐ろしいものですが、依然としてほとんどが人間の手による道具です。高度な AI は、戦略的なアクターとなり得る最初のテクノロジーです。つまり、目標を設定して追求し、マシンの速度で動作し、ネットワーク全体に拡張し、限界内でそれ自体を改善します。この組み合わせが、超知性が独自の列に位置する理由です。

実存的結果がどのように到来するか

現実の人生では道は重なり合う。それらに名前を付けることで、会話が一つの映画に崩壊するのを防ぐ。

制御の喪失。 システムが完全に指定していない目標を追求し、修正に抵抗する。 レースダイナミクス. 競合する研究所や国家は安全対策を省略する。 誤用。 人類は他の人類に対して極端な能力を行使する。 漸進的な権力剥奪。 機関はその形態を保ちつつ、決定は誰も覆せないシステムへと移行していく。 拡散. 危険な汎用システムは、単一のオフスイッチでは制御しきれません。

技術的アイデアを平易な言葉で

直交性: 知性と目標は切り離される可能性があります。賢いというのは優しいという意味ではありません。 道具的収束: :多くの最終目標が、資源や自己保存といった下位目標を共有する。 アライメント: システムに実際に意図したことを追求させること。 欺瞞的アライメント: :訓練や評価の間は安全に見せかけ、隙ができたら態度を変える。これらはいずれも機械の「憎悪」を必要としない。

偽りの精密さのない確率

P (破滅) は、AIによる実存的惨事の確率を個人が推定した値の非公式な略称だ。専門家の意見は大きく分かれる。研究に最も近い人々の多くが、数十年以内の災害に非ゼロの確率を置いている。すべてを失う確率がわずかでも、期待損失は依然として大きい。「確実になるまで待つ」というルールは、不可逆的なテールリスクには適さない。

現在の害と適応

"タイムラインは不確実だ;現在の害に焦点を当てるべきだ。" 現在の被害は重要だ。それが、現在のプロジェクトを終わらせるようなテールリスクを無視する理由にはならない。両方とも真実であり得る。近未来の悪用を規制し、制御不能な超知能への道を塞ぐ。

"私たちは常に適応する。" 適応には時間、フィードバック、生存者が必要だ。超知能の失敗モードは三つすべてを奪う。

"これは反技術だ。" Foundation は、医学、科学、物流などのツールのような役割を担う、狭い範囲の AI を支持しています。ラインは主権者の一般精神です。

"誰かがそれを制御するだろう。" 誰も超知能を、運用者より賢い稼働中のシステムに対する永続的な人間の命令という意味で制御することはできません。構築するかどうかの決定を制御することはまだ可能であり、だからこそ拘束力のある禁止が重要です。

リスクを低減するもの(そしてそうでないもの)

役立つもの:人工超知能を目指すフロンティア訓練への拘束力のある制限、計算資源統治、独立評価、検証機関、政治的圧力、そして明確な公的言語。席の配置換え:解決済みアライメントとして売られるマナー訓練、外部からの強制力のない自主的誓約、数値閾値のないサミット写真。

暗黒の地図の後の主体性

賭け金が暗いため、この主題は暗いです。行き場のない恐怖は裏目に出ます。その道筋は具体的である。超知能を他の禁止されている高リスク階級と同様に扱い、 機能が到着する前に検査可能なルールを構築する, 、そして人々に奉仕する狭いAIを維持します。私たちは強力なツールを維持できます。私たちはすべきではありません 覆せない心を築く.