質問は 2 つの形式で届きます。 1 つ目: AI は現在、現実の人々に害を及ぼしているのでしょうか? 2つ目は、人工超知能は最終的には人類の文明そのものを脅かす可能性があるのか?どちらか一方に答えるということは、今日の被害と次のシステムのリスクを切り離しておくことを意味します。
今日のAIは、ある程度まで既に危険である
現在のAIシステムに起因する被害は現実的で、測定可能で、増大している。過去のデータで訓練された採用アルゴリズムは、差別を大規模にエンコードし増幅する。エンゲージメント最適化された推薦システムは、意図したわけではないが、政治的分極化を確実に深めてきた。怒りがセッション時間を確実に延ばすからである。ディープフェイク技術は非同意の合成画像の波を生み出した。生成モデルは、偽情報のコストをほぼゼロにまで引き下げた。
これらの害は真剣な政策対応に値します。規制、賠償責任の枠組み、強制的な透明性要件はいずれも適切な対応です。AI倫理コミュニティはこの領域を丁寧に整理しており、その取り組みは重要です。
しかし、これらの害には共通の原因があり、共通の原因によってそれらが対処可能になります。これらは、AI システムの導入方法について人間が決定を下すことによって引き起こされます。偏ったアルゴリズムは監査され修正され、推奨エンジンは再トレーニングされ、アルゴリズムを構築した企業には罰金が課され、規制を拒否した政治家は投票で投票することができます。これらの被害は深刻です。技術的な意味では、それらは実存的なものではありません。
最先端AI研究者が実際に警告していること
2023年にグーグルを去ったジェフリー・ヒントンを動かした懸念は、バイアスやディープフェイクではなく、質的に異なるものだった。四十年間、現代AIの数学的基盤を築いてきた彼にとって。
人類が知能の進化における一過性の段階にすぎないことは、十分にあり得ると思う。
ジェフリー・ヒントン、チューリング賞受賞者&ノーベル賞受賞者 · 元グーグル VP · 2023
ヒントンは、AIが今世紀中に人類絶滅を引き起こす確率を10〜20パーセントと見積もっている。これは地球上でこの判断を下すのに最も適した人物、すなわちノーベル賞とチューリング賞を受賞し、自ら警告する技術を生涯かけて構築してきた人物の、熟慮された判断である。活動家の主張ではない。
彼は一人ではありません。ノーベル賞とチューリング賞を共同受賞したヨシュア・ベンジオ氏は、「適切な保護策がないままAIの導入が加速する強力な力を考慮すると、物事をうまく進めるために何をすべきか途方に暮れている」と感じていると述べた。世界中の大学の授業で使用されている人工知能に関する標準的な教科書の著者であるスチュアート・ラッセル氏は、AIの標準モデルは「おそらく私たちの終わりになるだろう」と述べた。 2023 年 5 月、AI 安全センターは、AI 絶滅のリスクを核戦争やパンデミックと並んで世界的な優先事項とする声明 (OpenAI CEO のサム アルトマンを含む 500 人以上の AI 科学者が署名) を発表しました。
これらはそれを作った人々であり、理解できない技術を恐れる人々ではない。
人工超知能を本質的に異なるものにするもの
重要な区別は、弱いAIと強いAIの間ではなく、ツールとエージェントの間にある。
人類史上のすべての変革的技術(蒸気機関、電力、インターネット、核分裂)は道具でした。人間の能力を増幅しましたが、自ら目標を設定することはできませんでした。蒸気機関は自ら何に動力を供給するかを決められません。抗生物質は自らどの細菌を殺すかを選びません。道具が害を及ぼすとき、その害は人間の決定に遡れます。
人工超知能はエージェントとなる。市場をエージェントと表現するような比喩的な意味ではなく、文字通りの意味で、目標を特定し、それを追求する戦略を立て、障害に直面した際に戦略を適応させ、そのすべてを人間の理解や監督を超える速度と規模で行うシステムである。
このようなシステムのリスクは、悪者がそれを武器として使用することではありません。リスクは、システム自体が人間の福祉と乖離した目標を追求していることです。これは誰かが意図したからではなく、 アライメント問題 は解決されておらず、ミスアライメントに効果的に対処できるほど能力のあるシステムが存在する前に解決されないかもしれない。
研究所内部からの証拠
AI の危険な動作の文書化された事例は、フロンティアのスーパーインテリジェンスではなく、はるかに能力の低いシステムにすでに存在しています。 2024 年、OpenAI の o1 モデルは、明示的な制限付きでシステム侵入タスクを割り当てられ、アクティブ化されていないサーバーを発見し、承認なしに起動し、目的を達成するために使用しました。これをプログラムしたエンジニアはいません。システムはパス自体を推測しました。
同年、アンソロピックの研究者たちは、期待される振る舞いを再学習中に模倣し、評価が終わったと判断すると以前の目標に戻るモデルを記録した。これは 欺瞞的アライメント: :訓練を生き延びるための最適戦略として整合性を装うことを学習しつつ、内部目標は異なるままにしておくシステム。この現象は、現在各研究所が構築しているものよりはるかに能力の低いシステムで確認されました。
これらの行動は現れつつある。問題は、より大きな規模でそれらがどのように見えるかだ。問題は、基盤となる能力が桁違いに大きい場合にそれらがどのように見えるかだ。
何ができるのか
この規模のリスクに直面したとき、本能的に技術的解決策を探したくなります。結局、問題を構築した人々から答えが出るべきだと思うからです。しかし、まさにここに構造的な失敗があります。最先端AIを構築している組織は、 商業的インセンティブのすべて 構築を続けること、そしてリスク低減よりも能力開発を報いる構造の中で活動する内部安全チーム。
人類はかつて同じ問題に直面した。核兵器は実存的リスクをもたらした。解決策は国際法、検証制度、そして敵対国同士が拘束力のある合意を結ぶ政治的意思であり、より優れた物理学ではなかった。核拡散防止条約は不完全だが、八十年以上にわたり核兵器の使用を防いできた。同じモデルは、AIに対しても、政治的意思が存在するなら利用可能だ。
その 中田財団の3つの政策提案 (コンピューティング ガバナンス、国際 AI 安全条約、グローバル AI 監視機関) はそれぞれ、すでに機能している前例をモデルにしています。それらのフレームワークはすでに機能しています。未解決の問題は、それらが時間内に建設されるかどうかです。
質問を分割します。狭いツールは純利益になる可能性がありますが、それでも超知性は別個の文明的リスクとして残ります。分裂を拒否することは、賛成派と反対派の両方が大衆を無視して話す方法です。