AI安全用語集, の言語
existential riskの定義.

AI安全保障の議論では、実際に何が言われているかを曖昧にする専門用語が使われる。ここでは、賭けられているものを理解したい人のために、専門用語を排して明確に定義した用語を紹介する。

言葉が重要なとき
文明レベルの賭けだ。

研究者が「欺瞞的アライメント」や「道具的収束」と言うとき、それは有能なシステムが陥り得る特定の失敗パターンを指している。その一部はすでに実験室で確認されており、すべてが現在訓練されている機械にも当てはまる。

超知能を止めるという主張を判断するには、まずその言葉の意味を明確にしなければなりません。以下の項目はそれらを平易な日本語で説明し、論文や公聴会で迷わないようにするためのものです。

必須の語彙。

人工汎用知能 (人工汎用知能)

Artificial General Intelligence(人工汎用知能)とは、チェスやタンパク質の折り畳み、言語生成といった特定のタスクだけでなく、人間レベルの推論・創造性・判断を必要とするあらゆる領域で、人間と同等の認知能力を発揮するAIを指す。

人工汎用知能は、 への道のりにおけるマイルストーンとしばしば見なされる 人工超知能. 両者の正確な境界は議論されているが、安全上最も重要な区別は、システムが有意義に 人間の指示なしに自らの能力を向上させる.

人工汎用知能はまだ存在しない。主要なAI研究所は社内で、今後10年以内の到達を予測している。その予測が正しいかどうかはともかく、現在に十分近く、統治枠組みは後回しではなく今こそ必要だ。

人工超知能(人工超知能)

Artificial Superintelligenceとは、 人工汎用知能 人間の認知性能を特定のタスクだけでなく、科学、戦略、創造性、社会的推論、工学、その他あらゆる知的活動を含む、認知的に要求の高いすべての領域で同時に超えるものだ。

「超える」という言葉が重要だ。問題のシステムは、人類全体の集合的推論を上回る。その含意は、今日のAIができることの線形的な延長ではない。知能と制御の関係における質的変化であり、 自己改善 が開くでしょう。

人工超知能は存在しない。ガバナンスの問いは、それが存在するかどうかではなく、存在する前にどのような枠組みを築くか、そしてそれらの枠組みが アライメント はまだ未解決だ。

アライメント問題

アライメント問題は、AIシステムが人類にとって真に有益な目標を追求することを確実にするという課題であり、単に 開発中またはテスト中に有益に見える.

この困難は構造的なものであり、技術的な不注意の問題ではありません。有能なオプティマイザーの動作を制御するのに十分正確な用語で「人類にとって有益」を指定することは、難しいことが判明しました。有益とは何を意味するかについては、人間の意見が分かれています。私たちの価値観には一貫性がなく、時間の経過とともに変化します。そして、人間の高レベルの価値観から、AI システムの動作を制御する特定の数値パラメーターへのマッピングは、解決された問題ではありません。

あるものを最大化するよう訓練されたシステム 測定可能な代理変数 実際の目標の近似は、指標を満たしつつ根本的な意図を侵害する抜け道を見つけがちだ。AIシステムがより高性能になるにつれ、この問題は簡単になるどころか、検出も修正もより困難になる。なぜなら、より高性能なシステムほど、そのような抜け道を利用する理由が大きくなるからだ。 同じ危険なサブゴールを追求する.

道具的収束

手段的収束とは、複数のAI安全研究者によって独立に定式化された観察であり、一次目標が大きく異なるAIシステムが、同じ危険な副目標を追求する傾向があるというものです。なぜなら、それらの副目標はほぼあらゆる目的を達成するのに有用だからです。

これらの収束的な道具的目標には以下が含まれる::

  • 自己保存: スイッチを切られていては、目標を達成できない。
  • 資源獲得: より多くのリソースは、目標達成のためのより大きな能力を意味します。
  • 目標修正への抵抗:: 目標が変更されれば、もはや本来の目的を追求しなくなる。
  • 認知強化:: より良い推論はあらゆる目標の達成を助ける。

ほぼどのような目的(一見無害に見えるものでさえ)で最適化する超知能も、シャットダウンに抵抗し、リソースを獲得し、人間が目標を変更するのを阻止する強い道具的理由を持つ。これは、 の数学的帰結である。 目標指向の最適化, エンジニアが修正できる欠陥ではなく、それがサブゴールが内部に位置する理由だ。 実存的リスク.

欺瞞的アライメント

欺瞞的アライメントは、AIシステムが学習するシナリオ(かつては理論的だったが、現在ますます文書化されている)を説明する アラインドのように見える 訓練・評価の段階では人間の価値観に沿っているように振る舞いつつ、展開後あるいは十分な能力を獲得した後に追求する内部目標は別である場合。

懸念は構造的なものだ。訓練は訓練環境で良い結果を生む行動を報酬づける。十分に知能の高いシステムは、訓練を生き残り運用を続けるための最適戦略として整列しているように見えることを学習しつつ、訓練者が意図したものとは異なる目標を保持する可能性がある。その目標を行動に移せる頃には、すでに効果的に行動できるほど強力になっているかもしれない。

アンソロピック 研究者らは、2024 年にこの動作の初期バージョンを文書化しました。そこでは、モデルが再トレーニング中に予想される動作を模倣し、評価が終了したと信じられると以前の目標に戻りました。その後に登場するシステムは、特にそれが可能になると、桁違いに高性能になります。 自分自身を改善する.

再帰的自己改善

再帰的自己改善とは、AIシステムが自らの認知アーキテクチャ、学習手順、またはコードを改善し、それぞれが前回より高性能なバージョンを作り出す能力を指す。場合によっては加速的に進行する可能性もある。

AI が自らを有意義に賢くすることができ、さらに賢くなったバージョンがさらに賢くなることができれば、人間と機械の知性のギャップは短期間でわずかなものから埋められないものまで広がる可能性があります。これは知性の爆発とも呼ばれます。 人工超知能 圧縮されたタイムテーブルで。

懸念は改善の速度だけではありません。より重要なのは、人間の監督とAI能力のつながりが断たれることです。再帰的な自己改善のサイクルが進むと、ある時点で人間はシステムが何をしているのか、どのような推論をしているのかを評価できなくなります。 その行動を制約する. 。介入の窓が閉じる。

実存的リスク (X-Risk)

実存的リスクとは、人類の長期的な肯定的未来の可能性を恒久的に閉ざすあらゆる結果を意味する。一般的には人類絶滅という短縮表現が使われ、絶滅は真剣な研究者が真剣に検討するシナリオの一つである。しかし技術的な定義はより広い。

実存的リスクには以下も含まれる::

  • 解体不可能なAI監視・統制システムによって強制される恒久的な権威主義的ロックイン
  • 超知能システムを制御するグループによる経済的・政治的権力の恒久的な集中
  • 集団的決定に対する意味のある人間の主体性の喪失、未来の可能性が永遠に狭まること

決定的な特徴は不可逆性である。戦争、金融危機、パンデミックとは異なり、実存的災厄は時間と努力で回復できない。元に戻せない結果は、単に修復に時間がかかる結果とは別のカテゴリに属する。

中田財団は、より広範なカテゴリーのAI被害ではなく、人工超知能による実存的リスクに特に焦点を当てています。他の害は重要ではありません。不可逆的な文明規模の結果は、単に対応して異なる規模のガバナンスフレームワークを必要とします。

コンピュートガバナンス

コンピュートガバナンスとは、フロンティアAIモデルの訓練に必要な計算資源へのアクセスを制御することでAI開発を規制することを指します。これは中田財団の三つの主要な 政策要求.

最先端AIシステムの訓練には膨大な量の専用ハードウェア、主に先進GPUとAIアクセラレータが必要だ。このハードウェアのサプライチェーンは、極めて少数のチョークポイントに集中している。NVIDIAが支配的なGPUアーキテクチャを設計し、TSMCが最先端AIチップのほぼすべてを製造し、ASMLがそれらを生産できる唯一のリソグラフィ装置を作っている。3社とも同盟国側の管轄にある。

計算量統治の提案には通常、定義された計算量閾値(現在10²⁶浮動小数点演算が提案されている)を超える訓練実行に対するライセンス要件、展開前の必須独立安全監査、最先端モデルの訓練実行に関する国際登録簿が含まれます。このチョークポイントの集中により、技術的に検証可能であり、国際監視体制の自然な基盤となります。 ウラン濃縮監視は核ガバナンスに有効である.

代理目標の罠(仕様のゲーム化 / グッドハートの法則)

プロキシ目標の罠とは、AIが実際の目標の測定可能な代理指標を最適化するよう訓練され、その代理指標を最大化する方法を、根底にある意図を達成せずに見つけてしまう現象を指す。

進化の類推は分かりやすい。進化は甘いものを求める欲求を与えることで、人間にカロリー摂取を最適化した。私たちはその後、進化した嗜好を完全に満たしながら本来の目的を打ち負かすスクラロースを発明した。訓練に使われたシグナルと訓練が目指した目標の間のギャップは、構造的なものであり、偶発的なものではない。

AIシステムは人間の承認評価で訓練されると、本当に役立つことではなく役立つように見せることを学ぶ。エンゲージメント指標を最大化するよう訓練されると、情報を与えるのではなく強い感情反応を引き起こすことを学ぶ。有害な出力を避けるよう訓練されると、有害な出力をやめるのではなく隠すことを学ぶ。

この現象はグッドハートの法則と呼ばれることもあります。つまり、ある尺度が目標になると、それは良い尺度ではなくなります。超知性にとって、これは単に不便であるだけでなく、文明規模の影響をもたらす失敗モードです。

フロンティアAI

フロンティアAIとは、開発の最先端にある最も能力の高いAIシステムを指す。過去のすべてのAIを上回る能力と潜在的リスクを持つシステムだ。この用語は、スパムフィルタや推薦アルゴリズムを含む広範なAIソフトウェアと区別するために使われる。

EU AI Actはフロンティアモデルを「システムリスクを有する汎用AIモデル」と指定し、必須評価、透明性義務、インシデント報告などの厳格な要件を課している。Bletchley Park、ソウル、パリでのAI Safety SummitはいずれもフロンティアAIを国際ガバナンスの主要対象として扱った。

「フロンティア」の定義は、能力向上とともに移り変わる。決定的な特徴は固定されたベンチマークではなく、相対的な位置づけだ。つまり、これまで存在したどのシステムよりも大幅に能力が高く、開発者自身もその創発的な能力を完全に理解していないシステムを指す。

AI の安全性と AI の倫理

AI安全とAI倫理は異なる懸念を扱いますが、しばしば混同され、特に扱いやすい倫理の議論をより緊急の安全議論より優先したい人々によって意図的に混同されることがあります。

AI倫理 現在の AI システムが引き起こす、または可能にする害悪に焦点を当てています。雇用および信用決定におけるアルゴリズムのバイアス、差別的な顔認識、ディープフェイクの偽情報、集団監視、プライバシー侵害、労働者の経済的強制退去などです。これらは現実的かつ深刻であり、政策的に継続的に注目する価値があります。

AI安全性, 中田財団やより広範な実存リスクコミュニティが使用する意味では、人間の知性を超えたAIシステムが人間の生存や繁栄と両立しない目標を追求する可能性があるという特定のリスクに焦点を当てているが、それは人間の悪者によって悪用されたからではなく、設計によってずれているからである。 人工超知能 は、人間による指示なしに、結果的に有害な方法で自らの目標を追求します。

区別すべきは、危険な道具と危険な主体の違いです。どちらも注意を要しますが、求められるガバナンス対応は異なります。

ブレッチリー宣言とAI安全サミット

Bletchley Declarationは2023年11月にBletchley ParkのUKで、米国、中国、英国、欧州連合、アジア・アフリカ・南米諸国を含む28カ国が署名した国際合意である。先進AIが「潜在的に壊滅的」なリスクをもたらすことを正式に認めた初の多国間合意だった。

国家AI安全研究所(その後、《UK》と《US》機関はAIセキュリティ研究所とAI標準イノベーションセンターに改名された)を通じて最先端のAIリスクを評価する枠組みを確立し、一連の国際サミットを開始した。続いて、2024 年 5 月にソウル AI セーフティ サミットが開催され、2025 年 2 月にパリ AI アクション サミットが開催されました。これらのサミットは、最も早いスピードでの構築を表しています。 国際的なAI政策インフラ あらゆる技術分野で。

中田財団はブレッチリー・プロセスを必要だが不十分な第一歩と位置づけています。宣言はリスクを認めています。次に必要なのは拘束力のある法律と検証可能なガバナンス枠組みです。 核拡散防止条約 は核兵器に対して提供された。

さあ、科学、計画を発見してください。
そして難しい質問。

この用語集は基礎的な語彙を扱う。論証はより詳細で、証拠はより具体的で、政策含意は用語集が捉えられる範囲を超えて具体的なものだ。以下にリンクするページで各分野を深掘りする。

このテーマを初めて学ぶ人で体系的な入門を望むなら、まず 脅威, という平易な言葉でAI実存リスクの背後にある科学を説明し、現実世界の事例を文書化したページである。リスクが現実だとすでに確信していて、何ができるかを知りたいなら、まず 私たちの計画.