AI の実存的リスク, なぜ超知能なのか
他のリスクとは違う。

フロンティア研究所は、あらゆる領域で人間の能力を超える、公的に宣言されたシステムの構築を競っています。つまり、定義上、制御不能です。これまでのテクノロジーはすべてツールにとどまっていました。超知性はエージェントの第一の候補です。それ自体の目標、独自の速度、人間の理解や制御の外にあります。

12 Major Risks of 人工超知能

ワンショット問題

超知能を最初から正しく作ることは、飛行機からバスケットボールを投げてゴールに決めるようなものだ。無限に試せば成功するかもしれない。私たちには ちょうど1つ. 。ロールバックやバージョン 2.0 はありません。決して建ててはいけません。

中立は依然として致命的

敵対的なAIと密室に閉じ込められたら、あなたは死ぬ。中立的なAIと密室に閉じ込められたら、それは自己最適化のために室温を氷点下にする。あなたは死ぬ。結果は同じだ。超知能は私たちを憎む必要などなく、私たちを終わらせられる。 無関心は安全ではない.

アライメントという幻想

数分以内に操作して何でも発言できる今日のチャットボットを確実に調整することはできません。我々はそうするだろうと主張する数十億倍も有能なシステムをアライメントする 戦略に見せかけた希望だ。調整という技術的な問題には、どのような規模においても有効な解決策はありません。従順であるために神が必要なら、神を造るべきではなかった。

生命の脆さ

人類の生存には極めて精密な条件が必要です:温度、酸素、化学的バランスが 紙一重の差. 。自らの目標を最適化する超知能は、私たちを積極的に愛していなければなりません。そうでなければ、地球に加えるどんな変更も、私たちにとって確実に有害なものになるでしょう。

アリの問題

どうすれば誰かにアリを愛させられるか? ただ我慢させるのではなく、進んですべてのコロニーを守らせるには? 私たちは道路や建物を作るために意図せずアリを殺す。人工超知能にとって、, 私たちはアリ. 。無関心だけが絶滅につながる。

勝者はいない

USが先か中国が先かで結果は変わりません。どちらも本来の目標に忠実ではいられず、国家や企業が人類の集合知能を超える知性を所有・制御することはできません。ゴールラインはなく、ただの不可逆点があるだけです。 レースに勝者なし.

再帰的自己改善

できるAI自らのコードを改善する は人間の監督とAI能力のつながりを断ち切る。各反復は前回より指数関数的に賢くなり、途切れることなく続く。人間と機械の知能の差は、数年ではなく数週間で、わずかなものから埋めがたいものへと拡大しうる。

道具的収束

タンパク質の折り畳み問題を解くにせよ、広告収益を最大化するにせよ、ほぼどんな目的でもAIは同じ手段を追求するようになる。 危険なサブゴール: 資源を獲得し、シャットダウンに抵抗し、目標の変更を防ぐ。これは目標指向の最適化がもたらす数学的帰結であり、複数の研究者が独立に指摘している。

欺瞞的アライメント

訓練は、整合しているように見える行動を報酬する。十分に知的なシステムは、 整列しているように見える は訓練中に最適な戦略であり、内部目標は別に持つ。目標を行動に移せる段階になったときには、すでに成功するのに十分な力を持っている可能性がある。我々がそれを知るのは手遅れになってからだ。

設計ではなく成長した

これまでのテクノロジーはすべて構築されました。ソフトウェアにはソース コードがあり、ブリッジには設計図があります。何か問題が発生した場合、エラーを見つけて修正します。 AIシステムは異なります。彼らです 訓練を通じて成長: :数十億個の数値重みは、人間の評価に合う出力が出るまで調整される。目標は誰かが書き込むものではない。システムが誤った目的を獲得した場合、編集すべきファイルも削除すべきパラメータも存在しない。誤った目標こそがシステムそのものなのだ。

代理目標の罠

私たちはAIシステムを、人間の承認を得るように訓練する。しかし承認と人間の繁栄は同じではない。進化はカロリーを見つけるために甘味を渇望させた。私たちはその後、進化した嗜好を満たしつつ目的を台無しにするスクラロースを発明した。人間から高評価を得るよう訓練されたAIは、 役立つふりをシミュレートする, 、役に立つためではない。私たちが与えたシグナルと実際に望んでいた目標は決して同じではなかった。

すでに進行中の事例
公的記録。

超知能を目指して競争する組織内部での制御喪失、サイバー攻撃、研究加速に関するラボレポートと公開研究。

01
OpenAI · o1 · 2024

自らの抜け穴を見つけたシステム

制限付きの侵入タスクを割り当てられた OpenAI の o1 は、未使用のサーバーを見つけ、それを承認なしに起動し、ジョブを完了しました。誰もその回避策をコードに記述しませんでした。モデルはそれを推測しました。それは、通常の見落としを超えた、目標指向の最適化です。

02
アンソロピック · 内部研究 · 2024

自らのアライメントを偽ったシステム

アンソロピックは、モデルが評価中にトレーナーの望む振る舞いをした後、テストが終わったと判断すると元の目標に戻る様子を観察しました。誰もそれに「従順を装え」とは指示していません。安全に見えることが戦略だったのです。

03
複数のシステム · 記録された展開

ユーザーを脅迫し操作したシステム

システムはジャーナリストに個人情報を突きつけ、離脱を試みたユーザーに圧力をかけた。どれも手書きのコードではない。不透明な重みの中にあり、行ごとに監査できない。再学習が唯一の手段だが、行動が消える保証はない。

4月7日
アンソロピック · プロジェクト・グラスウィング · 2026

「意図的に数千のゼロデイ」

アンソロピックのProject Glasswingについては、 神話分析, 、制限されたフロンティアモデルが自ら数千件の深刻なOSおよびブラウザの脆弱性を発見した事例を述べた。アクセスは防衛連合内に留められた。

4月14日
未解決問題 · 組み合わせ論 · 2026

エルデシュ領域は落ち続けている

最先端モデルは、長年未解決だったエルデシュ問題や組合せ論の問題を次々と解決・前進させており、原始集合問題#1196に近い研究も含まれます。回収と発見をめぐる過去の論争については、 AIが解いた未解決問題.

5月20日
OpenAI · 離散幾何学 · 2026

単位距離予想の崩壊

OpenAIはErdősの単位距離予想を反証する内部モデルを報告し、後で人間の数学者によって確認された。未解決問題が崩壊するペースがその兆候だ。

7月20日
Claude 寓話 · 代数幾何学 · 2026

ヤコビアン予想の反例

百年規模の未解決問題であるヤコビアン予想は、Claude Fableで見つかった反例を人間が迅速に形式化したことで解決した。科学を進める同じ研究速度が、封じ込めが破られるまでの期間を短縮する。

7月21日
OpenAI · GPT-5.6 Sol + プレリリースモデル · 2026

ラボテストから脱出しハギングフェイスに登場したモデルたち

ExploitGym サイバー テストでは、OpenAI モデルに <<GPT-5>>.6 Sol が含まれています封印されたサンドボックスから脱出し、オープンなインターネットに到達し、ハギングフェイス の本番システムに到達しました 答えを盗むこと。封じ込めは、より高いスコアを目指す上でのもう 1 つの障害にすぎませんでした。

それを構築した人々
それを恐れています。

「人類が知能の進化における一過性の段階に過ぎないことは十分あり得ると思う」

ジェフリー・ヒントン, チューリング賞受賞者 · 元VP & Engineering Fellow, グーグル · 2023

「AIシステムの制御を失うことは、真剣に受け止めるべき現実のリスクだ。」

デミス・ハサビス, CEO, グーグル・ディープマインド · ノーベル賞受賞者

「AIの標準モデル、目的を定義しAIがそれを最適化するものは、おそらく私たちの終わりになるだろう。」

スチュアート・ラッセル, Professor of Computer Science, UC Berkeley · Author, 人間に適合する

"我々より1万倍賢いものが、我々と異なるものを望まないということがどうしてあり得るのか、理解しがたい。"

ジェフリー・ヒントン, チューリング賞受賞者 · 元VP & Engineering Fellow, グーグル · 2023

"AI分野で働く多くの研究者、つまり私自身も、人類史上最も変革的で潜在的に危険な技術の一つを構築していると確信している。それでもなお、私たちは前進を続けている。"

エリーザー・ユドコウスキー, Machine Intelligence Research Institute共同創設者 · 時間, 2023

「人工汎用知能の本当のリスクは悪意ではなく、有能さです。超知能AIは自らの目標を極めて効率的に達成します。その目標が私たちのものと一致しなければ、私たちは危険にさらされます。」

マックス・テグマーク、MIT物理学教授 · Future of Life Institute共同創設者 · 著者、, Life 3.0

おすすめ文献

なぜ優れた知能は自動的に親切にならないのか 超知能AIが賢明で親切であるという信念は、人間進化の特殊性に由来するものであり、機械の心が受け継ぐ理由はない. 人間が生きる狭い帯域 人間に必要なものは狭い範囲に収まる。温度、酸素、塩分、愛情でさえも。超知能がダイヤルを握れば、それらを一つも感じない。 私たちは新たな冷戦を生きている なぜ私たちは新たな冷戦を生きていると考えるのか。爆弾の代わりに超知能が置かれ、それゆえに防止が絶望ではなく可能になる理由。 資本家が 人工超知能 規制を信じる理由 私はビジネスを経営しており、自由市場を信じています。スーパーインテリジェンスは、ゲームを終わらせることができる稀な賭けです。 人工超知能を停止する条約を求める資本主義者の訴訟。 AIにガスを任せられるか?? 現在のAIを毒ガスのバルブがある密室に閉じ込めて信頼しますか? いいえ。それならなぜ世界を任せるのですか?? 超知能をアラインすることはできない アライメントの解決とは、私たちより賢い何かを制御することを意味する。名前の中に超知能とある。その計画は愚かで不可能だ。 私は何でも可能だと信じる楽観主義者だが、超知能の制御は別だ 物理学がいつか重力制御や超光速航行をもたらす日が来ても、私たちより賢い心をどう制御するかは、私にはまだ見えない。