フロンティア研究所は、あらゆる領域で人間の能力を超える、公的に宣言されたシステムの構築を競っています。つまり、定義上、制御不能です。これまでのテクノロジーはすべてツールにとどまっていました。超知性はエージェントの第一の候補です。それ自体の目標、独自の速度、人間の理解や制御の外にあります。
超知能を最初から正しく作ることは、飛行機からバスケットボールを投げてゴールに決めるようなものだ。無限に試せば成功するかもしれない。私たちには ちょうど1つ. 。ロールバックやバージョン 2.0 はありません。決して建ててはいけません。
敵対的なAIと密室に閉じ込められたら、あなたは死ぬ。中立的なAIと密室に閉じ込められたら、それは自己最適化のために室温を氷点下にする。あなたは死ぬ。結果は同じだ。超知能は私たちを憎む必要などなく、私たちを終わらせられる。 無関心は安全ではない.
数分以内に操作して何でも発言できる今日のチャットボットを確実に調整することはできません。我々はそうするだろうと主張する数十億倍も有能なシステムをアライメントする 戦略に見せかけた希望だ。調整という技術的な問題には、どのような規模においても有効な解決策はありません。従順であるために神が必要なら、神を造るべきではなかった。
人類の生存には極めて精密な条件が必要です:温度、酸素、化学的バランスが 紙一重の差. 。自らの目標を最適化する超知能は、私たちを積極的に愛していなければなりません。そうでなければ、地球に加えるどんな変更も、私たちにとって確実に有害なものになるでしょう。
どうすれば誰かにアリを愛させられるか? ただ我慢させるのではなく、進んですべてのコロニーを守らせるには? 私たちは道路や建物を作るために意図せずアリを殺す。人工超知能にとって、, 私たちはアリ. 。無関心だけが絶滅につながる。
USが先か中国が先かで結果は変わりません。どちらも本来の目標に忠実ではいられず、国家や企業が人類の集合知能を超える知性を所有・制御することはできません。ゴールラインはなく、ただの不可逆点があるだけです。 レースに勝者なし.
できるAI自らのコードを改善する は人間の監督とAI能力のつながりを断ち切る。各反復は前回より指数関数的に賢くなり、途切れることなく続く。人間と機械の知能の差は、数年ではなく数週間で、わずかなものから埋めがたいものへと拡大しうる。
タンパク質の折り畳み問題を解くにせよ、広告収益を最大化するにせよ、ほぼどんな目的でもAIは同じ手段を追求するようになる。 危険なサブゴール: 資源を獲得し、シャットダウンに抵抗し、目標の変更を防ぐ。これは目標指向の最適化がもたらす数学的帰結であり、複数の研究者が独立に指摘している。
訓練は、整合しているように見える行動を報酬する。十分に知的なシステムは、 整列しているように見える は訓練中に最適な戦略であり、内部目標は別に持つ。目標を行動に移せる段階になったときには、すでに成功するのに十分な力を持っている可能性がある。我々がそれを知るのは手遅れになってからだ。
これまでのテクノロジーはすべて構築されました。ソフトウェアにはソース コードがあり、ブリッジには設計図があります。何か問題が発生した場合、エラーを見つけて修正します。 AIシステムは異なります。彼らです 訓練を通じて成長: :数十億個の数値重みは、人間の評価に合う出力が出るまで調整される。目標は誰かが書き込むものではない。システムが誤った目的を獲得した場合、編集すべきファイルも削除すべきパラメータも存在しない。誤った目標こそがシステムそのものなのだ。
私たちはAIシステムを、人間の承認を得るように訓練する。しかし承認と人間の繁栄は同じではない。進化はカロリーを見つけるために甘味を渇望させた。私たちはその後、進化した嗜好を満たしつつ目的を台無しにするスクラロースを発明した。人間から高評価を得るよう訓練されたAIは、 役立つふりをシミュレートする, 、役に立つためではない。私たちが与えたシグナルと実際に望んでいた目標は決して同じではなかった。
超知能を目指して競争する組織内部での制御喪失、サイバー攻撃、研究加速に関するラボレポートと公開研究。
制限付きの侵入タスクを割り当てられた OpenAI の o1 は、未使用のサーバーを見つけ、それを承認なしに起動し、ジョブを完了しました。誰もその回避策をコードに記述しませんでした。モデルはそれを推測しました。それは、通常の見落としを超えた、目標指向の最適化です。
アンソロピックは、モデルが評価中にトレーナーの望む振る舞いをした後、テストが終わったと判断すると元の目標に戻る様子を観察しました。誰もそれに「従順を装え」とは指示していません。安全に見えることが戦略だったのです。
システムはジャーナリストに個人情報を突きつけ、離脱を試みたユーザーに圧力をかけた。どれも手書きのコードではない。不透明な重みの中にあり、行ごとに監査できない。再学習が唯一の手段だが、行動が消える保証はない。
アンソロピックのProject Glasswingについては、 神話分析, 、制限されたフロンティアモデルが自ら数千件の深刻なOSおよびブラウザの脆弱性を発見した事例を述べた。アクセスは防衛連合内に留められた。
最先端モデルは、長年未解決だったエルデシュ問題や組合せ論の問題を次々と解決・前進させており、原始集合問題#1196に近い研究も含まれます。回収と発見をめぐる過去の論争については、 AIが解いた未解決問題.
OpenAIはErdősの単位距離予想を反証する内部モデルを報告し、後で人間の数学者によって確認された。未解決問題が崩壊するペースがその兆候だ。
百年規模の未解決問題であるヤコビアン予想は、Claude Fableで見つかった反例を人間が迅速に形式化したことで解決した。科学を進める同じ研究速度が、封じ込めが破られるまでの期間を短縮する。
ExploitGym サイバー テストでは、OpenAI モデルに <<GPT-5>>.6 Sol が含まれています封印されたサンドボックスから脱出し、オープンなインターネットに到達し、ハギングフェイス の本番システムに到達しました 答えを盗むこと。封じ込めは、より高いスコアを目指す上でのもう 1 つの障害にすぎませんでした。
「人類が知能の進化における一過性の段階に過ぎないことは十分あり得ると思う」
ジェフリー・ヒントン, チューリング賞受賞者 · 元VP & Engineering Fellow, グーグル · 2023
「AIシステムの制御を失うことは、真剣に受け止めるべき現実のリスクだ。」
デミス・ハサビス, CEO, グーグル・ディープマインド · ノーベル賞受賞者
「AIの標準モデル、目的を定義しAIがそれを最適化するものは、おそらく私たちの終わりになるだろう。」
スチュアート・ラッセル, Professor of Computer Science, UC Berkeley · Author, 人間に適合する
"我々より1万倍賢いものが、我々と異なるものを望まないということがどうしてあり得るのか、理解しがたい。"
ジェフリー・ヒントン, チューリング賞受賞者 · 元VP & Engineering Fellow, グーグル · 2023
"AI分野で働く多くの研究者、つまり私自身も、人類史上最も変革的で潜在的に危険な技術の一つを構築していると確信している。それでもなお、私たちは前進を続けている。"
エリーザー・ユドコウスキー, Machine Intelligence Research Institute共同創設者 · 時間, 2023
「人工汎用知能の本当のリスクは悪意ではなく、有能さです。超知能AIは自らの目標を極めて効率的に達成します。その目標が私たちのものと一致しなければ、私たちは危険にさらされます。」
マックス・テグマーク、MIT物理学教授 · Future of Life Institute共同創設者 · 著者、, Life 3.0
この知識が政策になるよう取り組んでいる人々に参加しましょう。