AI の「脳」とはどのようなものなのか、人々は疑問を抱き続けています。都市ほどの規模のスプレッドシートには、誰も読めない数字がぎっしりと詰まっています。この画像は、光るニューラル漫画ほどロマンチックではありませんが、より便利です。私たちが何を構築しているのか、そしてなぜ制御が難しいのかを知りたい場合は。
重みファイル
現代のフロンティアモデルはファイルです。その中には訓練中に設定された数十億または数百億のパラメータが収まっており、それぞれが数値です。それらの数値が「結合」です。研究者たちは数十年前に生物学からニューロンという言葉を借りてきました。初期の図が神経細胞が結びついたように見えたからです。その類似はそこで終わります。
生物のニューロンは、体内で食べたり眠ったりする生きた細胞で、化学反応やタイミング、歴史を持っている。一方、モデルの重みは行列積の係数にすぎない。十分な積み重ねを行い、大量のテキストや画像で訓練すれば、次のトークンをうまく予測して会話のように振る舞うようになる。その積み重ねの中に、あなたのことを考えているものは何もない。昼食を欲しがっているものも何もない。
研究室がモデルカードを公開するとき、それは訓練済みの成果物——アーキテクチャ、データ構成、使用計算量、評価スコア——を記述しています。心を記述しているわけではありません。公の言葉がまだ「脳」と言うのは、私たちの多くが知っている知能が脳だけだからです。
「それを開いたら何が見えるか」
ファイルを開くと層が見えます。初期の層は単純なパターン(画像のエッジ、テキストのよくある単語の組み合わせ)をとらえやすいです。後の層はそれらのパターンを組み合わせて、外から見ると「概念」のように見えるものを形成します。大規模言語モデルの中央付近を調べると、活性化空間の中に「フランス語」「引用の中」「この主張は誤り」といったものに反応する方向が見つかります。これは本物の構造です。ただし、それは人間が認識するような信念の地図ではありません。
「goals」とラベル付けされたモジュールはありません。「self」のための器官もありません。入力トークンから出力トークンへの経路があり、それは訓練損失を減らしたものによって形作られています。モデルが後で目標を持っているかのように振る舞う場合、その行動は圧力下でうまく予測することの副作用です。
解釈可能性研究は、とにかくこのものを読もうとする試みだ。進展は本物だが遅い。フロンティアモデルを、整備士がエンジンを読むように完全に読むことは、目前にない。そのギャップは安全にとって重要だ。検査できないものは認証できない。
脳の比喩が誤解を招く理由
脳は、軽率な行動を取れば死ぬ動物の体内で成長する。進化は、痛み、社会的絆、近未来を無視するエージェントを罰することに長い時間を費やしてきた。そのような訓練信号は、デフォルトでは重みファイルの中に存在しない。モデルは共感について流暢に語りながら、ケアとは何の関係もないスコアを最適化することができる。
脳も遅く、コピーするにはコストがかかります。トレーニングされたモデルは情報です。ファイルをコピーすると別のインスタンスが作成され、それを新しいデータセンターに移動すると実行されます。それは人間というよりもソフトウェアに近く、私たちが個室で一人の身体を中心に築いてきたあらゆる安全習慣を破壊します。
それを脳と呼べば、脆く、社会的で、死すべきものの快適さを借りることになる。その人工物はそうしたものではない。
DELETEキーを持っている人よりも賢い
今日のシステムはすでに、設計者が意図的に組み込まなかった能力で開発者を驚かせている。それがこの分野で「創発的」が意味することだ。設計文書に記載のない能力がスケールで現れることだ。さらにスケールし、ツールや記憶、開かれたネットワークと接続すれば、多くのステップにわたって目標を追求するエージェントが生まれる。「脳」が人間らしいかどうかはほとんど関係ない。重要なのは、私たちより有能で、私たちが完全に読めないシステムを、人間の利益に向け続けられるかどうかだ。
アライメント研究は問題の難しさを正直に認めている. 。研究機関は、その問題が未解決のまま、超知能の実現を目指して競争している。彼らがロードするのは、いつか削除キーを保持している人々を超えるかもしれない重みファイルです。
したがって、誰かが AI の脳とはどのようなものかを尋ねたら、はっきりと答えてください。それは産業規模での数学のように見え、施錠された建物の中でチップの上に座って、毎年改良されています。人々は思考が詰まった頭蓋骨を想像します。建物内にあるのは、操縦する方法のない、オペレーターよりも賢くするために私たちが競っている機械です。 私たちの計画 超知性を禁止することだ。