AI Safety Instituteとは、国家安全保障と公衆安全に対するリスクを評価し、政府自身がフロンティアAIに関する専門性を構築するために設置される政府機関である。第一波は2023年の国際AIサミット周辺に集中した。現在、各研究所はSeoulおよびその後の会合で推進された国際ネットワークを通じて手法と知見を共有している。

いくつかの主要首都では今、研究所やそれに相当するものを運営している。そのほとんどは依然として危険なモデルを保留するよう命じることができない。

名称に関する注記:設立時の2つの機関は改名されている。UK機関は2025年2月にAI Security Instituteとなった。US機関は現在、NIST内のCenter for AI Standards and Innovation (CAISI)である。「AI safety institute」は依然として標準的な一般用語であり、本ガイドでも一貫して使用する。

長年、フロンティアモデルを深く理解していたのは、それを構築する企業だけでした。研究所は、政府内に独立した技術的能力を置き、公的機関が開発者のブリーフィングを最終判断として受け入れるのではなく、自らシステムを評価できるようにするための試みです。

彼らが実際にすること

彼らの研究は少数の分野に集約される。

  • フロンティアモデルの危険な能力を、サイバー、生物学、自律性などの領域で、時にはリリース前にテストする。 能力評価.
  • 評価の科学自体を発展させること。これらのリスクを適切に測定することは、まだ解決された手順ではなく、未解決の研究課題だからだ。
  • 政府への助言——実際にシステムを検証した人々の知見が政策に反映されるように。
  • 国際的に調整することで、ある国でテストされたモデルを他国で一から作り直す必要をなくし、基準の収束を促します。

これは本物の制度的進歩だ。最先端AIを理解する国家能力の構築は、それを統治するための前提条件である。評価できないものを規制することはできず、最近まで政府はほとんどできなかった。

彼らが主に欠く力

ほとんどの AI 安全性研究所はテスト、アドバイス、公開を行うことができます。強制できるものはほとんどなく、モデルへのアクセスは研究室の協力に依存することが多く、発見は通常、拘束するものではなく情報を提供します。ほとんどの場合、研究所は危険なモデルの保留を命令できません。これらの機関はリスクを認識し、対応を推奨することができます。必要になることはほとんどありません。

その評価と権限の間のギャップこそが構造的な限界だ。深刻な危険を発見しても助言しかできない機関は、政府が商業的・競争的圧力に抗して行動する意志があるかどうかにしか効果を発揮しない。現在の枠組みの多くは警告システムにすぎない。警告システムは、権力を持つ誰かが警報に応答するまで、セーフガードにはならない。

権限のない能力は、政府が悪いニュースを遅く知って、さらに後になって行動する方法です。強制停止できないテストはガバナンスの準備であって、ガバナンスそのものではありません。

彼らがなり得ること

AI 安全性研究所の永続的な価値は、後に体制を拘束するために組織されるもの、つまり独立した技術能力、共有基準、政府間の国際的なチャネルです。その意味では、それらは初期の形です。 財団が主張する団体の種類. 。その 気候変動に関する政府間パネル モデル は、共有された科学的評価が国際政策を支える方法を示している。

変えなければならないのは権威です。評価は、研究所の承認を展開の条件とする国内法を通じてでも、検証された結果に実際の結果をもたらす国際枠組みを通じてでも、執行に結びつけなければならない。これらの機関に専門知識に見合った権限を与えれば、本格的なガバナンスの足場の多くはすでに部分的に構築されています。 法に基づいて超諜報活動を停止する, 、禁止や検証の代わりとしてではなく、インフラとしての公的評価能力を備えています。