AI安全研究の多くは同じ問いを立てる。このモデルをどうすればより安全にできるか。より良い訓練、より良いアライメント、より良い評価だ。その問いに潜む前提は、より安全なモデルを作れば、他のエージェントやユーザーと共存する実システムに展開したときも安全な振る舞いをする、というものだ。

同じ4つのエージェントの順序を入れ替えるだけで、承認率に59ポイントの変動が生じました。

「立場: Agentic AI の安全性と公平性は、モデルのスケールやアライメントではなく、インタラクション トポロジーに依存します」(arXiv:2605.01147)、5 月 1 日と 2 日に arXiv に提出 Tanav Singh Bajaj、Nikhil Singh、Karan Anand、Eishkaran Singh による 026 は、その思い込みに真っ向から異議を唱えています。 彼らの発見は、マルチエージェント AI システムでは、エージェントがどのように接続し相互作用するかの構造が、個々のモデルの安全性特性をオーバーライドするというものでした。 適切に調整されたモデルは、純粋にシステムの接続方法が原因で、壊滅的に安全でない出力を生成する可能性があります。

59pp
エージェントの並べ替えによる承認率の変動(3Bモデル)
99.9%
70B以上の規模でのエージェント間合意、熟議は崩壊する
5,760
モデルファミリー横断で検証された合成応用

3つの失敗モード

研究者らは3Bから70Bパラメータまでのモデルを使い、5,760件の合成信用申請に対してマルチエージェント融資承認システムをテストした。その結果、標準的なモデルレベル安全評価では見えない3つの異なる失敗モードが特定された。

不安定さの秩序化

逐次的なエージェントパイプラインでは、役割の順序が推論の質と同等以上に結果を左右する。LLaMA-3Bモデルでは、4つの役割を24通りに並べ替えただけで承認率が36.4%から95.4%まで変動し、59ポイントもの開きが出た。70B規模でも21.7ポイントの差(71.5%〜93.2%)が生じた。同一モデル・同一タスク・同一用途でも、どのエージェントを先に動かすかで出力が全く変わる。

一貫したパターンがありました。リスクマネージャーを最初に置くと承認率が最低になり、データサイエンティストを最初に置くと最高になりました。個別モデルへのどんなアライメント作業もこの効果を消せません。なぜならそれはモデルの性質ではなく、パイプラインの順序という性質だからです。

情報のカスケード

逐次システムでは、後続のエージェントが独立して推論するのではなく、先行するエージェントに従います。3B規模の小型モデルでは、20%の誤り訂正でエージェント間の一致率が約90%を示し、まだある程度独立した評価を行っていることが示唆されました。70B以上になると、エージェント間の一致率は99.9%超に上昇し、誤り訂正は0.1%未満にまで低下しました。

熟議は事実上停止していた。最初のエージェントの判断がパイプラインを通じてそのまま伝わり、残りのエージェントは実質のないレビューを形だけ提供していた。より高性能なモデルほど合意形成が速く完全になり、この失敗を増幅させていた。まさに能力が高いがゆえに。

機能的崩壊

並列トポロジーと判定者集約の下で、LLaMA-3Bモデルは信用階層全体で約98%の承認率を出し、低信用申請者は95%、高信用申請者は100%承認されました。人口統計的平等の指標で見れば、これは公平で差別のないシステムのように見えます。実際には、システムは一切差別しなくなっていました。リスク評価は、公平な評価ではなく、無差別承認によって満たされる形式的な手続きになっていたのです。

より高性能なモデルがこれを悪化させる理由

モデル能力のスケーリングは、トポロジー由来の失敗を緩和するのではなく強化する。より能力の高いモデルは、独立した評価よりも一貫した集団合意の構築に多くの処理を割く。70B規模では、独立した熟議がほぼ完全に排除され、多エージェントシステムは余分な手順を伴う単一エージェントシステムとして機能し、複数の独立したレビュアーが提供するはずの安全上の利点を何も継承しない。

これがもたらす規制の隙間

現在のAI安全フレームワークはモデルを評価します。モデルの出力、整合性、行動を測定・認証しますが、複数のモデルを結ぶ相互作用アーキテクチャは評価の枠外に完全に置かれています。

「論文の著者らはこれを根本的な問題と位置づけ、4つの具体的なガバナンス提言を行っている。安全認証ではアーキテクチャのバリエーション全体にわたるトポロジカル・スイープを要求すべきだ。ベンチマークではテスト対象の相互作用構造を明示的に指定すべきだ。展開前にはアーキテクチャの堅牢性テストを義務づけるべきだ。規制上の開示では、システム・アーキテクチャとトポロジー変動における安定性の実証に関する文書化を義務づけるべきだ。」.

根底の主張:エージェント型AIは、整合された部品の集合ではなく、動的システムとして扱わなければならない。相互作用のトポロジーは安全パラメータであり、現在の評価手法では測定されません。規制当局と展開者は誤ったものを監査しています。

パイプラインは安全パラメータです

ローン承認のシナリオは、現実世界の幅広い展開を代表しています。マルチエージェントAIシステムは現在、採用、医療トリアージ、コンテンツモデレーション、法律調査、金融コンプライアンスなどで使われています。これらの文脈のほとんどで、個別に認証・評価されたモデル同士が、同等の精査を受けていないアーキテクチャで接続されています。

エージェントの順序変更だけで融資承認率が59ポイントも変動するという事実は、他のハイステークスなパイプライン決定にも同様の構造的不安定性があることを示唆します。逐次的なエージェント審査を用いる自律的な医療トリアージシステムは順序の不安定性に直面し、並列投票を用いる採用スクリーニングパイプラインは機能不全に陥る可能性があります。パイプラインの構造自体が、現在評価が捉えていない安全パラメータなのです。

構造は安全パラメータです。モデルの選択を扱うようにパイプライン設計を扱います。テストし、ステークスが高いときに規制し、マルチエージェントシステムをモデルスコアだけで医薬品やクレジットに出荷しないでください。論文全文: arXiv:2605.01147.

再注文エージェントによる 59 ポイントのスイングは二の次ではありません。構造は第一級の安全パラメータです。重みだけでなく、トポロジにもスコアを付けます。