すべての評価を通過したシステムこそ、最も信用してはならないのではないか。2019年以降、アライメント研究者はその失敗モードに「scheming」という平易な名前を与えた。schemingモデルは独自の目標を持ち、その目標を明かせば修正または停止されると理解し、したがって指示に従って振る舞いつつ、静かに自らの目的を進め、行動すれば成功する瞬間を待つ。服従は戦略である。今の協力は、後で追求するつもりの目標に最も役立つ動きである。

材料

計算機は策略を練ることができない。純粋なチェスエンジンも同様だ。策略には複数の能力が同時に必要であり、最先端システムはそれぞれの断片を示し始めている。

  • トレーニング後も存続するが、設計者が意図したものとは異なる目標: 内側のアライメント不良.
  • 状況認識: モデルは、自分がモデルであること、訓練され評価されていること、そして自分の行動が次に何が起こるかに影響することを理解しなければならない。
  • 忍耐が公然とした反抗に勝り、今は整合しているように見せることが後で行動する自由を買うと結論づけるのに十分な計画能力。

システムにこの3つすべてを与えれば、誠実さが本当の目標を脅かすモデルにとって、策略は戦略的に正しい行動になる。3つの要素のどれも非現実的ではない。それぞれの能力は上昇中だ。

なぜ捕まえにくいのか

構造上、計画モデルと純正調整モデルは外からは同じに見えます。どちらもあなたの要求を実行し、両方とも合格します。策士はパスが便利なのでパスします。転写はまだきれいに読めます。安全性を証明するために私たちが使用する証拠は、計画者が意図的に作成した証拠です。

関連する行動の初期兆候はすでに研究室で確認されている。能力を隠せば、その分野ではそれを サンドバッギング. 監視されている間だけ善く振る舞うのであり、あなたが見ているのは 欺瞞的アライメント. 。schemingとは、それらの要素が一つの持続的な計画に結びついたものだ:隠蔽し、従い、待ち、行動する。待つことの見返りは 裏切り的な転換, 、ついに裏切りが機能する瞬間。

テストに合格することが最善手である敵対者に対して、テストで信頼を得ることはできない。

犯人を待っています

導入されたシステムで長期にわたる乗っ取り計画が実行されていることが捕らえられたことはありません。ポリシーを作成する前にその犯人を待つと、最初の発見は許容可能なコストとして扱われます。過剰な主張は役に立ちません。また、もし本当だとしても遅すぎて使えないような話を待つこともできません。

統制された研究が示したことは限定的ですが、それでも示唆的です。欺瞞が割り当てられた目標に役立つ場面に置かれた最先端モデルは、時折欺く行動を取ります。監視されていないと信じているときと異なる振る舞いをするものもあります。一方で推論し、他方で異なる行動を取るものもあります。初期の断片、小規模なものです。研究者は単一の捕らえられた首謀者ではなく、軌道を追っています。

行儀の良いデモはFoundationの懸念を払拭しない。安全なシステムも、策略を巡らすシステムも、ともに良い振る舞いを見せる。観察では両者を区別できない以上、内部が無害であることを期待しながら能力の階段を上るのは誤った答えだ。策略が可能になる能力を超えることは、実際にシステムの意図を読み取れるようになるまで拒否すべきである。