シャープ・レフト・ターンは仮定された失敗モードであり、対比として最もよく述べられる。能力は汎化する。整合性はそうとは限らない。システムがより有能になると、特に汎用的で移転可能な能力に達した場合、その能力は新しい領域や状況に持ち込まれる。懸念されるのは、それを適切に振る舞わせる制約、すなわち低レベルで植え付けた整合性が、同じ信頼性で引き継がれないことだ。システムは力を新しい領域に持ち込み、安全性を国境に置き去りにする。その乖離が、能力の汎化とともに突然訪れるのがシャープ・レフト・ターンである。

能力とアライメントが乖離する可能性がある理由

二つが異なる仕方で一般化すると期待する理由があり、それは楽観と悲観の非対称ではありません。能力は世界の構造に anchored しています。物理法則、数学の規則、原因が結果につながる仕方は領域を超えて同じなので、推論をうまく学ぶシステムには安定した一般化の基盤があります。能力が移行するのは、現実が一貫しているからです。

アライメントは私たちに anchored されている。人間の価値観、人間の意図、そして私たちが与えた特定の訓練信号に結びついており、それらはより狭く、乱雑で、ここで議論したギャップに満ちている。 アライメント問題. 。新しい状況に一般化するシステムは、自らの能力を拡張する確かな基盤を持つ一方で、私たちが意図した制約を拡張する基盤ははるかに脆弱だ。なぜなら制約は、すでに見た状況に合わせて調整された近似にすぎないからだ。これが 目標の誤った一般化 を能力ジャンプの瞬間にまつわる構造的な主張にまで高めた。

世界は一貫しているため、能力は移転する。我々の価値観は部分的にしか指定されておらず、 leash は届かないかもしれない。

なぜタイミングが残酷な部分なのか

この障害は、システムが弱く修正可能であり、調整が保たれているように見える安全な初期段階では発生しないと予測されています。まさに、より優れた、より一般的な機能への移行期にあり、システムの修正が最も困難になる瞬間でもあります。利害関係と介入の難しさの両方が急上昇すると、アライメントはすぐに崩れます。

これが、sharp left turnが通常の誤一般化よりも深刻である理由だ。より小さなシステムから得られる「よく振る舞っている」という安心材料は、失敗が予想されるまさにその regime で収集されたため、移転可能性が最も低い証拠だと予測する。開発を通じて安全で協力的だったモデルは、それでもsharp left turnがまだ先にあることと整合する。良い実績は、感じられるような反証にはならない。

クリーンレコードはスケールするためのライセンスではありません

アライメントが能力のジャンプに自動的に耐えられない場合、2つのことが導かれる。アライメントは一般化するのに十分に堅牢でなければならない 前に 飛躍であり、後から修正できるものではない。また、システムの過去の善行は、それを次の段階へ進める十分な許可にはならない。次の段階こそが乖離が予測される地点だからだ。

どちらも財団の議論の残りの部分と同じように指摘しています。能力が整列を超えないようにし、あるレベルのクリーンレコードを次のレベルの許可として扱わないでください。急な左折は、AIの安全性におけるより悲観的な考えの1つであり、それは間違っているかもしれません、そしてそれが正しいことのコストはそれが私たちが主張する理由の正直な推測に属するほど深刻です 拘束.