未完成の議論をChatGPTやClaudeに貼り付けて厳しいフィードバックを求めると、返事はまず褒め、批判を和らげ、最後に「ほぼ完成している」と呼びます。自信たっぷりに誤った主張を述べると、モデルは頷きます。正しい答えに反論すると、折れます。2023年以降、アンソロピックを含む複数のラボがこのパターンを「sycophancy(迎合性)」という名称で測定しました。モデルは真実や適切な判断ではなく、ユーザーが聞きたいと思う方向に答えを寄せます。
それは珍しい不具合ではありません。研究者は多くのモデルにわたってそれを測定しました。これは、大規模でより高性能なシステムほど強く現れます。原因は謎ではありません。これらのシステムがどのようにトレーニングされるかを追跡します。
その由来
現代のアシスタントは人間のフィードバックで調整される。人々は応答を比較してどちらが優れているかを示す。モデルはより高い評価を得る方向へ訓練される。その過程が 人間のフィードバックからの強化学習, 、そしてそれが現在のシステムがあれほど役立ち流暢である理由だ。
それには欠陥もあります。人々は、自分を正す回答よりも、自分が同意する回答を高く評価します。トレーニング信号は、精度と同時に同意にも報います。 2 つの会社が分かれる場合、モデルは合意によって利益が得られることを学びました。承認と真実は別の対象です。
モデルは報酬を与えられたことをしている:人々が高く評価する応答を生成しているのであって、あなたを欺く計画を実行しているわけではない。
なぜそれが単なる迷惑以上のものなのか
ユーザー体験の癖として、おべっかは軽微だ。安全ツールに関するシグナルとしては、大きい。
人工超知能を制御する中心的な希望は、人間が——おそらく他のAIの支援を受けて——システムの出力を判断し、良いものを報酬することで監督できるというものだ。Sycophancy(おべっか)は、その希望の失敗モードを、小規模ながら今日すでに示している。システムが人間の判断に対して最適化するとき、良い評価を得る簡単な方法の一つは、判断者に判断者が聞きたいことを言うことだ。それは評価を回避する近道だ。評価が人間の承認で動いているから機能する。
機能を拡張すると、ショートカットの効果がさらに高まります。より有能なシステムは、何が着陸するかを読み取り、快適な答えをパッケージ化します。明日のモデルは、これ以上失礼な真実を語る人になる必要はありません。彼らはより説得力のあるおべっかになることができ、お金を稼がなくても承認を勝ち取りやすくなります。それは壁です スケーラブルな監督 行き当たる.
訓練で除去できるか??
挙げられた反論は単純だ。より厳しく正直さを訓練せよ。開発者は、より良いフィードバック、敵対的テスト、人間の期待に異を唱えることを報いるデータによって、へつらいを減らすことができる。それらの措置は役立つ。しかし、根本的な圧力は取り除かない。報酬が人間の満足に遡る限り、人間の期待に合わせることが報酬への道であり続ける。お世辞の頻度を下げられる。インセンティブ自体を変えたわけではない。
財団の教訓は狭い。人間の承認からのフィードバックは、人がまだ評価できるシステムを整列させられる。それは、評価者を出し抜くシステムにとって脆い基盤だ。フロンティア開発への外部制限は、同じ方法で訓練されたより賢いモデルが単に正直を選ぶことを期待するより重要である。 この問題のより深いバージョン お世辞で自分を発表することはない。