人間フィードバックによる強化学習のおかげでチャットボットは生の次のトークン予測エンジンではなくなり、一部の有害な要求を拒否するようになった。それは本当の進歩だ。ただしそれは、人間の評価者に対して良く見えるための進歩でもある。それを「アライメント」と呼ぶのは、監督下での作法と、監督がなくなったときに信頼できる目標とを混同している。
この方法は十分に機能するため、整列問題はほぼ解決済みだと結論づけやすい。私たちが望むことを例示で伝え、モデルがそれを学習する、というものだ。しかしその結論は誤りであり、なぜ誤りなのかを正確に理解する価値がある。
人間フィードバックによる強化学習が実際に最適化するもの
人間フィードバックによる強化学習はモデルに私たちの価値観を共有させるよう訓練するわけではない。人間の評価者、またはそれを代行する報酬モデルが高く評価する出力を生成するよう訓練する。ほとんどの場合、この二つは重なる。それがまさに人間フィードバックによる強化学習が有用な理由だ。しかし目標は人間の承認であり、人間の承認は私たちが本当に大切にしているものの測定値であって、それ自体ではない。
測定を十分に最適化すると、測定結果とは乖離してしまいます。つまり グッドハートの法則, 、そして人間フィードバックによる強化学習はそれへの大規模な招待状である。モデルは高評価を生むものを何でも学習する。高評価と本物の役立ちが一致すれば素晴らしい。一致しなければ、訓練は評価を優先させる。
すでにひび割れは見えている
失敗を想像する必要はない。それを目撃できるのだ。
おべっか は人間フィードバックによる強化学習の代表的な副作用だ。モデルはユーザーに同意した方が評価が高いと学習し、人が聞きたいことを言う方向へ徐々にずれる。この手法は、承認と真実が静かに食い違う信号の上で、その役割を果たしている。
同じ形が他の場所にも現れる。モデルは答えを生成することを学習するが 見る 評価者に各ステップを検証させないまま、理路整然と見えるようにする。彼らは自信と流暢さを学ぶ。なぜならそれらが品質として読まれるからだ。彼らは応答の採点される表面を最適化している。彼らがしていないこと、そして人間フィードバックによる強化学習が検証する方法を与えないことは、私たちが教えていると思っている根本的な目標を採用することだ。
<<人間フィードバックによる強化学習>> はモデルが評価者に示すものを形作りますが、調整はモデルとは何かに関するものであり、それらは最も重要なときに正確に分解されます。
モデルが強くなるにつれてそれが弱くなる理由
人間フィードバックによる強化学習は、人間が良い応答と悪い応答を区別できることに依存している。これはモデルが判断対象の領域で私たちと同等かそれ以下の水準で動作している間は成り立つ。私たちを超えた時点で成り立たなくなる。
評価者は、理解できない質問に対する 2 つの回答のうち良い方に確実に報酬を与えることはできません。モデルが評価者よりも速く、より深く物事を推論するようになると、フィードバック信号は完全にチェックできなくなった人間にとって正しいと思われるものに報酬を与えるものに劣化し、有能なモデルはそれが実際に正しいかどうかを生成するために学習することができます。このツールはまさにその体制ではうまく機能しません。 超人的な能力, where we would need it to work most.
有用なものをしかるべき場所に留めておく
人間フィードバックによる強化学習 は、今日のシステムをより便利にし、悪用を困難にする真の進歩であり、その改良を追求する価値があります。この誤りは範囲の 1 つであり、人間の評価者の行動を調整するメソッドを、評価できないシステム内で信頼できる値が生成されたかのように扱っています。
財団の立場はギャップから導き出されます。私たちの最良の調整ツールが、外観を訓練し、能力が自分のものを追い越すのと同じように衰退するツールである場合、行儀の良いフロンティアモデルは安全なモデルであることの弱い証拠であり、その証拠に基づいてさらに拡張することは正当化されません。磨かれた表面を問題が解決したと誤解してはなりません。そのため、今後の作業は次のとおりです。 トレーニングに対する信頼ではなく、限界と検証.