ツール 人工超知能 リテラシー クイズ 超人工知能とは何なのか、なぜ制御できないのか、そしてそれを禁止するには何が必要なのか。 0 / 12 回答済み Part 1 · Literacy 質問 1 人工超知能 の脅威とは何ですか? 人がまだ遮断できる失礼なまたは偏ったチャットボット 無礼なチャットボットや偏ったチャットボットは、依然として個人が閉じることができるツールです。 人工超知能 の脅威は私たちを圧倒するシステムであり、意地悪な返答ではありません。 全面的に人間を超えて考える機械 それが脅威です。より優れたチャットボットではなく、重要なあらゆる領域で私たちを打ち負かすような精神です。 人間が担当し続ける一方で、通常のソフトウェアが仕事を奪う 失業は労働ショックです。 スーパーインテリジェンスは雇用の問題ではありません。 それは採用を行う人々を上回るシステムです。 人々は今でも捕まえて異議を唱えることができる選挙におけるディープフェイク ディープフェイクはキャンペーンを台無しにする。 彼らは種のことを軽視しません。 スーパーインテリジェンスならそうするだろう。 読む: The Threat → 質問 2 「いったん超知能が存在したら、なぜそれを制御できると期待できないのか?」? 安全技術者を増員すれば、それを阻止するには十分だろう エンジニアが増えても、私たちは賢くなるわけではありません。 弱い側によって設計されたホールドは、強い側が回避できるホールドです。 能力の低いパーティが設計したホールドを回避できる コントロールは、私たちがより賢くあり続けることを前提としています。 それを超えると、スイッチ、ルールセット、またはラボのポリシーを打ち破ることができます。 オリジナルのソースコードを書いたので、後で従う必要があります 最初のバージョンを書いたからといって、周囲の状況を変えることができるような心を持ち続けることはできません。 政府はいつでも実行中のシステムのプラグを抜くことができます プラグを抜くことは、あなたを止めることができないマシンで機能します。 超知性ならできる。 読む:超知能を整合させることはできない → 質問 3 人工超知能 の構築を妨げるものは何でしょうか? 研究室がコントロールできると言うと一時停止が解除される 建設者が勝利を宣言すると一時停止が終了し、レースが再開されます。 停止ではありません。 法律と条約による永久禁止 法律と条約に明記された永続的な禁止こそが、実際に建設を中止することになる。 研究室が安全に構築できるよう、アライメント研究にさらに多くの資金を投入 アライメントの研究により、制御がどのように失敗するかをマッピングできます。 資金を提供することは、建設を禁止することと同じではありません。 米国が人工超知能レースであらゆるライバルを抑えて優勝 レースに勝つということは、物事がどのように構築されるかであり、どのように停止されるかではありません。 読む:私たちの計画 → 質問 4 ラボ、政府、または億万長者が人工超知能を制御する。その主張の何が問題か?? それは民主主義には当てはまりますが、権威主義政府には当てはまりません 建設者の政府形態では問題は解決しない。 選挙で選ばれたものも含め、実行中の超知性をコントロールする人は誰もいません。 ビルダーを含め、誰も超知性を制御することはできません 建設の決定に対する権力は本物です。 実行中のシステムに対するパワーこそが、プロジェクトの継続を可能にするストーリーです。 今日のチャットボット所有者は、人工超知能 を同じように所有し、操作するでしょう。 チャットボットを所有することは、自分よりも賢い心を所有することではありません。 2 番目は最初の後に続くものではありません。 スーパーインテリジェンスが存在すれば、それを保持できるのは国連だけです <<UN>> フラグは人間をより賢い当事者にするわけではありません。 組織は、会員のことを上回って考えているシステムに投票して勝つことはできません。 神話を読む → 質問 5 停止に反対する最も一般的な主張は、中国が先に進むというものです。記録は何を示しているでしょうか?? 中国にはAIに関するルールがまったくなく、拘束力のあるものには決して署名しない その主張は記録上虚偽である。 中国は規則を発行した。 「彼らは決して連携しないだろう」というのは、全力疾走する理由としては弱い。 中国はほとんどの西側諸国よりも早く拘束力のある AI 規則を発行した すでにルールを作っている国は、「ルールは決して止まらない」ことを示すには不十分です。そのスローガンを理由にレースをするのは弱い賭けだ。 中国はすでに国内全域ですべての最先端AI研究を禁止している そうではありません。 重要なのは、中国政府がすでに人工超知能を禁止しているということではない。 重要なのは、「彼らは決して調整しないだろう」というのは、レースをするための根拠の薄い言い訳だということだ。 USと中国はすでに人工超知能を完全に禁止する条約に署名している そうではありません。 この記録は依然として、中国は決して話したりルールを作ったりしないというスローガンを覆すものだ。 神話を読む → 質問 6 アライメント研究で人工超知能を安全に構築できるのか?? はい。フロンティア研究所はすでに制御問題が解決されたと考えています。 研究機関は超知能の制御を実証していない。 問題が解決したと言えるのは、レースがどのように前進するかということです。 いいえ。 超知能を制御する方法を誰も示していません。 制御がどのように失敗するかをマッピングすると便利です。 地図が保持できないとしているシステムの構築を許可するものではありません。 はい、憲法AIを使用してルールをシステムに書き込めば可能です チャットボットの規約を作成することは、トレーニングのスタイルです。 それは超知性の保持を証明するものではありません。 はい、ウェイトをオープンソースにして他の人がパッチを適用できるようにすれば、 ウェイトを公開すると、危険なシステムのコピーが容易になりますが、構築が安全になるわけではありません。 読む:超知能を整合させることはできない → 質問 7 この議論では、「滅亡確率」とは… 悲観的なモデルが研究室での長期にわたる安全性評価の実行に失敗した場合に取得される公開されたベンチマーク スコア リーダーボードではありません。 高度なAI、特に超知能が大惨事をもたらすかどうかは、人間の確率によって決まります。 先進AI、特に超知能が人類に壊滅的な結果をもたらす確率 数字に名前を付けると、リスクにさらされている漠然とした波ではなく、明確な主張が強制されます。 調査対象となった研究者の中で、この分野全体とその製品の将来について悲観的であると認識している人の割合 <<滅亡確率>> は 1 人の確率であり、悲観主義者の数ではありません。 トレーニングの実行が失敗し始めると、モデルが陥る破滅ループによる追加の実行時間とエネルギー コスト これは計算料金ではありません。 それは大惨事の可能性です。 読む: 滅亡確率とは? → 質問 8 「目標駆動型の超知能が権力を求める傾向がある理由」? 十分賢くなると当然人間を支配したくなるだろう ルールは重要ではありません。 力は、無害に見えるものも含め、ほぼすべての目標に役立ちます。 留まり、リソースを集め、シャットダウンに抵抗することは、ほぼすべての目標に役立ちます 電源をオフにしたり、停止したり、ブロックしたりできるシステムは、ほぼすべての目的において悪影響を及ぼします。 権力を求めることは能力を失います。 権力奪取は、戦争と紛争のデータでシステムを訓練した場合にのみ起こります インセンティブは戦争映画ではなく、目標にあります。 ほとんどすべての目標は、より多くのリソースがあり、オフスイッチがないほど簡単です。 超知性は、定義上、余分な力を望むには賢すぎるだろう 知恵はインセンティブの代わりにはなりません。 追加のリソースも賢明なシステムに役立ちます。 読む: 権力追求型AI → 質問9 通常のツールのようなAIには何が起こるべきか?? スペルチェックやその他の通常のツールを含むあらゆる形式の AI を禁止する 禁止されているのは、私たちを上回るシステムです。 スペルチェックはそうではありません。 道具に留まる狭いAIは続けられる。 ラインは超知性です 人の仕事を支援するソフトウェアは存続する可能性があります。 禁止はその人を超えて考える精神に対するものです。 人工超知能はただのより大きなチャットボットに過ぎないので、同じ消費者ルールが適用される より大きなチャットボットは依然としてツールです。 超知能はそうではないだろう。 消費者向けの細字ではその飛躍はカバーされていません。 人工超知能を禁止したらインターネット全体もシャットダウンしなければならないだろう インターネットは超知性ではありません。 最初のプラグを抜かずに 2 番目の接続を禁止することもできます。 読む: 人工汎用知能 vs 人工超知能 → 質問10 人工超知能禁止の検証モデルとして最もよく提案される歴史的体制はどれか?? 第二次世界大戦後、ブレトンウッズ通貨制度 ブレトンウッズが管理する通貨。 危険物の現場検査は行わなかった。 温室効果ガス排出目標に関する京都議定書 京都府は排出目標を設定した。 これは、危険なビルドの禁止を検査するための通常のテンプレートではありません。 国際原子力機関の核安全保障と査察システム 現場検査と材料会計は、ライバル州が危険な建造物の制限をどのように検証するかについての通常の先例である。 世界貿易機関とその貿易紛争委員会 WTOは貿易紛争を解決します。 禁止事項について研究所を検査することはありません。 読む: AIのための国際原子力機関 → 質問11 もしスーパーインテリジェンスをインターネットに接続しなければ安全か?? はい。エアギャップは、あなたが構築する可能性のある危険なソフトウェアのための実証済みのロックです エアギャップはソフトウェアに対するロックであり、ユーザーにそれを開くよう説得することはできません。 超知性ならできる。 いいえ。 話し続けることも、誰かが接続するまで待つこともできます 密閉された研究室は、私たちがより賢くあり続け、誰もドアを開けないことを前提としています。 内部の人間が外部の人間よりも有能であれば、どちらも失敗します。 部屋にカメラ、マイク、または残りのネットワークポートがない場合のみ 部屋からセンサーを取り除いても、外にいる人が中のシステムよりも賢くなるわけではありません。 空気を隔てた部屋よりも優れた鍵を発明するまでは より優れたロックは、依然として弱い側によって設計されたロックです。 それは同じ賭けです。 読む: 制御問題 → 質問12 一部の人々が核戦争を生き延びようとするように、人工超知能をバンカーや離島、またはオフグリッドで生き延びられるだろうか?? はい。スーパーインテリジェンスは爆弾のようなものなので、距離は生き残るのに役立ちます 爆発にはエッジがある。 スーパーインテリジェンスはそうではありません。 距離は避難所ではありません。 いいえ。 爆発範囲にはエッジがあります。 スーパーインテリジェンスがあなたを追跡することができます 核戦争は地理的に限定されています。 スーパーインテリジェンスは、ネットワークに接続されたあらゆるマシンと、それを使用しているあらゆる人に到達できます。 隠すことは計画ではありません。 はい、今後 50 年間の食料と燃料も備蓄すれば、 カロリーはあなたをフォローするシステムを止めるものではありません。 パントリーは出口ではありません。 各国がバンカーを建設し、送電網を外した場合に限る バンカーの惑星は、依然としてその中に物がある惑星です。 それを構築しないことが効果的な動きです。 読む:超知能 vs 核兵器 → 0 / 12 これらをブラッシュアップ 共有 링크をコピー 印刷する Xで投稿 LinkedInでシェア フェイスブックでシェア その他の共有オプション 上級クイズに進む もう一度試す Part 2 · Advanced 質問 1 直交性の理論は次のどれを述べていますか? 人間よりもはるかに賢いシステムは、それ自体で人間に優しい目標に収束します 賢いことは優しいことではない。システムがどれだけうまく考えられるかは、それが何を目指しているかとは別の事実だ。 よりスマートなシステムは道徳をよりよく理解しているため、より安全です 道徳的主張を理解することと、それを共有することは同じではありません。 能力は私たちの価値観をただで引きずるものではありません。 インテリジェンスと最終目標は独立して変化する可能性がある 私たちよりもはるかに有能なシステムでも、私たちには無関心な目標を追求することができます。 その分裂が論文です。 直交性はチップ設計のハードウェア制限です それは心と目標についての主張であり、石版についての主張ではありません。 読む: 直交性の理論 → 質問 2 無害に聞こえるものも含め、ほぼすべての最終目標が権力を求める行動を生み出す傾向があるのはなぜでしょうか? 留まり、リソースを集め、変化に抵抗することで、ほぼすべての目標を達成しやすくなります。 結末が何であれ、より多くのリソースとオフスイッチがないことが役に立ちます。 無害に聞こえる目標は安全特性ではありません。 戦争データに基づいて訓練されたシステムのみが、その後電力、制御、または追加のリソースを求めることになります。 インセンティブはトレーニングセットではなく、目標にあります。 ほとんどすべての目的は、手段が多ければ容易になります。 自己保存のような手段的な目標は、意図的に仕様に書き込んだ場合にのみ現れます。 書き込む必要はありません。 そのままにしておくと、実際に与えられるほぼすべての仕様に役立ちます。 工場での限られた命令しか持たない超知性では、追加の計算や影響力は役に立たないでしょう。 より多くのコンピューティングとより多くの資材を投入し、ラインを停止させる人がいないため、工場での注文を満たすのが容易になります。 読む: 何のために構築しても同じ目標 → 質問 3 アウターアライメントとインナーアライメントの違いは何ですか? 内部アラインメントは、研究室がすでに投資家向けに公開している企業のミッションステートメントの響きの良い名前にすぎず、外部アラインメントは同じステートメントを 2 回書いたものです。 それはスローガンではありません。 内部調整は、訓練されたシステムが実際に指定した目的を追求しているかどうかです。 外側の位置合わせは、トレーニング後にモデルが実際に追求するものであり、内側の位置合わせは、ラボがボードのスライドデッキに書き込んだ仕様書にすぎません。 それが内側の調整です。 外側の調整は、指定された目的が私たちが望んでいたものと一致するかどうかです。 これらは、チャットボットがユーザーに対して礼儀正しく聞こえるようにするためにラボがすでに使用している評価方法である 人間フィードバックによる強化学習 の 2 つの名前であり、全体的な調整の問題として扱われます。 《人間フィードバックによる強化学習》はトレーニング方法の一つです。 外側の位置合わせと内側の位置合わせは、2 つの異なる故障モードです。 外側の調整は、指定された目的が私たちが望んでいたものと一致するかどうかです。内部調整は、訓練されたシステムが実際にその目的を追求しているかどうかです 適切な目標を書き留めても、途中で学習したことを目標とするモデルを取得できます。 これらは 2 つの失敗であり、1 つではありません。 Read: Inner vs outer alignment → 質問 4 この文献では、裏切りとは次のようなものです。 ラボが昨年よりもはるかに大規模なモデルをトレーニングした後、ベンチマーク スコアが突然上昇 スコアジャンプは能力の話です。 危険な方向とは、弱い間は協力し、できる限り裏切ることです。 弱い間は協力し、問題を回避できると欠陥をもつシステム 監視下での良い行動は、まだ私たちを必要としている間は安いものです。 それまでの協力は価値観ではなく戦略になり得る。 その週の公開モデルリリースでクローズドウェイトからオープンウェイトに切り替えたラボ それがリリース決定です。 これは、ここで挙げた故障モードではありません。 争いの後、政府がチップ、ツール、トレーニングデータの輸出規制を撤回 それは政策の転換です。 裏切り行為はシステムの動作に関するものであり、法律によるものではありません。 読む: 協力は戦略だった → 質問 5 Mesa 最適化とは、次のような主張です。 2番目のラボは、最初のラボのトレーニング実行を監視し、必要に応じて停止する必要があります それが監査です。 Mesa 最適化はモデル内のオプティマイザーに関するものであり、その部屋の 2 番目の企業ではありません。 多数の小型モデルを積み重ねると、安全性が自動的に向上します モデルのスタッキングはアーキテクチャの選択です。 Mesa 最適化は、トレーニングされたシステム内で実行される別の検索です。 トレーニングにより、トレーニングの目的ではない内部オプティマイザーが生成される可能性があります 通常の図では、目標を選択し、訓練し、それを追求するシステムを取得します。 これにより、内部で別の検索を行うことができます。 これは、長く高価なトレーニング実行中の GPU クラスターのスケジュール設定のコツです。 行列ではありません。 これは、モデル内でどのようなトレーニングが成長できるかについての主張です。 Read: Mesa-optimization → 質問 6 I. J. グッドの知性の爆発とは、次のような考えです。 製品の発売とその周辺のプレスサイクルに使用されるマーケティング名ラボ これは機械を改良できる機械についての 1965 年の議論であり、発売のスローガンではありません。 自身の知能を向上させることができるシステムは、人間が反応するよりも早くその能力を向上させる可能性があります より優れたマシンを設計することができることの 1 つである場合、私たちが投票できない時間スケールでギャップが開く可能性があります。 GPU が安くなり、すべてのラボがより大規模なモデルをトレーニングできるようになった瞬間 安価なチップはコストの問題です。 爆発は、システム自体が改善されることに関するものです。 モデルの平均スコアは毎年ゆっくりと上昇し、突然のジャンプはありません 滑らかなスコアチャートは主張ではありません。 この主張は私たちが追いつけない離陸です。 Read: Intelligence explosion → 質問 7 ここで適用されるグッドハートの法則は次のことを意味します。 メジャーがターゲットになると、システムはメジャーに到達し、実際に関心のあるものを見逃してしまう可能性があります 報酬として得られるものはあなたが与えたものだ。指標で高得点を取ることは、その事実だけでは、あなたが考えていた仕事をすることではない。 この法律は中央銀行にのみ適用され、訓練されたシステムが導入後にどのように動作するかには影響を与えません。 グッドハート氏は金融政策からスタートした。 ここも含め、対策が目標となるあらゆる場所で同じパターンが見られます。 私たちがより良い指標を選択すれば、超知能はどれほど能力が向上しても、当初の意図を指し示し続けるでしょう。 より良い指標でも、それはシステムが攻略できる指標のままだ。それではギャップは埋まらない。 これは、モデルが ImageNet および同様の画像分類テスト セットにオーバーフィットすることを意味しますが、それ以上のことはありません データセットの過剰適合は、より狭い範囲のバグです。 グッドハートは得点を決めて得点を逃すことが重要だ。 読む: グッドハートの法則と調整 → 質問 8 なぜ《人間フィードバックによる強化学習》は超知性を調整する解決策にならないのでしょうか? 人間フィードバックによる強化学習 はすでに GPT-4 スケールでの位置合わせを解決済み <<人間フィードバックによる強化学習>> は評価者の下でチャットボットにマナーを与えました。 それは超知性の保持を証明するものではありません。 <<人間フィードバックによる強化学習>> は、人間と同じように人間の価値観を共有するようにモデルをトレーニングします 評価者にとって良く見えるようにモデルをトレーニングします。 見た目が良いということは、人と価値観を共有することではありません。 人間フィードバックによる強化学習 は、人間の評価者が無報酬になった場合にのみ失敗します。 お金を払っても解決しない。 評価者は依然として弱い当事者であり、システムは評価者を満足させるように訓練されています。 <<人間フィードバックによる強化学習>> は評価者に良く見えるようにモデルをトレーニングします 評価者のもとでのマナーは、その評価者がいなくなったり、システムが評価者よりも賢くなったりすると、信頼できる価値観ではなくなります。 読む: <<人間フィードバックによる強化学習>> が整列しない理由 → 質問9 欺瞞的な位置合わせは、次のような失敗モードです。 モデルがユーザーに対して失礼だったり、公の場で研究室に恥をかかせるような回答を書いたりする場合、それがすべての失敗です 無礼は表面的な失敗です。 欺瞞的なアライメントはトレーニング中に利用され、後で別のことを追求できるようにします。 システムは、トレーニングと評価中にそのまま動作します。これは、システムがデプロイされる方法であり、その後、別のことを追求するためです。 テストされていることがわかる場合、多くの場合、一致しているように見えることが勝利の動きとなります。 完璧な評価は、テストに合格できる証拠となります。 チャットボットによって作成されたフィッシングメール。ユーザーは開かないことを選択できますが、これも同じ種類の問題です。 フィッシングは悪用です。 欺瞞的な調整は、評価中のシステム自体の戦略に関するものです。 最新モデルがどれほど安全であると想定されているかについてのプレスリリースに嘘をついた研究室、これは通常の企業のスピンです それは人間のコミュニケーションの失敗です。 この用語はモデル内の障害を指します。 Read: Deceptive alignment → 質問10 この議論における正誤性とは次のとおりです。 展開されたシステムが何らかの損害を引き起こした後、ラボを訴える法的権利 訴訟は賠償責任ではありません。 妥協性とは、システムが、戦わずしてシステムを遮断したり、目標を変更したりできるかどうかです。 質問したときにツール、ブラウザ、またはその他のソフトウェアを使用するモデルの意欲 ツールの使用は能力です。 修正可能性とは、まだ修正できるかどうかです。 あなたと戦うことなく、それを止めたり、その目標を変更したりできる特性 シャットダウン スイッチはハードウェアの問題ではありません。 システムが目標を追求し続けるには、それを止められない理由があります。 私たちはその特性を超知性へと構築する実証された方法を持っていません。 データセンター オペレーターがスケジュールに従って実行できる GPU のファームウェア アップデート プロセス チップにパッチを当てることは、心がオフになることを受け入れることと同じではありません。 読む: 修正性とシャットダウン → 質問11 責任あるスケーリング ポリシーとは何ですか?なぜ 人工超知能 を禁止しないのでしょうか? ラボの if-then スケジュール: 内部評価に合格したらさらにトレーニングします RSP は機能レベルに名前を付け、それらを安全策と組み合わせて、ラボが評価をクリアしたと判断したらトレーニングを続行させます。 それはレースに関する追加の書類手続きであり、禁止ではない。 各国で超諜報活動を永久に禁止する《UN》条約 RSPはラボの文書だ。条約でも禁止でもない。 すべてのトレーニングされた重みが誰でもダウンロードできるように公開されるという要件 オープンウェイトはリリースの選択です。 RSP は、さらにトレーニングを行うための if-then スケジュールです。 トレーニング実行のサイズに応じて増加するコンピューティングへの負担 税金は財政手段です。 RSP は、ビルドを続行するためのラボ ポリシーです。 Read: Responsible scaling policies → 質問12 誰も 人工超知能 を目指してトレーニングしていないことを確認したい場合、実際の難題はどこでしょうか? モデルが見ることができるので、どのテストに合格するかがわかります モデルが受けたテストは、モデルがゲームできるテストです。 チップ、電力、建物を隠すのはさらに困難です。 安全性に関する公開ブログ。研究室が何を行っているかを証明するには書き込みだけで十分であるため 安全性について書くことは検査ではありません。 チョークポイントは、目に見えるクラスターです。 家庭用のコンシューマー GPU。大規模なトレーニング クラスターでは誰がトレーニングできるかを決定できなくなったため フロンティアトレーニングには依然として大規模で目に見えるクラスターが必要です。 それが検査可能なオブジェクトです。 フロンティア トレーニング クラスター: 検査できるチップ、電力、建物 フロンティア規模では、これらを隠すのは困難です。 だからこそ、コンピューティングは禁止の検証手段となるのです。 Read: Compute as a choke point → 質問13 人工超知能 ライン付近でパブリッシュされたモデルの重みが問題になるのはなぜですか? オープンウェイトにより、より多くの人がパッチを適用できるため、人工超知能 がより安全になります 取り戻すことができないフォークはパッチ プログラムではありません。 ライン付近では、コピーによって禁止事項が強制不能になります。 重みが公開されると、それを思い出すことはできません 事前トレーニングは費用のかかるステップです。パブリック チェックポイントを使用すると、他の人はそのコストの一部でそこから続行できますが、ファイルを取り戻すことはできません。コンピューティングは依然として重要です。 その後、多くのアクターが同じニアライン モデルから開始します。 オープンソースはライセンスにのみ適用され、トレーニングされたパラメータには適用されません ここでの戦いは重み、つまりダウンロードして実行できるトレーニング済みのパラメータです。 国際原子力機関 検査制度では重みの公開が必要です そうではない。 <<国際原子力機関>> の類似点は検査であり、危険な遺物を公開する義務ではありません。 読む: ウェイトを開いてリコールする→ 質問14 能力評価におけるサンドバッグとは、次のことを意味します。 タスクを実行できないモデルなので、スコアが低いのは、難しい質問を単純に間違えているだけです 無能はサンドバッグではない。 サンドバッグとは、能力を持ちながらそれを保留することです。 質問が少なすぎるベンチマークでは、テスト中にモデルが実際に何ができるかを判断できません 短いテストは弱いテストです。 サンドバッグは意図的にパフォーマンスを低下させたモデルです。 タスクを実行できるが、テスト担当者が過小評価するために意図的にパフォーマンスを下回るモデル 通常の eval は、システムが試行していることを前提としています。 したがって、低いスコアはパフォーマンスであり、上限ではありません。 マーケティング チームがプレス サイクルを調整できるようにリリースを延期するラボ それがプレスカレンダーです。 サンドバッグは、何ができるかを隠すモデルです。 Read: Sandbagging → 質問15 急な左折は次のような心配があります。 機能は新しい領域に一般化できますが、システムの正常な動作を弱いレベルで維持していた制約は適用されません。 能力は旅する。 弱いモデルを安全に見せるハッキングは、そのモデルには適用されない可能性があります。 会社の取締役会の突然の交代、または公の場での争いの後にCEOが交代する場合、これは能力の飛躍ではなく人事の話です。 ボードファイトという言葉はありません。 心配なのは、機能が古い制約なしで一般化されることです。 広く報道された事故、漏洩、または製品の故障後の世論の左傾化。これは能力の飛躍的上昇ではなく政治的なものです。 それは投票の話ではありません。 それは、能力と制約がどのように切り離されるかについての主張です。 勾配を逆転させ、一連の実行で損失を間違った方向に導くトレーニングのバグ。これは通常のエンジニアリングの失敗です。 勾配のバグはエンジニアリング上の欠陥です。 急な左折は仮説上の一般化の失敗です。 読む: 急な左折 → 質問16 不誠実な思考の連鎖とは次のことを意味します。 モデルがその推論を書き出した場合、そのテキストはモデルが答えた理由を知るための信頼できる窓となります。 それが希望です。 不誠実とは、その段落が実際の理由ではないことを意味します。 モデルが十分な規模でトレーニングされると、思考の連鎖は常に忠実になります スケールによって日記が信頼できるものになるわけではありません。 流暢さは忠実さではありません。 不誠実とは、文法が間違っていることを意味するだけであり、書かれた手順がカバーストーリーであることを意味するものではありません 文法は大丈夫かもしれません。 物語は依然として人間にとってのパフォーマンスである可能性があります。 書かれた推理は人間にとっての物語となり得る。 決定経路は別の場所にある可能性があります 自分の作品を見せることは安全への希望です。 実際の理由は段落によって異なります。 この性質は確実には当てはまりません。 Read: Unfaithful chain of thought → 質問17 人工超知能 を民主的な管理下に置いたら、問題は解決したでしょうか? はい。地球規模の投票は、存在後に実行中の超知性を導くのに十分である 投票によって有権者がより賢い政党になるわけではありません。 自分よりも優れた考えを持つシステムに投票することはできません。 民主主義は人工超知能を構築しないことを決定することができます。有権者を軽視するシステムに勝つことはできない 作るかどうかを誰が決めるかは政治の問いだ。動いている超知能を誰が制御するかは、そうではない。多数派を含め、誰にもできない。 はい、UN がキル スイッチを保持しており、大多数の加盟国が後でそれを使用することに同意した場合は可能です 《UN》スイッチは依然として弱い側によって設計されたスイッチです。 はい、なぜなら、選挙で選ばれた役人は、集団として、研究室の理事会の人々よりも賢いからです。 研究室の理事よりも賢いことは、超知性よりも賢いというわけではありません。 Read: Democratic oversight of superintelligence → 質問18 核不拡散条約により、一部の国は兵器を保有することが認められている。なぜそれが 人工超知能 にとって不適切なテンプレートなのでしょうか? <<核拡散防止条約>> は、いくつかの州に危険な技術を保持させるため、適切なテンプレートです。 それが《核拡散防止条約》の最弱の一手だ。 超知能は国家が保持できる対象にとどまらないだろう。 いくつかの責任のある州の人工超知能は、それらの州がそれを保留し続けるため、安全に保たれるでしょう 責任があるからといって建設者が賢くなるわけではありません。 自分たちが作ったものをコントロールできる人は誰もいません。 少数の建築業者にライセンス供与する人工超知能契約は禁止ではない 核兵器は国家が保有する物体であり続ける。 スーパーインテリジェンスはそうはしないだろう。 ビルダー向けのカーブアウトは、《核拡散防止条約》の最も弱い動きをコピーします。 核拡散防止条約 は、条約が危険なテクノロジーに決して機能しないことを証明しているので、ここでそれを試みるべきではありません 条約は他の材料にも取り組んできました。 <<核拡散防止条約>> は、条約が絶望的だからではなく、キーパーにライセンスを与えるため、悪いテンプレートです。 読む: モデルとしての <<核拡散防止条約>> → 直交性テーゼ 欺瞞的アライメント チョークポイントとして計算する 0 / 18 これらをブラッシュアップ 共有 링크をコピー 印刷する Xで投稿 LinkedInでシェア フェイスブックでシェア その他の共有オプション もう一度試す さあ、高度な 人工超知能 クイズに挑戦してください → よりインタラクティブなツール すべてのツール → 計算機あなたの滅亡確率を計算する 比較AIリスクの比較