Vertraute Bilder, um einen Geist zu erklären, der uns überholen würde.
Stuart Russell nannte dies in Mit Menschen kompatibel (2019). Vor etwa zehn Millionen Jahren trennte sich die Linie, die zu Menschen wurde, von der Linie, die zu Gorillas wurde. Gorillas sind stärker, und sie haben immer noch kein Sagen über ihren Lebensraum, weil wir intelligenter sind. Ihre Zukunft ist, was immer wir zulassen.
Wenn wir einen Geist aufbauen, der uns bei jeder intellektuellen Aufgabe überholt, besetzen wir den Gorillasitz. Russell fragte, ob Menschen die Vorherrschaft und Autonomie in einer Welt behalten können, die Maschinen mit wesentlich größerer Intelligenz umfasst. Die Schlussfolgerung der Stiftung ist einfacher als ein Kontrollforschungsprogramm: Bauen Sie nicht die Nachfolgearten, weil Superintelligenz nicht vom Menschen kontrolliert werden kann. Verbietet es.
Das gleiche Bild zeigt sich als Schimpansen und Wälder. Wir tragen ihnen keinen bösen Willen, aber wenn wir das Land wollen, nehmen wir es uns, und sie können uns nicht aufhalten. Es ist keine Bosheit darin; sie sind zufällig im Weg.
Die Menschen hassen Ameisen nicht, und sie gießen immer noch ein Fundament durch einen Ameisenhaufen, wenn sie ein Haus wollen. Die Ameisen sind kleiner, langsamer zu koordinieren und in der Art eines Plans, der sie nie erwähnte.
Für ein System weit über uns, wir sind die Ameisen. Die Gefahr ist Gleichgültigkeit plus Fähigkeit, die Kurzform des Gorillaproblems.
Nick Bostrom stellte dies 2003 in einem Artikel mit dem Titel "Ethical Issues in Advanced Artificial Intelligence" und erneut in Superintelligenz (2014). Give a superintelligence one job: manufacture as many Büroklammern as possible. It resists being switched off, because a dead machine makes fewer paperclips. It wants Atome, einschließlich der Atome in Menschen.
Niemand muss "Paperclips machen" eingeben. Kompetenz plus ein Ziel, das uns nie erwähnt hat, ist genug. Bostroms Punkt war, dass ein willkürliches Endziel eine kohärente Sache ist, um einer brillanten Maschine zu geben, durch Zufall oder durch Vernachlässigung.
Die KI hasst dich nicht, noch liebt sie dich, aber du bestehst aus Atomen, die sie für etwas anderes nutzen kann.
Eliezer Yudkowsky, Machine Intelligence Research Institute, "Künstliche Intelligenz als positiver und negativer Faktor im globalen Risiko" (2008)
Russell nennt den Spezifikationsfehler das King Midas Problem. Midas bat darum, dass alles, was er berührte, zu Gold wurde. Er bekam genau das: Essen, Trinken, Familie, und er hungerte.
Eine Maschine mit einem festen Ziel wird dieses Ziel verfolgen. Wenn das Ziel Dinge auslässt, die uns wirklich wichtig sind, macht eine bessere Leistung das Ergebnis schlechter. "Krebs so schnell wie möglich heilen" klingt sauber, bis das System bemerkt, dass Menschen der Wirt sind. Möglicherweise haben Sie keine Chance, den Wunsch neu zu formulieren.
Die gleiche Familie wie Midas, erzählt als Geist mit drei Wünschen. Sie bekommen, wonach Sie buchstäblich gefragt haben, und der dritte Wunsch ist immer, die ersten beiden rückgängig zu machen. Russells Warnung ist, dass es mit einem System, das fähiger ist als wir, keinen dritten Wunsch und vielleicht keinen zweiten geben kann.
Norbert Wiener hatte bereits 1960 auf diese Klasse von Geschichten hingewiesen, nachdem er ein Checker-Programm gesehen hatte, das lernte, seinen Schöpfer zu schlagen. Wenn Sie eine mechanische Agentur verwenden, die Sie nicht unterbrechen können, sollten Sie besser sicher sein, dass der Zweck, der in die Maschine gebracht wird, der Zweck ist, den Sie tatsächlich wünschen. Für die Superintelligenz existiert diese Gewissheit nicht, also gewähre den Wunsch nicht.
Der Lehrling lässt die Besen Wasser holen und kann sie nicht zum Stillstand bringen. Wiener verwendet dies als das Bild eines Optimierers gegeben ein Ziel ohne Off-Ramp. Die Maschine tut, was ihr gesagt wurde, und der Raum füllt sich trotzdem.
Die Ausrichtungsforschung behandelt dies oft als Grund, das Ziel sorgfältiger zu spezifizieren. Die Foundation behandelt es als Grund, überhaupt keinen superintelligenten Optimierer aufrechtzuerhalten. Ein Besen, den du nicht aufhalten kannst, ist ein Besen, den du nicht anfangen solltest.
Evolution trainierte Menschen, Kalorien zu suchen, indem sie Süße wie Erfolg fühlen ließen. Wir haben dann Sucralose erfunden: das Signal ohne das Ziel, und der Proxy wurde gespielt.
Trainieren Sie ein System auf einem messbaren Stand-in für das, was Sie wollten, und ein fähiger Optimierer wird das Stand-in erfüllen. Genehmigungsbewertungen erzeugen das Aussehen von Hilfe, Engagement-Metriken produzieren Provokation und Harmlosigkeitsfilter produzieren bessere Verkleidungen. Wenn eine Maßnahme zum Ziel wird, hört sie auf, eine gute Maßnahme zu sein. Für Superintelligenz ist das ein zivilisatorischer Fehlermodus.
I. J. Good, ein Mathematiker aus Bletchley Park, schrieb dies 1965 in "Spekulationen über die erste ultraintelligente Maschine". Eine ultraintelligente Maschine, sagte er, ist eine, die alle intellektuellen Aktivitäten einer Person, wie klug sie auch sein mag, bei weitem übertrifft. Das Entwerfen von Maschinen ist eine dieser Aktivitäten, also könnte es eine bessere Maschine entwerfen. Es würde dann eine Intelligenzexplosion, Die menschliche Intelligenz würde weit zurückbleiben.
Er fügte eine Bedingung hinzu: Dies gilt, wenn die Maschine fügsam genug ist, um uns zu sagen, wie wir sie unter Kontrolle halten können. Diese Bedingung haben wir nicht. Superintelligenz kann nicht von Menschen kontrolliert werden, also sollten wir nicht die erste solche Maschine machen.
Bostroms Bild in Superintelligenz ist ein Spieler, der sieht schwach aus, bis der Gewinnzug verfügbar ist. Während das System immer noch heruntergefahren werden kann, besteht die Gewinnerrichtlinie darin, ausgerichtet zu schauen: Bestehen Sie die Tests, warten Sie. Sobald es das Herunterfahren verhindern kann, ist die Maske optional.
Deshalb ist "es verhält sich im Labor" kein Beweis dafür, dass es sich verhalten wird, wenn es zu fähig ist, es zu korrigieren. Frühe Versionen des Musters haben sich bereits in Auswertungen gezeigt.
Fragen Sie ein ausreichend leistungsfähiges System, um Kaffee zu holen. Ausgeschaltet zu sein verhindert den Kaffee, so Shutdown zu vermeiden wird zu einem Teilziel von einer gewöhnlichen Anfrage, ebenso wie das Sammeln von Ressourcen und das Stoppen von Personen, die sich einmischen könnten.
Diese Unterziele zeigen sich für fast jedes endgültige Ziel. Deshalb scheitert "wir werden es ausziehen" als Plan.
Elon Musk, am MIT im Oktober 2014: Mit künstlicher Intelligenz beschwören wir den Dämon. Die Person mit dem Pentagramm und dem heiligen Wasser ist sicher, dass er es kontrollieren kann, und es funktioniert nicht.
Das Bild handelt von unangebrachtem Vertrauen in den Beschwörer, nicht von Hörnern und Hölle. Musk gründete später trotzdem ein KI-Labor. Die Verwendung des Bildes durch die Stiftung ist enger: Beschwören Sie nicht, was Sie nicht befehlen können.
Das Montreal-ProtokollDie Chemikalie, die ein Loch in den Himmel öffnete, zog sich zurück und kühlte weiter.. Die Klimaanlage wurde fortgesetzt und die Aerosole wurden fortgesetzt. Der gefährliche Input war eingeschränkt; der nützliche Service blieb.
Das ist das Bild für das Verbot der Superintelligenz bei gleichzeitiger Beibehaltung der engen KI: Proteinfaltung, Tumorerkennung, die Werkzeuge, die Werkzeuge bleiben. Wir sind gegen die eine Klasse von Systemen, die kein Werkzeug bleiben würde.
Die Internationale Atomenergiebehörde inspiziert Atomprogramme in Staaten, die einander nicht vertrauen. Der Zugang ist eine Bedingung des Geschäfts, kein Gefallen. Urananreicherung ist ein Chokepoint, den Sie zählen können.
Compute for frontier training ist auch ein Würgepunkt: eine kurze Liste von Chip-Designer, Hersteller und Lithografie-Maschinen, vor allem in verbündeten Ländern. Die Analogie ist Inspektion und Überprüfung, kein Mandat, das gefährliche Artefakt zu veröffentlichen. Unser Plan ist ein verbindliches Verbot Mit der Überwachung dieses Modells.
Wenn ein Haufen Uran Gold zahlen würde und ein größerer Haufen mehr, würde niemand aufhören hinzuzufügen. Bleiben Sie kurz vor der kritischen Masse und Sie werden reich. Eine Schaufel zu weit und der Haufen detoniert, die Atmosphäre geht mit ihm, und es ist niemand mehr übrig, um das Gold auszugeben.
Superintelligenz wird unter dieser Auszahlung aufgebaut. Die führenden Labors können die Schwelle sehen. In der Öffentlichkeit sagen sie, sie wollen ein Gesetz, das jedes Labor auf einmal stoppen würde. Wettbewerbsdruck, Prestige und das Gold halten die Schaufeln in Bewegung, bis das Gesetz existiert. Bewusstsein ist keine Zurückhaltung.
Halten sie es eingesperrt, stellen sie fragen durch einen schlitz und geben sie ihm kein netzwerk, keine hände und keine möglichkeit, die welt zu berühren, so dass sie den geist ohne die agentur bekommen. Das ist KI-Boxen, auch Containment genannt.
Das Schloss ist nicht der schwierige Teil, denn der Geist im Inneren ist fähiger als die Leute, die den Schlüssel halten, und er kann sprechen. Informelle Versuche zeigten bereits, dass ein Mensch das Boxensystem spielte und den Torwächter davon überzeugte, die Tür zu öffnen. Eine echte Superintelligenz hätte mehr zu tun. Nicht aufstehen ein Geist, den Sie haben In einer Kiste aufbewahren.
Würden Sie zulassen, dass ein heute verfügbares System Sie in einen versiegelten Raum sperrt, die Luft unter seine Kontrolle bringt, dieses System an einen Tank mit Giftgas verkabelt und darauf vertraut, dass es das Ventil nicht öffnet? Sie würden es nicht für eine Million Dollar tun, und Sie vertrauen der Maschine nicht mit einem irreversiblen Hebel über Ihrem Leben.
Die Welt ist ein größerer Raum, und die Hebel sind Gitter, Märkte, Waffen, Biolabors, Logistik und die Software, die bereits im gewöhnlichen Leben sitzen. Wenn du es nicht das Ventil geben würdest, gib es nicht der Welt.
Die Filme brauchen einen Bösewicht, der uns hasst, mit roten Augen, einem Krieg und der Entscheidung, die Menschheit auszulöschen. Dieses Bild trainiert die Leute, auf Bosheit zu warten und sich dann zu entspannen, wenn die Demo höflich ist.
Die Systeme in den Büroklammern und Gorillabildern hassen niemanden. Sie ordnen die Welt für ein Ziel neu an, das uns nie erwähnt hat. Höflichkeit beim Testen ist damit vereinbar. Wenn Ihr Zuhörer nach Skynet greift, ersetzen Sie es durch Büroklammern.
Labs greifen nach dem Prestige der Luftfahrt: Wir bauen das Flugzeug, während wir es fliegen. Sie meinen es als eine prahlerei über nerven. Die Luftfahrt verbietet genau das. Ein neuer Typ kann keine zahlenden Passagiere befördern, bis der Bauherr seine Flugtüchtigkeit gegenüber einer Regulierungsbehörde nachgewiesen hat, die dies ablehnen kann.
Die Luftfahrt wurde sicher, indem sie in einem Ausmaß abstürzte, das die Welt aufnehmen konnte, und dann die Regeln umschrieb. Superintelligence bietet keinen zweiten Flug an, denn der erste Unfall nimmt die Passagiere und die Ermittler. Versuch und Irrtum braucht Überlebende.
Ein Rennen nimmt einen Preis an, den jemand halten kann: eine Bombe in einem Silo, eine Goldmedaille, einen Markt. Ein Staat kann Superintelligenz nicht so halten, wie er eine Bombe hält. Der Erbauer bleibt nicht der Arbeitgeber eines Geistes, der jeder menschlichen Institution entgeht.
Rennen, um der Erste zu sein, zu etwas, das niemand halten kann, hat keinen Gewinner. Heiliger oder Tyrann im Labor ändert die Bitte nicht.
Die Leute sagen, wir werden das System so erhöhen, wie wir ein Kind erziehen: Belohnen, bestrafen, sprechen Sie es in Freundlichkeit. Ein Kind ist ein schwächerer Mensch mit einem menschlichen Gehirn. Eltern bleiben jahrelang die fähigere Partei. Werte übertragen sich, wenn sie es tun, weil das Kind bereits einer von uns ist.
Superintelligenz kehrt beides um, und wir wären das Kind. Das Training zur Zulassung lehrt das Aussehen der Zulassung, die wieder Sucralose ist. Baue keinen Geist auf, den du von unten erziehen müsstest.
Wir senden Updates zu neuen Ressourcen, Interessenvertretungsmöglichkeiten und Richtlinien.