Alle paar Monate kündigt ein anderes Labor oder eine andere Stiftung mehr Geld für die Ausrichtungsforschung an. Der Pitch ist ernst. Wenn wir intelligentere Systeme bauen wollen als wir, sollten wir besser sicherstellen, dass sie das wollen, was wir wollen.
Alignment zu lösen, soweit es dem Feld darum geht, bedeutet, etwas zuverlässig zu kontrollieren, das weit intelligenter ist als alle Menschen, die an seinem Bau beteiligt sind. Nicht ein Taschenrechner. Nicht ein Proteinfaltungsprogramm. Ein allgemeiner Geist, der uns in allen Bereichen übertrifft. Wir haben das Ziel sogar benannt: Superintelligenz.
Die Unmöglichkeit liegt im Namen.
Was das Wort bereits zugibt
Super bedeutet oben: Intelligenz ist das, was wir verwenden, um Werkzeuge zu erfinden, Schlupflöcher zu erkennen und Wettbewerbe gegen schwächere Köpfe zu gewinnen. Wenn Sie ein System bauen, das bei diesen Spielen über Ihnen liegt, haben Sie etwas gebaut, das besser ist als Sie bei genau den Fähigkeiten, die Sie benötigen, um es an der Leine zu halten.
Die Leute sprechen immer noch so, als wäre Alignment ein Software-Patch, der landet, bevor das System es bemerkt. Man versucht, Regeln für einen Spieler zu schreiben, der irgendwann besser darin sein wird als man selbst. Man versucht, einen Schüler zu prüfen, der irgendwann besser darin sein wird als der Prüfer. Man versucht, einen Mitarbeiter zu beaufsichtigen, der irgendwann den Arbeitsplatz, die Anreize und die blinden Flecken besser verstehen wird als man selbst.
Nennen Sie es nicht einen Sicherheitsplan für die Arten. Sie können keine Entität ausrichten, die intelligenter ist als alle Menschen auf der Erde zusammen (einschließlich der kombinierten Intelligenz aller KI-Sicherheitsforscher).
Was sie eigentlich streiten
Die Fähigkeiten werden weiter steigen, ob es uns gefällt oder nicht. Einseitige Ablehnung durch ein Labor stoppt die anderen nicht. Aus dieser Sicht besteht der einzige verantwortungsvolle Schritt darin, Ziele so gut wie möglich festzulegen, Täuschung zu erkennen und Systeme korrekt zu halten, damit wir eine Chance haben, wenn ein gefährliches System auftritt. Ein Teil dieser Arbeit hilft bereits bei den heutigen Modellen. Ignorieren wäre leichtsinnig.
Sicherheitsarbeiten an Systemen, die wir noch inspizieren und abschalten können, sind ein echtes Engineering. Ich kaufe nicht den Sprung von der Hilfe mit den heutigen Modellen, deshalb können wir eine Superintelligenz hart genug ausrichten, um die Zivilisation darauf zu setzen. Der Sprung schmuggelt in der Annahme, dass die Kontrolle mit der kontrollierten Sache skaliert. Geschichte und gesunder Menschenverstand schneiden beide in die andere Richtung. Je schlauer der andere Spieler, desto weniger sieht Ihr cleveres Schema wie ein Schema aus und desto mehr sieht es wie ein Puzzle aus.
Kontrolle erfordert die Oberhand
Jede dauerhafte Kontrollbeziehung, die wir kennen, beruht auf einem Vorteil: physischer Gewalt, rechtlicher Autorität, Informationen, die der anderen Seite fehlen, oder der Möglichkeit, das System abzuschalten. Superintelligenz untergräbt diese Vorteile definitionsgemäß. Kann sie Sie besser modellieren als Sie sie, werden Ihre Tests zur Theateraufführung. Kann sie schneller und breiter handeln als Ihr Aufsichtsteam, ist Ihr Kill-Switch eine Geschichte, die Sie sich selbst erzählen, bis er eines Tages nicht mehr verfügbar ist.
Diese Behauptung bezieht sich auf den Endzustand, auf den Menschen weiterhin hinfundieren, nicht auf eine generelle Ablehnung jeder nützlichen Arbeit an heutigen Modellen. Die strukturellen Barrieren stapeln sich: Sie können menschliche Werte nicht vollständig spezifizieren, Sie können echte Compliance nicht zuverlässig von Vorspiegelung unterscheiden, und die Intelligenzlücke zwischen Evaluierendem und System wächst, während das System sich verbessert. Zu hoffen, dass die letzte Barriere kurz vor dem Einsatz fällt, ist eine Deadline-Fantasie, keine Wissenschaft.
Wenn das Produkt klüger ist als die Menschen, die die Fernbedienung halten, war die Fernbedienung nie der Punkt.
Dummheit ist eine Diagnose
Der Plan kann ernst und immer noch dumm sein. Wir investieren knappes Sicherheitsgeld, um eine Nachfolgeart gut laufen zu lassen, während das Rennen um den Bau dieses Nachfolgers planmäßig fortgesetzt wird. Das ist das Stapeln von Sandsäcken, während der Damm immer noch stromaufwärts abgerissen wird.
Der kluge Zug ist langweilig: Baue nicht das Ding, das du nicht kontrollieren kannst. Schmalband-KI, die Proteine faltet, Scans liest und Wetter vorhersagt, kann weiter liefern. Diese Systeme bleiben Werkzeuge. Superintelligenz ist ein neuer Ort von Handlungsfähigkeit, kein größeres Werkzeug. „Sie auszurichten“ als primären Plan zu behandeln, während Labore im Wettlauf sind, ist, wie eine Kultur sich in ein irreversibles Experiment hineinredet.
Was stattdessen mit dem Geld tun
Bewegen Sie den Alignment-for-Superintelligenz-Haufen in Richtung Arbeit, die Nicht-Kreation real macht: Vertragsgestaltung und Verifizierung, Compute Governance, die Sie inspizieren können, öffentliche Fallfindung, die das Ziel lesbar hält, und politischer Druck, damit der Gesetzgeber etwas anderes als Laborgespräche hört. Nach einem verifizierten Stopp auf dem Weg zur Superintelligenz kann die Erforschung leistungsstarker KI unter strenger Kontrolle fortgesetzt werden.
Sie können Superintelligenz nicht in dem Sinne ausrichten, wie es das Pitchdeck braucht. Das Wort hat dir schon gesagt, warum, also hör auf, die Fantasie zu finanzieren, die wir wollen, und finanziere die Entscheidung, sie nicht zu bauen.