Cada pocos meses otro laboratorio o fundación anuncia más dinero para la investigación de alineación. El lanzamiento es serio. Si vamos a construir sistemas más inteligentes que nosotros, mejor nos aseguramos de que quieren lo que queremos.
Resolver la alineación, en el límite que le importa al campo, significa controlar de forma confiable algo mucho más inteligente que todos los humanos involucrados en construirlo. No una calculadora. No un plegador de proteínas. Una mente general que nos supera en pensamiento en todos los ámbitos. Incluso le pusimos nombre al objetivo: superinteligencia.
La imposibilidad está en el nombre.
¿Qué admite ya la palabra?
Super significa arriba: la inteligencia es lo que utilizamos para inventar herramientas, detectar lagunas y ganar concursos contra mentes más débiles. Si usted construye un sistema que está por encima de usted en esos juegos, usted ha construido algo que es mejor que usted en las habilidades exactas que usted necesita para mantener en una correa.
La gente sigue hablando como si la alineación fuera un parche de software que llega antes de que el sistema se dé cuenta. Estás intentando escribir reglas para un jugador que eventualmente será mejor en reglas que tú. Estás intentando examinar a un estudiante que eventualmente será mejor en exámenes que el examinador. Estás intentando supervisar a un empleado que eventualmente entenderá el lugar de trabajo, los incentivos y tus puntos ciegos mejor que tú.
No lo llame un plan de seguridad para la especie. Usted no puede alinear una entidad más inteligente que todos los humanos en la Tierra combinados (incluyendo la inteligencia combinada de todos los investigadores de seguridad AI).
Lo que realmente argumentan
La capacidad seguirá aumentando si nos gusta o no. La negativa unilateral por un laboratorio no detiene a los demás. En este punto de vista, el único movimiento responsable es conseguir lo mejor posible para especificar objetivos, detectar engaños y mantener los sistemas corrigibles, de manera que si un sistema peligroso parece que tenemos una oportunidad. Algo de ese trabajo ya ayuda con los modelos de hoy. Ignorar que sería imprudente.
El trabajo de seguridad en sistemas que todavía podemos inspeccionar y apagar es la ingeniería real. No compro el salto de la ayuda con los modelos de hoy para por lo tanto podemos alinear una superinteligencia lo suficientemente difícil para apostar la civilización en ella. El salto de contrabando en la suposición de que el control escala con la cosa que se controla. La historia y el sentido común cortan el otro lado. Cuanto más inteligente sea el otro jugador, menos su inteligente esquema parece un esquema y más parece un rompecabezas.
El control requiere la ventaja
Toda relación de control duradera que conocemos se basa en una ventaja: fuerza física, autoridad legal, información que la otra parte no posee o la capacidad de apagar el sistema. La superinteligencia, por definición, erosiona esas ventajas. Si puede modelarte mejor de lo que tú la modelas a ella, tus pruebas se convierten en teatro. Si puede actuar más rápido y en mayor escala que tu equipo de supervisión, tu interruptor de apagado es una historia que te cuentas hasta el día en que ya no esté disponible.
Esa afirmación se refiere al estado final hacia el que la gente sigue financiando, no un argumento en contra de cada artículo útil sobre los modelos actuales. Las barreras estructurales se acumulan: no se pueden especificar por completo los valores humanos, no se puede distinguir de forma fiable el cumplimiento genuino de la actuación, y la brecha de inteligencia entre el evaluador y el sistema crece a medida que el sistema mejora. Esperar que la última barrera caiga justo antes del despliegue es una fantasía de fecha límite, no ciencia.
Si el producto es más inteligente que las personas que sostienen el control remoto, el control remoto nunca fue el punto.
Ser tonto es un diagnóstico
El plan puede ser serio y seguir siendo tonto. Estamos derramando escaso dinero de seguridad para hacer que una especie sucesor vaya bien mientras la raza para construir ese sucesor continúa a tiempo. Eso está apilando bolsas de arena mientras la presa todavía está siendo demolida aguas arriba.
La jugada inteligente es aburrida: no construyas lo que no puedes controlar. La IA estrecha que pliega proteínas, lee escáneres y pronostica el clima puede seguir entregando resultados. Esos sistemas siguen siendo herramientas. La superinteligencia es un nuevo centro de agencia, no una herramienta más grande. Tratar "alinearla" como el plan principal mientras los laboratorios compiten es la forma en que una cultura se convence de hacer un experimento irreversible.
Qué hacer con el dinero en su lugar
Mueva la alineación por superinteligencia hacia el trabajo que hace que la no creación sea real: diseño de tratados y verificación, computar la gobernanza que puede inspeccionar, hacer caso público que mantiene la meta legible, y la presión política para que los legisladores escuchen algo más que los puntos de habla del laboratorio. Después de una interrupción verificada en el camino a la superinteligencia, puede continuar la investigación en potente AI bajo control estricto.
No puedes alinear la superinteligencia en el sentido que la cubierta de campo necesita. La palabra ya te dijo por qué, así que deja de financiar la fantasía que haremos y financia la decisión de no construirla.