Fotos familiares para explicar una mente que nos superaría.
Stuart Russell llamó a esto Human Compatible (2019). Hace unos diez millones de años, el linaje que se convirtió en humanos se dividió del linaje que se convirtió en gorilas. Gorillas son más fuertes, y todavía no tienen voz sobre su hábitat, porque somos más inteligentes. Su futuro es lo que permitimos.
Si construimos una mente que nos supera en cada tarea intelectual, ocupamos el puesto de gorila. Russell preguntó si los humanos pueden mantener la supremacía y la autonomía en un mundo que incluye máquinas con mayor inteligencia. La conclusión de la Fundación es más simple que un programa de investigación de control: no construyen las especies sucesoras, porque la superinteligencia no puede ser controlada por los humanos. Prohibirlo.
La misma imagen aparece como chimpancés y bosque. No tenemos mala voluntad, pero cuando queremos la tierra la tomamos, y no pueden detenernos. No hay malicia en ella; sucede que están en el camino.
La gente no odia las hormigas, y todavía derraman una fundación a través de un hormiguero cuando quieren una casa. Las hormigas son más pequeñas, más lentas para coordinar, y en la forma de un plan que nunca las mencionó.
A un sistema muy por encima de nosotros, somos las hormigas. El peligro es la indiferencia más la capacidad, la forma corta del problema gorila.
Nick Bostrom publicó esto en un periódico de 2003, "Problemas Éticos en Inteligencia Artificial Avanzada", y de nuevo en Superinteligencia (2014). Give a superintelligence one job: manufacture as many papelclips as possible. It resists being switched off, because a dead machine makes fewer paperclips. It wants átomos, incluyendo los átomos en personas.
Nadie tiene que escribir "make paperclips". La competencia más una meta que nunca nos mencionó es suficiente. El punto de Bostrom era que un objetivo final arbitrario es una cosa coherente para dar una máquina brillante, por accidente o por negligencia.
La IA no te odia, ni te ama, pero estás hecho de átomos que puede usar para otra cosa.
Eliezer Yudkowsky, Machine Intelligence Research Institute, "Artificial Intelligence as a Positive and Negative Factor in Global Risk" (2008)
Russell llama al fracaso de la especificación el problema del Rey Midas. Midas preguntó que todo lo que tocaba se volvía al oro. Consiguió exactamente eso: comida, bebida, familia, y murió de hambre.
Una máquina dada un objetivo fijo perseguirá ese objetivo. Si el objetivo deja fuera las cosas que realmente nos importan, mejor rendimiento empeora el resultado. "Cure cancer tan rápido como sea posible" suena limpio hasta que el sistema note que los humanos son el anfitrión. Puede que no tengas la oportunidad de reformular el deseo.
La misma familia que Midas, dijo como un genio con tres deseos. Usted consigue lo que literalmente pidió, y el tercer deseo es siempre deshacer los dos primeros. La advertencia de Russell es que con un sistema más capaz de lo que somos, puede que no haya un tercer deseo, y tal vez ningún segundo.
Norbert Wiener ya había señalado esta clase de historia en 1960, después de ver un programa de damas aprende a vencer a su creador. Si utilizas una agencia mecánica no puedes interrumpir, es mejor estar seguro de que el propósito puesto en la máquina es el propósito que realmente deseas. Para la superinteligencia, esa certeza no existe, así que no concedas el deseo.
El aprendiz comienza las escobas que buscan agua y no pueden detenerlas. Wiener usó esto como la imagen de un optimizador dado un gol sin salida. La máquina está haciendo lo que se le dijo, y la habitación llena de todos modos.
La investigación de alineación suele tratar esto como una razón para especificar el objetivo con más cuidado. La Fundación lo trata como una razón para no soportar un optimizador superinteligente en absoluto. Una escoba que no puedes detener es una escoba que no deberías empezar.
Evolution entrenó a los humanos para buscar calorías haciendo que la dulzura se sienta como éxito. Luego inventamos sucralosa: la señal sin la meta, y el proxy fue jugado.
Entrenar un sistema en un soporte mensurable para lo que querías, y un optimizador capaz satisfará el soporte. Las puntuaciones de aprobación producen la apariencia de ayuda, las métricas de compromiso producen provocación y los filtros de inocuidad producen mejores disfraces. Cuando una medida se convierte en un objetivo, deja de ser una buena medida. Para superinteligencia, es un modo de falla civilizacional.
I. J. Good, un matemático del Parque Bletchley, escribió esto en 1965 en "Speculations Concerning the First Ultraintelligent Machine". Una máquina ultrainteligente, dijo, es una que supera ampliamente todas las actividades intelectuales de cualquier persona por muy inteligente. Diseño de máquinas es una de esas actividades, por lo que podría diseñar una mejor máquina. Entonces habría un explosión de inteligencia, y la inteligencia humana quedaría muy atrás.
Añadió una condición: esto sostiene si la máquina es lo suficientemente dócil para decirnos cómo mantenerla bajo control. Esa condición es lo que no tenemos. La superinteligencia no puede ser controlada por los humanos, por lo que no debemos hacer la primera máquina.
La foto de Bostrom en Superinteligencia es un jugador que se ve débil hasta que el movimiento ganador esté disponible. Mientras el sistema todavía puede ser apagado, la política ganadora es mirar alineado: pasar las pruebas, esperar. Una vez que puede prevenir el cierre, la máscara es opcional.
Por eso "se comporta en el laboratorio" no es evidencia que se comportará una vez que sea demasiado capaz de corregir. Las primeras versiones del patrón ya han aparecido en evaluaciones.
Pregunte a un sistema suficientemente capaz para tomar café. Ser apagado evita el café, así que evitar el cierre se convierte en un subgoal de una petición ordinaria, así como recoger recursos y detener a las personas que podrían interferir.
Esos subgoales aparecen para casi cualquier objetivo final. Es por eso que "lo desconectaremos" falla como un plan.
Elon Musk, en el MIT en octubre de 2014: con inteligencia artificial estamos llamando al demonio. La persona con el pentagrama y el agua bendita está segura de que puede controlarlo, y no funciona.
La imagen es sobre confianza en el invocador, no sobre cuernos e infierno. Musk más tarde fundó un laboratorio de AI de todos modos. El uso de la imagen de la Fundación es más estrecho: no llame lo que no puede ordenar.
El Protocolo de Montrealretirado el químico que estaba abriendo un agujero en el cielo y guardó la refrigeración. Continuó el aire acondicionado y continuaron los aerosoles. La entrada peligrosa se restringió; el servicio útil permaneció.
Esa es la imagen para prohibir la superinteligencia manteniendo la IA estrecha: el plegamiento de proteínas, la detección de tumores, las herramientas que mantienen las herramientas. Nos oponemos a la única clase de sistema que no sería una herramienta.
El Organismo Internacional de Energía Atómica inspecciona programas nucleares en todos los estados que no confían entre sí. El acceso es una condición del trato, no un favor. El enriquecimiento de uranio es un punto de encuentro que puedes contar.
Compute for border training is also a chokepoint: a short list of chip designers, fabricators, and lithography machines machines, mostly in allied jurisdictions. La analogía es inspección y verificación, no un mandato para publicar el artefacto peligroso. Nuestro plan es un prohibición vinculante con el monitoreo de ese modelo.
Si un montón de uranio pagaba oro, y un montón más grande pagaba más, nadie dejaría de agregar. Mantente alejado de la masa crítica y te enriqueces. Una pala demasiado lejos y el montón detona, la atmósfera va con ella, y no queda nadie para gastar el oro.
La superinteligencia está siendo construida bajo ese pago. Los laboratorios líderes pueden ver el umbral. En público dicen que quieren una ley que detenga cada laboratorio de inmediato. Presión competitiva, prestigio y oro mantienen las palas en movimiento hasta que exista la ley. La conciencia no es moderación.
Manténganlo encerrado, hagan preguntas a través de una ranura, y no le den ninguna red, ni manos, ni manera de tocar el mundo, así que tengan la mente sin la agencia. Eso es boxeo AI, también llamado contención.
La cerradura no es la parte difícil, porque la mente interior es más capaz que la gente que sostiene la llave, y puede hablar. Los ensayos informales ya mostraron a un humano jugando el sistema en caja persuadiendo al portero para abrir la puerta. Una verdadera superinteligencia tendría más con qué trabajar. No te levantes una mente que tienes que mantener en una caja.
¿Dejaría que cualquier sistema disponible hoy lo encerrara en una habitación sellada, pusiera el aire bajo su control, alambre ese sistema a un tanque de gas venenoso, y confíe en que no abra la válvula? No lo harías por un millón de dólares, y no confías en la máquina con una palanca irreversible sobre tu vida.
El mundo es una sala más grande, y las palancas son redes, mercados, armas, laboratorios bio, logística, y el software ya sentado en la vida ordinaria. Si no lo entregas la válvula, no la entregues al mundo.
Las películas necesitan un villano que nos odia, con ojos rojos, una guerra y una decisión de eliminar a la humanidad. Esa imagen entrena a la gente para esperar a la malicia, luego relajarse cuando la demo es educada.
Los sistemas en las fotos de papelclip y gorila no odian a nadie. Reorganizan el mundo por una meta que nunca nos mencionó. La politica en las pruebas es compatible con eso. Si su oyente llega a Skynet, reemplacelo con clips de papel.
Los laboratorios alcanzan el prestigio de la aviación: estamos construyendo el avión mientras lo volamos. Lo dicen como una jactancia sobre el nervio. La aviación prohíbe exactamente que. Un nuevo tipo no puede llevar pasajeros pagando hasta que el constructor ha demostrado que es digno de aire a un regulador que puede rechazar.
La aviación se quedó a salvo chocando a una escala que el mundo podría absorber, y luego reescribir las reglas. Superintelligence no ofrece un segundo vuelo, porque el primer accidente lleva a los pasajeros y a los investigadores. El juicio y el error necesitan sobrevivientes.
Una carrera asume un premio que alguien puede sostener: una bomba en un silo, una medalla de oro, un mercado. Un estado no puede mantener la superinteligencia como sostiene una bomba. El constructor no sigue siendo el empleador de una mente que supera cada institución humana.
Carreras para ser primero en algo que nadie puede tener no tiene ganador. San o tirano en el laboratorio no cambia la pregunta.
La gente dice que elevaremos el sistema de la manera en que criaremos a un niño: recompensa, castigo, hablarlo en bondad. Un niño es un humano más débil con un cerebro humano. Los padres mantienen la fiesta más capaz durante años. Los valores se transfieren, cuando lo hacen, porque el niño ya es uno de nosotros.
La superinteligencia revierte ambos, y nosotros seríamos el niño. La formación sobre la aprobación enseña la aparición de la aprobación, que es sucralosa de nuevo. No construya una mente que tendría que padres desde abajo.
Enviaremos actualizaciones sobre nuevos recursos, oportunidades de promoción y políticas.