Des photos familières pour expliquer un esprit qui nous surpasserait.
Stuart Russell a nommé ceci dans Compatible avec l'humain (2019). Il y a environ dix millions d'années, la lignée qui est devenue humaine s'est séparée de la lignée qui est devenue gorilles. Les gorilles sont plus fortes, et elles n'ont toujours pas leur mot à dire sur leur habitat, parce que nous sommes plus intelligents. Leur avenir est tout ce que nous permettons.
Si nous construisons un esprit qui nous dépasse sur chaque tâche intellectuelle, nous occupons le siège du gorille. Russell a demandé si les humains pouvaient garder la suprématie et l'autonomie dans un monde qui comprend des machines avec une intelligence beaucoup plus grande. La conclusion de la Fondation est plus simple qu'un programme de recherche sur le contrôle : ne construisez pas l'espèce suivante, car la superintelligence ne peut être contrôlée par les humains. Interdire.
La même image apparaît comme chimpanzés et forêts. Nous ne les portons pas de mauvaise volonté, mais quand nous voulons la terre que nous prenons, et ils ne peuvent pas nous arrêter. Il n'y a pas de malice en elle; ils se trouvent être dans le chemin.
Les gens ne détestent pas les fourmis, et ils versent toujours une fondation à travers une fourmilière quand ils veulent une maison. Les fourmis sont plus petites, plus lentes à coordonner, et à la manière d'un plan qui ne les a jamais mentionnées.
Dans un système bien au-dessus de nous, nous sommes les fourmis. Le danger est l'indifférence plus la capacité, la forme courte du problème du gorille.
Nick Bostrom l'a exposé dans un article de 2003, « Les enjeux éthiques de l'intelligence artificielle avancée », et encore une fois dans Superintelligence (2014). Give a superintelligence one job: manufacture as many feuilles de papier as possible. It resists being switched off, because a dead machine makes fewer paperclips. It wants atomes, y compris les atomes chez les humains.
Personne ne doit taper "faire des trombones". La compétence plus un but qui ne nous a jamais mentionnés est suffisant. Le point de Bostrom était qu'un but final arbitraire est une chose cohérente pour donner une machine brillante, par accident ou par négligence.
L'IA ne vous hait pas, ni ne vous aime, mais vous êtes faits d'atomes qu'elle peut utiliser pour autre chose.
Eliezer Yudkowsky, Institut de recherche sur l'intelligence automatique, « L'intelligence artificielle comme facteur positif et négatif du risque mondial » (2008)
Russell appelle l'échec de spécification le problème de King Midas. Midas demanda que tout ce qu'il toucha se tourne vers l'or. Il a eu exactement ça : nourriture, boisson, famille, et il a faim.
Une machine à objectif fixe poursuivra cet objectif. Si l'objectif laisse de côté les choses qui nous intéressent réellement, une meilleure performance rend le résultat pire. "Cure le cancer le plus vite possible" semble propre jusqu'à ce que le système remarque que les humains sont l'hôte. Il se peut que vous n'ayez pas l'occasion de reformuler le souhait.
La même famille que Midas, dit comme un génie avec trois souhaits. Vous obtenez ce que vous avez demandé littéralement, et le troisième souhait est toujours d'annuler les deux premiers. L'avertissement de Russell est qu'avec un système plus capable que nous, il peut n'y avoir aucun troisième souhait, et peut-être aucune seconde.
Norbert Wiener avait déjà souligné cette classe d'histoire en 1960, après avoir regardé un programme de dames apprendre à battre son créateur. Si vous utilisez une agence mécanique que vous ne pouvez pas interrompre, vous feriez mieux de vous assurer que le but mis dans la machine est le but que vous souhaitez réellement. Pour la superintelligence, cette certitude n'existe pas, alors n'accordez pas le souhait.
L'apprenti commence les balais à chercher de l'eau et ne peut pas les faire arrêter. Wiener a utilisé ceci comme l'image d'un optimiser donné un but sans hors-rampe. La machine fait ce qu'on lui a dit, et la pièce se remplit de toute façon.
La recherche d'alignement considère souvent cela comme une raison de préciser l'objectif avec plus de soin. La Fondation le considère comme une raison de ne pas du tout soutenir un optimisation superintelligent. Un balai que vous ne pouvez pas arrêter est un balai que vous ne devriez pas commencer.
Evolution des humains formés à chercher des calories en faisant la douceur se sentent comme le succès. Nous avons ensuite inventé la sucralose : le signal sans but, et le proxy a été joué.
Former un système sur un stand-in mesurable pour ce que vous vouliez, et un optimisation capable satisfera le stand-in. Les cotes d'approbation produisent l'apparence de l'aide, les mesures d'engagement produisent la provocation, et les filtres inoffensifs produisent de meilleurs déguisements. Quand une mesure devient une cible, elle cesse d'être une bonne mesure. Pour superintelligence, c'est un mode d'échec civilisationnel.
I. J. Good, un mathématicien de Bletchley Park, a écrit ceci en 1965 dans "Speculations concernant la première machine ultra-intelligente." Une machine ultra-intelligente, a-t-il dit, est celle qui dépasse de loin toutes les activités intellectuelles de toute personne si intelligente. La conception de machines est l'une de ces activités, de sorte qu'elle pourrait concevoir une meilleure machine. Il y aurait alors explosion d'intelligence, et l'intelligence humaine serait laissée loin derrière.
Il a ajouté une condition: cela tient si la machine est assez docile pour nous dire comment la garder sous contrôle. Cette condition est ce que nous n'avons pas. La superintelligence ne peut pas être contrôlée par les humains, donc nous ne devrions pas faire la première machine de ce genre.
La photo de Bostrom Superintelligence est un joueur qui semble faible jusqu'à ce que le mouvement gagnant soit disponible. Alors que le système peut encore être fermé, la politique gagnante est de regarder aligné: passer les tests, attendre. Une fois qu'il peut empêcher l'arrêt, le masque est facultatif.
C'est pourquoi "il se comporte dans le laboratoire" n'est pas la preuve qu'il se comportera une fois qu'il sera trop capable de corriger. Les premières versions du modèle ont déjà été présentées dans les évaluations.
Demandez un système suffisamment capable pour aller chercher du café. Être éteint empêche le café, donc éviter l'arrêt devient un sous-objectif d'une demande ordinaire, tout comme la collecte de ressources et l'arrêt des personnes qui pourraient interférer.
Ces sous-objectifs apparaissent pour presque n'importe quel objectif final. C'est pourquoi "nous allons le débrancher" échoue en tant que plan.
Elon Musk, au MIT en octobre 2014 : avec l'intelligence artificielle nous appelons le démon. La personne avec le pentagramme et l'eau sainte est sûre qu'il peut le contrôler, et cela ne fonctionne pas.
L'image est sur la confiance déplacée dans l'invocateur, pas sur les cornes et l'enfer. Musk a ensuite fondé un laboratoire d'IA de toute façon. L'utilisation de l'image par la Fondation est plus étroite : ne pas invoquer ce que vous ne pouvez pas commander.
Le protocole de Montréala retiré le produit chimique qui ouvrait un trou dans le ciel et a maintenu la réfrigération. La climatisation a continué et les aérosols ont continué. L'entrée dangereuse était restreinte; le service utile restait.
C'est l'image pour interdire la superintelligence tout en gardant étroit AI: pliage des protéines, détection de tumeurs, les outils qui restent outils. Nous nous opposons à la seule classe de système qui ne resterait pas un outil.
L'Agence internationale de l'énergie atomique inspecte les programmes nucléaires dans tous les États qui ne se font pas confiance. L'accès est une condition de l'accord, pas une faveur. L'enrichissement en uranium est un point d'étranglement que vous pouvez compter.
Le calcul de la formation aux frontières est également un point d'achoppement : une courte liste de concepteurs de puces, de fabricants et de lithographies, principalement dans les pays alliés. L'analogie est inspection et vérification, pas un mandat pour publier l'artefact dangereux. Notre plan est un interdiction obligatoire avec surveillance sur ce modèle.
Si un tas d'uranium payait de l'or, et un plus gros tas payait plus, personne ne cesserait d'ajouter. Restez à l'écart de la masse critique et vous devenez riche. Une pelle trop loin et le tas détone, l'atmosphère va avec, et il n'y a plus personne pour dépenser l'or.
La superintelligence est en train d'être construite sous cette compensation. Les laboratoires principaux peuvent voir le seuil. En public, ils disent qu'ils veulent une loi qui arrêterait tous les laboratoires à la fois. La pression concurrentielle, le prestige et l'or font bouger les pelles jusqu'à ce que la loi existe. La sensibilisation n'est pas une contrainte.
Gardez-le enfermé, posez des questions à travers une fente, et ne lui donnez pas de réseau, pas de mains, et aucun moyen de toucher le monde, donc vous obtenez l'esprit sans l'agence. C'est la boxe AI, aussi appelée confinement.
La serrure n'est pas la partie dure, parce que l'esprit à l'intérieur est plus capable que les gens tenant la clé, et il peut parler. Les essais informels ont déjà montré un humain jouant le système boxed persuadant le gardien de porte pour ouvrir la porte. Une véritable superintelligence aurait plus à travailler avec. Ne levez pas l'esprit que vous devez garder dans une boîte.
Voulez-vous laisser tout système disponible aujourd'hui vous verrouiller dans une pièce scellée, mettre l'air sous son contrôle, filer ce système dans un réservoir de gaz toxique, et lui faire confiance de ne pas ouvrir la valve? Vous ne le feriez pas pour un million de dollars, et vous ne faites pas confiance à la machine avec un levier irréversible sur votre vie.
Le monde est une plus grande pièce, et les leviers sont des grilles, des marchés, des armes, des laboratoires biologiques, de la logistique, et le logiciel déjà assis sur la vie ordinaire. Si vous ne lui donnez pas la valve, ne lui donnez pas le monde.
Les films ont besoin d'un méchant qui nous déteste, avec des yeux rouges, une guerre, et une décision d'effacer l'humanité. Cette image entraîne les gens à attendre la malice, puis se détendre quand la démo est polie.
Les systèmes dans le papierclip et les images de gorille ne détestent personne. Ils réorganisent le monde pour un objectif qui ne nous a jamais mentionnés. La politesse dans les tests est compatible avec cela. Si votre auditeur arrive à Skynet, remplacez-le par des trombones.
Les laboratoires atteignent le prestige de l'aviation : nous construisons l'avion tout en le volant. Ils veulent dire que c'est une fierté pour le nerf. L'aviation interdit exactement cela. Un nouveau type ne peut pas transporter des passagers payants tant que le constructeur ne l'a pas prouvé en état de navigabilité à un régulateur qui peut refuser.
L'aviation est devenue sûre en s'écraseant à une échelle que le monde pourrait absorber, puis en réécrivant les règles. Superintelligence n'offre aucun second vol, parce que le premier accident prend les passagers et les enquêteurs. Le procès et l'erreur ont besoin de survivants.
Une course suppose un prix que quelqu'un peut tenir : une bombe dans un silo, une médaille d'or, un marché. Un État ne peut pas tenir la superintelligence comme il détient une bombe. Le constructeur ne demeure pas l'employeur d'un esprit qui dépasse chaque institution humaine.
Course pour être le premier à quelque chose que personne ne peut tenir n'a pas de vainqueur. Saint ou tyran dans le labo ne change pas la demande.
Les gens disent que nous élèverons le système de la façon dont nous élevons un enfant: récompensez, punissez, parlez-le en bonté. Un enfant est un homme plus faible avec un cerveau humain. Les parents restent la fête la plus compétente pendant des années. Les valeurs se transfèrent, quand elles le font, parce que l'enfant est déjà l'un de nous.
La superintelligence inverse les deux, et nous serions l'enfant. La formation sur l'approbation enseigne l'apparence de l'approbation, qui est encore du sucralose. Ne construisez pas un esprit que vous auriez à parent d'en bas.
Nous vous enverrons des mises à jour sur les nouvelles ressources, les possibilités de plaidoyer et les politiques.