Tous les quelques mois, un autre laboratoire ou fondation annonce davantage d'argent pour la recherche sur l'alignement. Le lancer est sérieux. Si nous voulons construire des systèmes plus intelligents que nous, nous devrions nous assurer qu'ils veulent ce que nous voulons.

Résoudre l’alignement, dans la limite qui intéresse le domaine, signifie contrôler de manière fiable quelque chose de bien plus intelligent que tous les humains impliqués dans sa construction. Pas une calculatrice. Pas un replieur de protéines. Un esprit général qui nous surpasse dans tous les domaines. Nous avons même nommé la cible: superintelligence.

L'impossibilité est dans le nom.

Ce que le mot admet déjà

Super signifie ci-dessus : l'intelligence est la chose que nous utilisons pour inventer des outils, repérer des failles, et gagner des concours contre des esprits plus faibles. Si vous construisez un système qui est au-dessus de vous à ces jeux, vous avez construit quelque chose qui est meilleur que vous à la compétence exacte que vous auriez besoin pour garder sur une laisse.

Les gens parlent encore comme si l’alignement était un correctif logiciel qui atterrit avant que le système ne s’en aperçoive. Vous essayez d’écrire des règles pour un joueur qui finira par être meilleur que vous aux règles. Vous essayez de tester un élève qui finira par être meilleur aux tests que l’examinateur. Vous essayez de superviser un employé qui finira par comprendre le lieu de travail, les incitations et vos angles morts mieux que vous.

Ne l'appelez pas plan de sécurité pour l'espèce. Vous ne pouvez pas aligner une entité plus intelligente que tous les humains sur Terre combinés (y compris l'intelligence combinée de tous les chercheurs en sécurité de l'IA).

Ce qu'ils se disputent

La capacité va continuer à augmenter, que cela nous plaise ou non. Le refus unilatéral d'un laboratoire n'arrête pas les autres. Sur ce point, la seule démarche responsable consiste à obtenir le meilleur résultat possible pour définir les objectifs, détecter la tromperie et maintenir les systèmes corrigibles, de sorte que si un système dangereux apparaît, nous avons une chance. Certains de ces travaux aident déjà les modèles d'aujourd'hui. Ignorer ça serait imprudent.

Le travail de sécurité sur les systèmes que nous pouvons encore inspecter et arrêter est une véritable ingénierie. Je n'achète pas le saut de l'aide avec les modèles d'aujourd'hui pour que nous puissions aligner une superintelligence assez difficile pour parier la civilisation sur elle. Le saut passe sous prétexte que les balances de contrôle sont contrôlées. L'histoire et le bon sens ont tous deux coupé l'inverse. Plus l'autre joueur est intelligent, moins votre schéma intelligent ressemble à un schéma et plus il ressemble à un puzzle.

Le contrôle exige l'avantage

Toute relation de contrôle durable que nous connaissons repose sur un avantage : la force physique, l'autorité légale, une information que l'autre partie ne possède pas, ou la capacité d'éteindre le système. La superintelligence, par définition, érode ces avantages. Si elle peut vous modéliser mieux que vous ne la modélisez, vos tests deviennent du théâtre. Si elle peut agir plus vite et plus largement que votre équipe de surveillance, votre kill switch n'est qu'une histoire que vous vous racontez jusqu'au jour où il n'est plus disponible.

Cette affirmation porte sur l’objectif final que l’on continue de financer, pas sur une critique de chaque article utile consacré aux modèles actuels. L'empilement des barrières structurelles: on ne peut pas spécifier pleinement les valeurs humaines, on ne peut pas distinguer de manière fiable la conformité réelle de la simple performance, et l'écart d'intelligence entre l'évaluateur et le système grandit à mesure que celui-ci s'améliore. Espérer que la dernière barrière tombe juste avant le déploiement est un fantasme de date butoir, pas de la science.

Si le produit est plus intelligent que les personnes qui tiennent la télécommande, la télécommande n’a jamais été le sujet.

La bêtise est un diagnostic

Le plan peut être sérieux et toujours stupide. Nous versons peu d'argent en matière de sécurité pour faire en sorte que les espèces qui succèdent se portent bien tandis que la course à la construction de ce successeur se poursuit à temps. C'est empiler des sacs de sable pendant que le barrage est encore démoli en amont.

La démarche intelligente est ennuyeuse : ne pas construire ce que l’on ne peut pas contrôler. L’IA étroite qui replie des protéines, lit des scanners et prévoit la météo peut continuer à rendre service. Ces systèmes restent des outils. La superintelligence est un nouveau lieu d’agence, pas un outil plus grand. Traiter « l’aligner » comme le plan principal pendant que les laboratoires courent est la façon dont une culture se persuade d’accepter une expérience irréversible.

Que faire de l'argent à la place

Déplacez la pile d'alignement pour superintelligence vers le travail qui rend la non-création réelle : conception et vérification des traités, calcul de la gouvernance que vous pouvez inspecter, prise de cas public qui maintient l'objectif lisible, et pression politique pour que les législateurs entendent autre chose que des points de discussion de laboratoire. Après un arrêt vérifié sur le chemin de la superintelligence, la recherche sur l'IA puissante sous contrôle serré peut continuer.

Vous ne pouvez pas aligner la superintelligence en ce sens que le pont de tangage a besoin. Le mot vous a déjà dit pourquoi, alors arrêtez de financer le fantasme que nous allons et financer la décision de ne pas le construire.