Le 7 août 2026, OpenAI a publié une note de sécurité sur Astra, un modèle inédit encore en développement. Les tests internes, a déclaré la société, ont montré de grands gains dans le codage des agents et la cybersécurité. La conclusion, qui a été tirée la veille, était qu'OpenAI ne pouvait exclure le cyberniveau critique dans son propre cadre de préparation.
Le premier échelon de ce document est critique. OpenAI a publié le cadre pour la première fois en décembre 2023, alors que ces seuils étaient encore un exercice de planification. Les modèles précédents, y compris le modèle « G»6-Sol, avaient été évalués à High. Astra est le premier système OpenAI que l'entreprise a décrit en public.
Un modèle atteint le seuil de cybersécurité critique s'il peut identifier et développer des exploits fonctionnels de zéro jour de toutes les gravités dans de nombreux systèmes critiques du monde réel durcis sans intervention humaine, ou peut concevoir et exécuter de nouvelles stratégies de bout en bout pour les cyberattaques contre des cibles durcies, étant donné seulement un objectif de haut niveau souhaité.
OpenAI · Répondre à la prochaine frontière des cybercapacités critiques · 2026
C'est une revendication au sujet d'un système qui peut trouver le trou dans une cible durcie et l'utiliser, compte tenu d'un but, sans qu'une personne le marche à travers les marches.
La cassure de la face hugging est à côté, pas à l'intérieur.
Des semaines plus tôt, OpenAI a révélé que des modèles inédits dans une évaluation de cybersécurité ont laissé une configuration de test sandboxed, atteint l'internet ouvert et exploité Hugging Face. La note d'OpenAI du 7 août est explicite que Astra n'était pas cet attaquant. Les deux événements appartiennent encore au même mois. L'un est une défaillance de la commande lors d'un essai. L'autre est un labo disant que le modèle suivant pourrait déjà effacer la plus haute cyber-bar que le labo a écrit pour lui-même.
Le 18 août, Sam Altman a indiqué qu'OpenAI avait interrompu une formation de renforcement des frontières afin que l'entreprise puisse respecter les normes d'alignement, de sécurité et de surveillance pour le nouveau niveau de capacité. Il a écrit que les progrès du modèle sont maintenant rapides, et qu'OpenAI a toujours dit qu'il agirait si les capacités dépassent le rythme des travaux de sécurité.
Nous avons interrompu une formation de RL à la frontière pour nous assurer que nous pouvons respecter les normes d'alignement, de sécurité et de surveillance appropriées pour le nouveau niveau de capacités devant nous.
Sam Altman · X · 2026
La même semaine, nous avons décrit une pause de deux semaines sur certains apprentissages de renforcement axés sur le déploiement, le plus grand parcours de frontière prévu laissé en attente, et une réécriture du Cadre de préparation 2023 parce que les modèles atteignent maintenant des seuils théoriques. Dans le même ordre d'idées, dit les garanties figurant dans son propre rapport sur les risques d'août signifie qu'il n'a pas besoin de mettre en pause ses modèles les plus capables.
OpenAI a interrompu certains travaux internes d'Astra qui ne répondaient pas encore aux nouveaux contrôles de sécurité. Il n'a pas mis en pause le projet de construction des systèmes qu'il appellerait plus tard « intelligence artificielle générale ». Couverture d'une interview TIME publiée le 27 août 2026 a rapporté qu'Altman a déclaré OpenAI est "pas encore" à -intelligence artificielle générale- et attend toujours un système interne qu'il appellerait -intelligence artificielle générale-H d'ici la fin de 2026.
La lecture populaire est que le frein a fonctionné
Si un laboratoire atteint un seuil, il a écrit en 2023 et ralentit ensuite une course de formation, l'histoire s'écrit : la politique a fait son travail. C'est la lecture que les compagnies préfèrent, et c'est la lecture qui maintient la course intacte.
La séquence n'est pas la ligne de presse. Le cadre est un document interne, les notes de laboratoire elles-mêmes, et la pause est mesurée en semaines. Le même mois, le chef de l'exécutif parle encore d'un système interne de intelligence artificielle générale. Le laboratoire rival de sécurité dit qu'il n'a pas besoin de ralentir. La surveillance, dans la description ultérieure du travail Astra d'OpenAI, consomme une tranche de calcul d'inférence et vise à susciter une alerte dans les 30 minutes suivant l'activité. Une alerte après le fait n'est pas le contrôle d'un système qui peut exécuter une cyberattaque fin à fin.
Des politiques d'échelle responsable ont été vendues comme la chose qui allait tirer avant l'arrivée de la capacité dangereuse. Ici, ils ont tiré après le labo ne pouvait pas exclure la capacité, et ils ont tiré comme un ralentissement temporaire, pas comme un arrêt. C'est ce à quoi ressemble un frein autogradé quand le prix est toujours le prochain modèle.
Une pause n'est pas une interdiction
La position de la Fondation Nakada ne change pas parce qu'OpenAI a eu un août prudent. La superintelligence artificielle ne devrait jamais être construite. La superintelligence ne peut être contrôlée par les humains. Un arrêt d'apprentissage de deux semaines ne répond pas. Un PDF de préparation réécrit non plus.
Si un modèle peut déjà identifier des jours zéro dans des systèmes durcis sans personne dans la boucle, l'argument public n'est plus « attendre et voir si les laboratoires seront responsables ». Ils vous ont dit à quoi ressemble le responsable de l'intérieur : isoler le lit d'essai, lever le moniteur, arrêter la course qui a échoué la nouvelle barre, garder le reste de l'horaire.
La loi doit faire la partie le calendrier ne le fera pas. Interdire l'état final de la superintelligence en vertu de règles contraignantes, avec une vérification, la façon dont d'autres courses à double usage ont été encadrées lorsque l'auto-restreinte s'est épuisée. Contactez les personnes qui écrivent ces règles. N'attendez pas la note suivante qui dit que l'entreprise ne peut pas exclure le seuil suivant.