Le Rapport sur les risques d'août 2026 de l'entreprise est de 186 pages d'un laboratoire. La date de couverture est le 15 juillet. En vertu de la version 3.4 de la politique d'expansion responsable de l'entreprise, l'évaluation globale du risque de désalignement catastrophique est passée de sa cote de plancher antérieure à sa cote basse. La raison invoquée est l'incertitude après les récentes divulgations d'incidents liés à la cybersécurité, ainsi que les premiers signes que les modèles accélèrent à la recherche et à l'ingénierie automatisées, et non une nouvelle preuve de l'alignement intérieur.
Vous pouvez le manquer si vous ne voulez que le titre que Anthropic est toujours le plus prudent. Relisez-le. Le laboratoire de sécurité a soulevé sa propre étiquette à risque catastrophique et, dans le même document, a déclaré qu'il ne ralentissait pas le développement global.
Le modèle 2 est déjà au travail
Le rapport nomme un système de classe Mythos, modèle 2. L'indice de capacité privée de l'entreprise est décrit comme une amélioration notable sur Mythos 5 pour de nombreuses tâches internes, environ 1,5 point de plus que l'indice de capacité privée de l'entreprise, et non comme un saut sur l'échelle de l'Opus 4.6 à Mythos. Il n'y a pas de plan pour le libérer. La suite complète avant déploiement n'a pas été gérée, de sorte que la confiance de l'entreprise dans ce qu'elle peut faire est inférieure à celle de Mythos 5.
Sur CoBench, 449 problèmes d'ingénierie réels pris en grande partie à partir de problèmes résolus plus tard, le personnel du modèle 2 scores 62,8 pour cent. Mythos 5 scores 50,3%. Mythos Preview obtient 54,8 pour cent. Selon la propre estimation de la société, un système capable de soutenir son personnel de recherche aurait besoin d'au moins 85 pour cent. Le modèle 2 n'est pas ce système. Il a comblé un écart à deux chiffres sur le dernier champion interne dans un houblon, sur les propres devoirs du labo.
Mythos 5 et Model 2 sont largement utilisés pour la recherche et l'ingénierie au sein de -Anthropic, à la fois interactivement et via des déploiements d'agents persistants; -Claude-H est maintenant l'auteur d'une grande majorité du code fusionné dans nos bases de code de production.
Anthropic · Risk Report August 2026
L'étalon s'est usé lui-même
En ce qui concerne la R-D automatisée en matière d'IA, le rapport estime toujours que le risque global est faible. Ensuite, il dit que l'entreprise est moins confiante dans cette notation que dans les rapports précédents, parce que les évaluations les plus concrètes basées sur les tâches ont saturé. Ils ne tiennent plus compte de l'augmentation des capacités. Le laboratoire voit également des signes précoces d'accélération.
Un test qui ne peut pas voir le saut suivant est un angle mort avec un nombre attaché. L'ancienne suite a été remplacée par CoBench, qui est au moins un ensemble de problèmes internes réels. Même là, la barre de remplacement du personnel est à 85 %, et le modèle 2 est déjà à 62.8 sans nom public.
Garder le modèle 2 hors de l'API n'est pas le même que garder un modèle plus fort hors de la course. Le rapport indique que les deux systèmes les plus puissants sont déjà en forte utilisation interne, y compris les agents qui fonctionnent en continu. Le code qui expédie est, dans les mots de la compagnie, maintenant principalement écrit par -Claude.
La lecture populaire est que le labo soigneux a tenu la ligne
Le modèle 2. Il a publié un long rapport et a soulevé un adjectif de risque. Au même août, OpenAI a interrompu une formation à la frontière après Astra, et -Anthropic , a dit ses propres garanties signifie qu'il n'a pas besoin d'une pause. De l'extérieur, ça ressemble à une surveillance pour adultes. De l'intérieur du document, il ressemble à une entreprise qui ne peut plus mesurer la chose qu'il est à l'échelle, en utilisant le système plus fort sur son propre travail, et en refusant de ralentir le travail.
Les incitatifs expliquent cela sans méchants. Un laboratoire qui s'arrête alors qu'un rival ne perd pas le prochain modèle, le prochain contrat, la prochaine évaluation. Des politiques autogradées sont élaborées pour survivre à cette pression. Ils produisent des rapports, des noms refusés et un passage d'une cote de plancher antérieure à une cote inférieure. Ils ne produisent pas d'arrêt.
Élever la loi, pas l'adjectif
La Fondation Nakada ne prend pas une cote de risque interne plus élevée comme remède. La superintelligence artificielle ne devrait jamais être construite. La superintelligence ne peut être contrôlée par les humains. Si le staff qui écrit le code regarde déjà l'écriture de la plupart du temps, le rôle humain restant est une étape de revue rétrécissante sur un système, les tests ne peuvent plus voir clairement.
Publiez les évaluations si vous voulez. Retiens les poids si tu veux. Une interdiction contraignante n'est pas non plus un substitut. Le rapport d'août est utile parce qu'il est franc. Traiter la candeur comme une preuve, pas comme un réconfort.