Der Risikobericht vom August 2026 besteht aus 186 Seiten eines Labors, das sich selbst bewertet. Das Coverage-Datum ist der 15. Juli. Unter Version 3.4 der Responsible Scaling Policy des Unternehmens hat sich die Gesamtbewertung des katastrophalen Fehlausrichtungsrisikos von der vorherigen Bodenbewertung auf niedrig verschoben. Der Grund dafür ist die Unsicherheit nach den jüngsten Enthüllungen von Cybersicherheitsvorfällen sowie frühe Anzeichen dafür, dass Modelle bei automatisierter Forschung und Technik beschleunigt werden, kein neuer Beweis für eine innere Ausrichtung.
Sie können es verpassen, wenn Sie nur die Überschrift wollen, dass Anthropic immer noch die vorsichtige ist. Lesen Sie es noch einmal. Das Safety-Branded-Labor hob sein eigenes katastrophales Risiko-Label auf und sagte im selben Dokument, dass es die Entwicklung insgesamt nicht verlangsamt.
Model 2 ist bereits am Werk
Der Bericht nennt ein unveröffentlichtes Mythos-Klassensystem, Modell 2. Anthropic beschreibt es als eine spürbare Verbesserung von Mythos 5 für viele interne Aufgaben, etwa 1,5 Punkte höher auf dem privaten Fähigkeitsindex des Unternehmens und nicht als Sprung auf der Skala von Opus 4.6 zu Mythos. Es gibt derzeit keinen Plan, es zu veröffentlichen. Die vollständige Predeployment-Suite wurde nicht ausgeführt, so dass das eigene Vertrauen des Unternehmens in das, was es tun kann, geringer ist als bei Mythos 5.
Auf CoBench wurden 449 reale Engineering-Probleme weitgehend aus Problemen Anthropic Mitarbeiter später gelöst, Modell 2 erzielt 62,8 Prozent. Mythos 5 erzielt 50,3 Prozent. Mythos Preview erzielt 54,8 Prozent. Die eigene Schätzung von Anthropic ist, dass ein System, das in der Lage ist, sein Forschungspersonal zu vertreten, mindestens 85 Prozent benötigen würde. Model 2 ist nicht dieses System. Es schloss eine zweistellige Lücke zum letzten internen Champion in einem Sprung, zu den Hausaufgaben des Labors.
Mythos 5 und Model 2 werden ausgiebig für Forschung und Engineering innerhalb von Anthropic verwendet, sowohl interaktiv als auch über persistente Agenten-Deployments; Claude verfasst jetzt eine große Mehrheit des Codes, der in unseren Produktions-Codebasen zusammengeführt wurde.
Anthropic · Risk Report August 2026
Der Maßstab hat sich selbst verbraucht
In Bezug auf automatisierte KI-R&D bewertet der Bericht das Gesamtrisiko immer noch als gering. Dann sagt es, dass das Unternehmen in dieser Bewertung weniger zuversichtlich ist als in früheren Berichten, weil die konkretesten aufgabenbezogenen Bewertungen gesättigt sind. Sie erfassen keine Steigerungen der Fähigkeit mehr. Das Labor sieht auch frühe Anzeichen einer Beschleunigung.
Ein Test, der den nächsten Sprung nicht sehen kann, ist ein blinder Fleck mit einer Zahl. Anthropic ersetzte einen Teil der alten Suite durch CoBench, was zumindest eine Reihe von echten internen Problemen darstellt. Selbst dort liegt die Ersatz-Personal-Bar bei 85 Prozent, und Modell 2 ist bereits bei 62,8 ohne öffentlichen Namen.
Model 2 von der API fernzuhalten ist nicht dasselbe wie ein stärkeres Modell aus dem Rennen herauszuhalten. Der Bericht sagt, dass die beiden stärksten Systeme bereits stark intern genutzt werden, einschließlich Agenten, die kontinuierlich laufen. Der Code, der ausgeliefert wird, in den Worten des Unternehmens, jetzt meist geschrieben von Claude.
Die Volkslesung ist, dass das sorgfältige Labor die Linie hielt
Anthropic hat das Modell 2 nicht ausgeliefert. Es veröffentlichte einen langen Bericht und hob ein Risikoadjektiv. Im selben August, OpenAI unterbrach einige Grenztraining nach Astra, und Anthropic sagte, dass seine eigenen Sicherheitsvorkehrungen bedeuteten, dass es keine Pause brauchte. Von außen sieht das wie eine Aufsicht von Erwachsenen aus. Aus dem Inneren des Dokuments sieht es aus wie ein Unternehmen, das die Sache, die es skaliert, nicht mehr messen kann, das stärkere System für seine eigene Arbeit verwendet und es ablehnt, die Arbeit zu verlangsamen.
Anreize erklären dies ohne Schurken. Ein Labor, das aufhört, während ein Rivale das nächste Modell, den nächsten Vertrag, die nächste Bewertung nicht verliert. Selbsteinstufung Politik ist gebaut, um diesen Druck zu überleben. Sie produzieren Berichte, zurückgehaltene Namen und eine einstufige Bewegung von der vorherigen Bodenbewertung zu niedrig. Sie bringen keinen Halt.
Erhebe das Gesetz, nicht das Adjektiv
Die Nakada-Stiftung nimmt keine höhere interne Risikoeinstufung als Abhilfe. Künstliche Superintelligenz sollte niemals gebaut werden. Superintelligenz kann nicht von Menschen kontrolliert werden. Wenn die Mitarbeiter, die den Code schreiben, bereits das meiste davon schreiben, ist die verbleibende menschliche Rolle ein schrumpfender Überprüfungsschritt auf einem System, das die Tests nicht mehr klar sehen können.
Veröffentlichen Sie die Evals, wenn Sie möchten. Halten Sie die Gewichte, wenn Sie wollen. Beides ist kein Ersatz für ein verbindliches Verbot. Der August-Bericht ist nützlich, weil er offen ist. Behandle die Offenheit als Beweis, nicht als Trost.