アンソロピックの2026年8月リスク報告書は186ページにわたる自社評価である。対象期間は7月15日まで。同社の責任ある拡大方針バージョン3.4の下で、破局的ミスアライメントリスクの全体評価が従来の最低水準から低水準へ変更された。理由として挙げられたのは、最近のサイバーセキュリティ事件開示後の不確実性と、自動研究・工学の加速を示す初期兆候であり、内面アライメントの新たな証明ではない。
アンソロピック が依然として注意深いという見出しだけが必要な場合は、見逃しても構いません。もう一度読んでください。安全ブランドの研究所は独自に壊滅的リスクのラベルを引き上げ、同じ文書の中で開発全体を遅らせてはいないと述べた。
モデル 2 はすでに稼働しています
報告書は未公開のMythos級システムであるModel 2に言及している。アンソロピックはこれを多くの社内タスクでMythos 5より顕著に優れ、自社非公開能力指数で約1.5ポイント高いと述べ、Opus 4.6からMythosへの飛躍ほどの規模ではないとしている。現時点で公開予定はない。完全な展開前評価スイートは未実施であるため、同社自身の能力に対する信頼度はMythos 5の場合より低い。
主にアンソロピックスタッフが後に解決した実務的工学問題449件からなるCoBenchで、Model 2は62.8%を記録した。Mythos 5は50.3%、Mythos Previewは54.8%である。同社自身の推定では、研究スタッフを代替できるシステムには少なくとも85%が必要とされる。Model 2はその水準には達していない。最後の社内最高成績に対して二桁の差を一挙に縮めた。
Mythos 5とModel 2はアンソロピック内で研究・工学に広く活用されており、対話形式および常駐エージェント展開の両方で用いられている。Claudeは現在、生産コードベースにマージされるコードの大部分を生成している。
アンソロピック · Risk Report August 2026
物差しは使い果たされた
自動化された AI 研究開発に関して、レポートは依然として全体的なリスクを低いと評価しています。そして、最も具体的なタスクベースの評価が飽和しているため、同社は以前のレポートよりもその評価に自信を持っていない、と述べている。能力の向上を捉えることはできなくなりました。研究室では加速の初期の兆候も見られています。
次の飛躍を捉えられないテストは、数値付きの死角である。アンソロピックは旧スイートの一部を、少なくとも実際の社内問題群であるCoBenchに置き換えた。それでもスタッフ代替の基準は85%にあり、Model 2はすでに62.8%に達しているうえに公開名もない。
Model 2をAPIから外すことは、より強力なモデルを競争から排除することと同じではない。報告書によると、2つの最強システムはすでに継続的に動作するエージェントを含む重い内部利用中である。出荷されるコードは、会社の言葉で言えば、現在主にClaudeによって書かれている。
一般的な解釈では、慎重な研究室が一線を守ったということになる。
アンソロピック はモデル 2 を出荷しませんでした。 長い報告書を発表し、リスクという形容詞を掲げた。 同じ8月には、 OpenAI paused some frontier training after Astra, G 0は、独自のセーフガードが一時停止を必要としないことを意味すると述べた。外から見れば、それは大人の監督のように見えます。文書の中から見ると、スケーリングしているものをもはや測定することができず、より強力なシステムを自分の仕事に使用し、作業を遅くすることを拒否しているように見えます。
悪役抜きでインセンティブがこれを説明する。競合が止めない中で自社だけ止めれば、次のモデル、次の契約、次の評価額を失う。自社評価のポリシーはその圧力に耐えられるよう作られている。報告書や非公開の名前、以前の最低評価から一段階上げた「低」評価は生み出すが、停止は生み出さない。
ベンチが実際に測定するもの
中田財団は、社内のリスク評価を高くすることを救済策として考えていません。超人工知能は決して構築されるべきではありません。超知能は人間にはコントロールできません。コードを作成するスタッフが既に Claude のコードの大部分を監視している場合、残された人間の役割は、テストでは明確に確認できなくなったシステムの縮小レビュー ステップになります。
評価を公開したければ公開すればよい。重みを非公開にしたければ非公開にすればよい。どちらも拘束力のある禁止の代わりにはならない。8月の報告書は率直である点で有用だ。その率直さを安心材料ではなく証拠として扱え。