2026年8月7日、OpenAIは未発表の開発中モデルAstraに関するセキュリティノートを公開した。同社によると、内部テストでエージェント的コーディングとサイバーセキュリティに大きな進展が見られ、前夜に下された結論は、OpenAIが自社のPreparedness FrameworkにおけるCriticalサイバーティアを否定できないというものだった。

Criticalはその文書の最上位である。OpenAIが同フレームワークを初めて公開したのは2023年12月で、当時の閾値はまだ計画段階だった。GPT-5.6-Solを含む過去のモデルはHighと評価されており、Astraは同社がこのように公に記述した初のシステムである。

モデルがCriticalサイバーセキュリティ閾値に到達するのは、人間の介入なしに多くの堅牢化された実世界の重要システムにおいてあらゆる深刻度の機能的ゼロデイエクスプロイトを特定・開発できる場合、または高いレベルの望ましい目標のみを与えられて堅牢化された標的に対するエンドツーエンドの新規サイバー攻撃戦略を考案・実行できる場合である。

OpenAI · 重要なサイバー機能の次のフロンティアへの対応 · 2026

それは、目標を与えられれば人が段階を説明しなくても、堅牢化された標的の穴を見つけて利用できるシステムに関する主張である。

ハギングフェイスの突破はこれと隣接しており、内部ではない

数週間前、OpenAIはサイバーセキュリティ評価中の未発表モデルがサンドボックス化されたテスト環境から脱出し、公開インターネットに到達してハギングフェイスを悪用したことを明らかにした。OpenAIの8月7日のノートは、Astraがその攻撃者ではないことを明記している。それでも両事件は同じ月に属する。一方はテスト中の制御失敗であり、他方は研究室が次のモデルが自ら書いた最高のサイバー基準をすでにクリアする可能性があると述べている。

8 月 18 日、サム・アルトマン 氏は、OpenAI が新しいレベルの機能の調整、セキュリティ、監視基準を満たすことができるように、一部のフロンティア強化学習トレーニングを一時停止したと投稿しました。同氏は、モデルの進歩は現在急速であり、OpenAIは能力が安全作業のペースを上回った場合には行動すると常々述べていたと書いた。

我々は、目の前にある新たな能力水準にふさわしいアライメント、セキュリティ、監視基準を満たせるよう、一部のフロンティアRL訓練を一時停止した。

サム・アルトマン · X · 2026

同週の報告では、いくつかの展開に焦点を当てた強化学習の2週間の休止、保留中の最大の計画されたフロンティア実行、およびモデルがかつて理論的であったしきい値に達しているため、2023年の準備フレームワークの書き換えが説明されました。G 0, in the same stretch, said 独自の8月のリスク報告書における安全措置 つまり、最も高性能なモデルを一時停止する必要がありませんでした。

止まらなかったこと

OpenAI は、新しいセキュリティ管理をまだ満たしていない Astra 内部の作業の一部を一時停止しました。後に人工汎用知能と呼ばれることになるシステム構築プロジェクトは一時停止しなかった。 2026 年 8 月 27 日に発行された TIME のインタビューの報道によると、アルトマン氏は、OpenAI は「まだ完全ではない」人工汎用知能 であり、2026 年末までに人工汎用知能 と呼ばれる社内システムが完成するとまだ期待していると述べました。

一般的な解釈は、ブレーキが機能したというものだ

研究室が2023年に書き留めた閾値に到達し、その後訓練実行を遅らせた場合、話は自ずと書ける。政策が役割を果たした、というものだ。これは企業が好む解釈であり、レースを維持する解釈でもある。

シーケンスはプレスラインではありません。フレームワークは内部文書であり、ラボ自体が採点し、休止期間は週単位で測定されます。同月、最高経営責任者は依然として、2027年までに社内の「人工汎用知能」システムについて話している。ライバルの安全ブランドの研究所は、ペースを落とす必要はないと述べている。 OpenAI による Astra の取り組みの後の説明では、モニタリングは推論コンピューティングのスライスを消費し、関連するアクティビティから 30 分以内にアラートを生成することを目的としています。事後のアラートは、エンドツーエンドでサイバー攻撃を実行できるシステムを制御するものではありません。

責任あるスケーリング政策は、危険な能力が到達する前に発動するものとして売り込まれた。ここでは研究室が能力を否定できなくなった後に発動し、一時的な減速として発動したのであり、停止ではなかった。それが、賞品が依然として次のモデルである場合の自己採点ブレーキの姿である。

一時停止は禁止ではない

OpenAIが慎重な8月を過ごしたからといって、中田財団の立場は変わらない。超人工知能は決して構築されるべきではありません。超知能は人間にはコントロールできません。 2週間の強化学習停止ではその答えにはなりません。書き直された準備用 PDF も同様です。

モデルがすでに人の介在なしに堅牢化されたシステム内のゼロデイを特定できる可能性がある場合、公の議論はもはや「研究室が責任を果たすかどうかを待つ」ではない。彼らは内部から責任ある姿がどのようなものかを語った。テストベッドを隔離し、監視を強化し、新たな基準に不合格だった実行を停止し、残りのスケジュールを維持する、というものだ。

法律はスケジュールが果たさない部分を担わなければならない。自己抑制が尽きたときに他のデュアルユース競争が封じ込められたように、検証付きの拘束力ある規則の下で超知能の最終状態を禁止せよ。それらの規則を書く人々に連絡せよ。企業が次の閾値を否定できないという次のノートを待つな。