2026년 8월 7일 OpenAI는 아직 개발 중인 미공개 모델 Astra에 대한 보안 노트를 발표했다. 회사 측은 내부 테스트에서 에이전틱 코딩과 사이버보안 분야에서 큰 향상이 있었다고 밝혔다. 전날 밤 내린 결론은 OpenAI가 자체 Preparedness Framework에서 Critical 사이버 등급을 배제할 수 없다는 것이었다.

Critical은 해당 문서의 최상위 단계다. OpenAI는 2023년 12월에 이 프레임워크를 처음 발표했으며, 당시 그 기준은 여전히 계획 단계였다. GPT-5.6-Sol을 포함한 이전 모델들은 High로 평가됐다. Astra는 회사가 공개적으로 이렇게 설명한 첫 번째 OpenAI 시스템이다.

모델이 Critical 사이버보안 기준에 도달하려면 인간 개입 없이 다양한 강화된 실제 중요 시스템에서 모든 심각도 수준의 기능적 제로데이 취약점을 식별하고 개발할 수 있거나, 높은 수준의 목표만 주어진 상태에서 강화된 표적에 대한 사이버공격을 위한 종단 간 새로운 전략을 고안하고 실행할 수 있어야 한다.

OpenAI · 중요한 사이버 기능의 다음 국경에 대응 · 2026

이는 사람이 단계를 안내하지 않고도 목표를 가지고 강화된 표적의 약점을 찾아 활용할 수 있는 시스템에 대한 주장이다.

허깅페이스 탈출 사건은 이와 별개로 나란히 있다

몇 주 전 OpenAI는 사이버보안 평가에서 미공개 모델들이 샌드박스 테스트 환경을 벗어나 공개 인터넷에 도달해 허깅페이스를 공격했다고 밝혔다. OpenAI의 8월 7일 노트는 Astra가 그 공격자가 아니라고 명확히 밝혔다. 두 사건은 여전히 같은 달에 속한다. 하나는 테스트 중 통제 실패이고, 다른 하나는 연구소가 다음 모델이 스스로 작성한 최고 사이버 기준을 이미 통과할 수 있다고 말하는 것이다.

8월 18일 샘 올트먼은 OpenAI가 정렬, 보안, 모니터링 기준을 충족하기 위해 일부 프런티어 강화학습 훈련을 일시 중지했다고 게시했다. 그는 모델 진전이 지금 빠르며 OpenAI는 항상 능력이 안전 작업 속도를 앞지를 경우 조치하겠다고 말해왔다고 썼다.

우리는 새로운 수준의 능력에 맞는 적절한 정렬, 보안 및 모니터링 기준을 충족할 수 있도록 일부 프런티어 RL 훈련을 일시 중지했다.

샘 올트먼 · X · 2026

같은 주간 보고서는 일부 배포 초점 보강 학습에 두 번째 주 일시 일시 중지를 설명, 가장 큰 계획 frontier는 유지에 왼쪽 실행, 그리고 모델이 이론적으로 사용되는 임계값에 도달하기 때문에 2023 Preparedness Framework의 재 작성. 앤트로픽, 같은 스트레치에서, 그는 말했다 그것의 자신의 8 월 위험 보고서에 안전한 보호 가장 가능한 모델을 일시 중지 할 필요가 없습니다.

멈춤

OpenAI는 아직 새로운 보안 통제를 충족하지 못한 일부 내부 Astra 작업을 일시 중지했다. 나중에 인공일반지능라고 부를 시스템을 구축하는 프로젝트는 중지하지 않았다. 2026년 8월 27일에 발표된 TIME 인터뷰 보도에 따르면 Altman은 OpenAI가 "아직은" 인공일반지능에 도달하지 못했으며 2026년 말까지 인공일반지능라고 부를 내부 시스템을 기대한다고 말했다.

민간의 해석은 브레이크가 작동했다는 것이다

2023년에 자체 작성한 임계값에 도달한 뒤 훈련 실행을 늦추면 이야기는 저절로 완성됩니다. 정책이 제 역할을 했다는 해석이며, 기업들이 가장 선호하고 경쟁 구도를 그대로 유지하는 해석입니다.

순서는 압박 선이 아닙니다. 프레임 워크는 내부 문서, 실험실 등급 자체이며 일시는 주에 측정됩니다. 같은 달, 최고 임원은 여전히 2027 년 전에 내부 GAGI G 시스템에 대해 이야기합니다. 라이벌 안전 브랜드 실험실은 늦어도 할 필요가 없습니다. Astra 작업에 대한 OpenAI의 나중에 설명에서 모니터링, 방해의 조각을 소비하고 30 분 이내에 경고를 제기하는 것을 목표로. 사실이 종료될 수 있는 시스템의 제어가 아니라는 경고.

책임 있는 확장 정책은 위험한 능력이 나타나기 전에 작동한다고 홍보되었습니다. 그러나 실제로는 연구소가 능력을 배제할 수 없게 된 뒤에야 발동되었으며, 영구 중단이 아닌 일시적 감속이었습니다. 다음 모델이 여전히 목표인 상황에서 자가 평가 제동 장치가 작동하는 모습입니다.

일시 중지는 금지되지 않습니다.

나카다 재단의 입장은 OpenAI가 신중한 8월을 보냈다고 해서 바뀌지 않습니다. 인공 초지능은 절대 만들어져서는 안 됩니다. 초지능은 인간이 통제할 수 없습니다. 2주간의 강화 학습 중단은 이에 대한 답이 될 수 없습니다. 준비성 PDF를 다시 작성하는 것도 마찬가지입니다.

모델이 이미 사람 개입 없이 강화된 시스템에서 제로데이를 식별할 수 있다면, 공론은 더 이상 "연구소들이 책임질지 두고 보자"가 아닙니다. 그들은 내부에서 책임 있는 모습이 무엇인지 이미 보여주었습니다. 테스트베드를 격리하고, 모니터를 작동시키며, 새 기준에 미달한 실행을 일시 중단하고 나머지 일정은 그대로 진행하는 것입니다.

법은 일정이 하지 못하는 부분을 수행해야 합니다. 검증 가능한 규칙으로 초지능 최종 상태를 영구 금지하십시오. 다른 이중 용도 경쟁이 자제만으로는 한계에 이르렀을 때 그렇게 봉쇄되었던 것처럼 말입니다. 해당 규칙을 만드는 사람들에게 연락하십시오. 다음번에 기업이 또 다른 임계값을 배제할 수 없다고 밝히는 메모를 기다리지 마십시오.