앤트로픽의 2026년 8월 위험 보고서는 연구소가 스스로를 평가한 186쪽 분량이다. 조사 기준일은 7월 15일이다. 회사 책임 확장 정책 3.4판에 따라 전체 치명적 오정렬 위험 평가는 기존 최저 등급에서 낮음으로 변경됐다. 이유는 최근 사이버보안 사고 공개 이후 불확실성과, 모델이 자동 연구·공학 작업을 가속하는 초기 징후 때문이며, 내부 정렬에 대한 새로운 증거가 나온 것은 아니다.

앤트로픽가 여전히 조심스럽다는 헤드라인만 원하신다면 놓칠 수 있습니다. 다시 읽어보세요. 안전 브랜드 연구소는 자체적으로 치명적인 위험 라벨을 올렸으며 같은 문서에서 전반적인 개발 속도를 늦추지 않는다고 말했습니다.

모형 2는 일에 이미 입니다

보고서는 미공개 Mythos급 시스템인 Model 2를 언급했다. 앤트로픽은 이 시스템이 내부 업무에서 Mythos 5보다 눈에 띄는 개선을 보이며, 자체 비공개 능력 지수에서 약 1.5점 높고, Opus 4.6에서 Mythos로의 도약 수준은 아니라고 설명했다. 현재 공개 계획은 없다. 전체 배포 전 평가를 아직 마치지 않아, 회사 스스로도 Mythos 5만큼 성능을 확신하지 못한다.

CoBench에서 앤트로픽 직원이 나중에 해결한 실제 공학 문제 449개를 대상으로 Model 2는 62.8%를 기록했다. Mythos 5는 50.3%, Mythos Preview는 54.8%였다. 앤트로픽이 자체 추정한 연구 인력 대체 수준은 최소 85%다. Model 2는 아직 그 수준이 아니다. 그러나 직전 내부 최고 모델과의 두 자릿수 격차를 한 번에 좁혔다. 그것도 연구소가 직접 만든 과제에서였다.

Mythos 5와 Model 2는 앤트로픽 내부 연구·공학 업무에 광범위하게 사용되며, 대화형으로도, 지속형 에이전트 배포 형태로도 활용된다. 현재 클로드가 생산 코드베이스에 병합되는 코드의 대다수를 작성한다.

앤트로픽 · Risk Report August 2026

yardstick는 자체를 사용

자동화된 AI R&D에, 보고는 아직도 낮게 전반적인 위험을 평가합니다. 그런 다음이 회사는 이전 보고서보다 등급이 더 적은 것을 말한다. 대부분의 콘크리트 작업 기반 평가가 포화되어 있기 때문에. 그들은 더 이상 기능을 캡처하지 않습니다. 실험실은 또한 가속의 초기 징후를보고있다.

다음 점프를 보지 못하는 테스트는 숫자가 붙은 사각지대다. 앤트로픽은 기존 평가 세트 일부를 CoBench로 교체했는데, 이는 최소한 실제 내부 문제들로 구성된 집합이다. 그곳에서도 직원 대체 기준은 85퍼센트에 머물러 있고, Model 2는 공개 이름 없이 이미 62.8을 기록했다.

어떤 withhold는 하지 않습니다.

Model 2를 API에서 배제하는 것은 더 강력한 모델을 경쟁에서 배제하는 것과 같지 않다. 보고서는 두 개의 가장 강력한 시스템이 이미 지속적으로 작동하는 에이전트를 포함해 내부에서 많이 사용되고 있다고 밝힌다. 출시되는 코드는 회사 표현대로 이제 대부분 클로드가 작성한다.

일반적인 해석은 신중한 연구소가 선을 지켰다는 것이다

앤트로픽은 모델 2를 배하지 않았다. 그것은 긴 보고서를 출판하고 위험 중독을 제기. 같은 8 월, OpenAI는 Astra 후에 몇몇 국경 훈련을 paused, 그리고 앤트로픽 its는 그것의 자신의 safeguards는 일시 중지를 필요로 하지 않았다. 외부에서 성인 감독처럼 보입니다. 문서 내부에서 더 이상 그 일을 측정 할 수없는 회사와 같고, 자체 작업에 더 강한 시스템을 사용하여, 작업을 느리고.

악당 없이도 인센티브만으로 설명된다. 경쟁사가 멈추지 않는데 한 연구소가 멈추면 다음 모델, 다음 계약, 다음 기업 가치를 잃는다. 자체 평가 정책은 그 압력을 견디도록 설계됐다. 보고서와 이름 비공개, 이전 최저 등급에서 낮음으로 한 단계 상향 조정은 나오지만, 중단은 나오지 않는다.

법의 제기, 형용사

나카다 재단은 사내 위험 등급 상향을 해결책으로 보지 않는다. 인공 초지능은 결코 만들어져서는 안 된다. 초지능은 인간이 통제할 수 없다. 코드를 작성하는 직원들이 이미 클로드가 대부분 작성하는 것을 지켜보고 있다면, 남은 인간의 역할은 테스트가 더 이상 명확히 볼 수 없는 시스템에 대한 축소된 검토 단계일 뿐이다.

평가를 공개하고 싶다면 공개하라. 가중치를 숨기고 싶다면 숨겨라. 어느 쪽도 구속력 있는 금지를 대신할 수 없다. 8월 보고서는 솔직하다는 점에서 유용하다. 그 솔직함을 위안이 아니라 증거로 받아들여라.