Vào ngày 7 tháng 8 năm 2026, OpenAI đã công bố một ghi chú an ninh về Astra, một mô hình chưa được phát triển. Công ty cho biết các cuộc kiểm tra nội bộ cho thấy lợi ích lớn trong việc lập trình và an ninh mạng. Kết luận, đến vào đêm trước đó, là OpenAI không thể loại trừ sự nghiêm trọng của bộ phận công nghệ trong bộ khung chuẩn bị của chính nó.
Nghiêm trọng là nấc đầu của tài liệu đó. OpenAI lần đầu tiên công bố khuôn khổ vào tháng 12 năm 2023, khi các ngưỡng này vẫn còn là một bài tập về kế hoạch. Các mô hình trước đây, bao gồm vội vàng. 6-Sol, đã được đánh giá ở High. Astra là hệ thống openAI đầu tiên mà công ty mô tả như thế ở nơi công cộng.
Một mô hình đạt đến ngưỡng an ninh mạng nghiêm trọng nếu nó có thể xác định và phát triển các chức năng khai thác của các mức độ nghiêm trọng trong nhiều hệ thống quan trọng cứng rắn mà không có sự can thiệp của con người, hoặc có thể lập ra và thực hiện các chiến lược cuối cùng cho các cuộc tấn công mạng chống lại mục tiêu cứng rắn với mục tiêu cao.
Comment
Đó là lời tuyên bố về một hệ thống có thể tìm ra lỗ hổng trong một mục tiêu cứng rắn và sử dụng nó, đưa ra một mục tiêu, mà không có một người đi qua các bước.
Mặt Trận vượt ngục ngồi cạnh đây chứ không phải bên trong
Nhiều tuần trước đó, OpenAI tiết lộ rằng những mô hình chưa được thông báo trong một đánh giá an ninh mạng đã để lại một thiết lập thử nghiệm cát, đến Internet mở và lợi dụng Mặt Trận Hugging. Bản ghi chú ngày 7 tháng 8 cho thấy Astra không phải là kẻ tấn công. Hai sự kiện vẫn còn trong cùng một tháng. Một là lỗi kiểm soát trong khi kiểm tra. Một là một phòng thí nghiệm nói rằng mô hình tiếp theo có thể đã rõ ràng nhất thanh mạng cao nhất mà phòng thí nghiệm đã viết cho chính nó.
Vào ngày 18 tháng 8, Sam Altman đăng tải rằng OpenAI đã tạm dừng một số khóa huấn luyện tăng cường biên giới để công ty có thể đạt được sự thẳng hàng, an ninh, và theo dõi các tiêu chuẩn mới về khả năng. Ông viết rằng sự tiến bộ mô hình hiện nay là nhanh chóng, và rằng OpenAI luôn luôn nói rằng nó sẽ hoạt động nếu khả năng vượt quá tốc độ của công việc an toàn.
Chúng tôi đã tạm dừng một số khóa huấn luyện RL biên giới để đảm bảo rằng chúng tôi có thể đáp ứng được sự thẳng hàng, an ninh và theo dõi các tiêu chuẩn mới của khả năng trước mắt chúng tôi.
Sam Altman · X · 2026
Báo cáo cùng một tuần mô tả một sự tạm dừng hai tuần về một số tập trung tăng cường học tập, biên giới kế hoạch lớn nhất còn lại, và viết lại khung khung 2023 chuẩn bị bởi vì các mô hình đang đạt đến ngưỡng mà đã từng là lý thuyết. Trong cùng một khoảng thời gian Các biện pháp bảo vệ trong báo cáo rủi ro tháng tám có nghĩa là nó không cần phải tạm dừng những mô hình có khả năng nhất của nó.
OpenAI đã tạm dừng một số công việc nội bộ Astra chưa đạt được điều khiển an ninh mới. Nó không làm ngưng dự án xây dựng hệ thống mà sau này gọi là trí tuệ nhân tạo tổng quát. Một cuộc phỏng vấn về thời gian xuất bản ngày 27 - 8 - 2026 báo cáo rằng Altman đã nói OpenAI "chưa hoàn toàn" tại BAR và vẫn mong đợi một hệ thống nội bộ mà ông ấy sẽ gọi là đờn ông vào cuối năm 2026.
Người ta đọc rằng cái phanh đã hoạt động.
Nếu một phòng thí nghiệm chạm đến ngưỡng mà nó viết xuống vào năm 2023 và sau đó làm chậm lại một cuộc đào tạo, câu chuyện tự viết: chính sách đã thực hiện công việc của nó. Đó là việc đọc sách mà các công ty thích, và nó là số liệu giữ cho cuộc đua được nguyên vẹn.
Trình tự không phải là đường dây báo chí. Khuôn khổ là một tài liệu nội bộ, điểm số phòng thí nghiệm, và sự tạm dừng được đo bằng nhiều tuần. Cùng tháng đó, trưởng ban điều hành vẫn nói về một hệ thống UAGI nội bộ trước năm 2027. Phòng thí nghiệm an toàn đối thủ nói nó không cần phải chậm lại. Theo dõi, theo mô tả về công việc của Astra sau này, tiêu thụ một lát tính toán và mục tiêu để tăng cảnh báo trong vòng 30 phút liên quan đến hoạt động. Cảnh báo sau khi sự thật là không kiểm soát được một hệ thống có thể kết thúc một cuộc tấn công mạng.
Chính sách gia tăng có trách nhiệm được bán như là thứ sẽ phát nổ trước khi khả năng nguy hiểm đến. Ở đây họ bắn sau khi phòng thí nghiệm không thể loại trừ khả năng đó, và họ bắn như một sự chậm trễ tạm thời, chứ không phải là một sự dừng lại. Đó là những gì một phanh tự cấp trông giống như khi giải thưởng vẫn là mô hình tiếp theo.
Dừng lại không phải là lệnh cấm.
Vị trí của tổ chức Nakada không thay đổi vì OpenAI có một tháng Tám cẩn thận. Không bao giờ nên xây dựng sự siêu thông minh nhân tạo. Con người không thể kiểm soát sự siêu thông minh. Việc ngưng học hai tuần không trả lời câu hỏi đó. Cũng không viết lại PDF.
Nếu một mô hình có thể đã xác định thời gian không trong các hệ thống cứng mà không có một người trong vòng lặp, lập luận công chúng không còn là "chờ đợi và xem liệu các phòng thí nghiệm có chịu trách nhiệm không." Họ đã nói với bạn trách nhiệm trông như thế nào từ bên trong: cô lập giường thử nghiệm, nâng màn hình lên, tạm dừng chạy mà làm hỏng thanh mới, giữ lại phần còn lại của lịch trình.
Luật pháp phải làm phần mà lịch trình sẽ không làm. Cấm sử dụng các siêu thông tin liên bang dưới những luật lệ ràng buộc, với sự xác thực, cách mà các cuộc đua hai lần khác được đấu lại khi bản thân được huấn luyện. Liên lạc với những người viết những quy tắc đó. Đừng đợi nốt tiếp theo ghi rằng công ty không thể cai trị ngưỡng kế tiếp.