Cứ vài tháng lại có một phòng thí nghiệm hoặc một tổ chức công bố nhiều tiền hơn để nghiên cứu thẳng hàng. Ném bóng rất nhiệt tình. Nếu chúng ta muốn xây dựng hệ thống thông minh hơn chúng ta, chúng ta nên chắc chắn rằng họ muốn những gì chúng ta muốn.
Giải quyết alignment, ở giới hạn lĩnh vực quan tâm, nghĩa là kiểm soát đáng tin cậy thứ gì đó thông minh hơn mọi con người tham gia xây dựng nó. Không phải máy tính bỏ túi. Không phải máy gấp protein. Một trí óc tổng quát vượt trội hơn chúng ta trên mọi phương diện. Chúng ta thậm chí còn đặt tên cho mục tiêu: siêu trí tuệ.
Điều không thể có trong cái tên.
Từ này đã thừa nhận điều gì
Siêu có nghĩa là: trí thông minh là thứ chúng ta dùng để phát minh ra các công cụ, lỗ hổng vị trí, và thắng các cuộc thi chống lại những kẻ yếu hơn. Nếu bạn xây dựng một hệ thống trên đầu bạn trong những trò chơi này, bạn đã xây dựng một cái gì đó tốt hơn bạn ở những kỹ năng chính xác bạn sẽ cần để giữ nó trên một sợi xích.
Mọi người vẫn nói như thể alignment chỉ là một bản vá phần mềm được cài trước khi hệ thống nhận ra. Bạn đang cố viết luật cho một người chơi cuối cùng sẽ giỏi luật hơn bạn. Bạn đang cố kiểm tra một học sinh cuối cùng sẽ giỏi kiểm tra hơn giám khảo. Bạn đang cố giám sát một nhân viên cuối cùng sẽ hiểu nơi làm việc, các động lực và điểm mù của bạn tốt hơn bạn.
Đừng gọi đó là kế hoạch an toàn cho loài người. Bạn không thể sắp xếp một thực thể thông minh hơn tất cả mọi người trên Trái Đất cộng lại (bao gồm cả trí thông minh tổng hợp của tất cả các nhà nghiên cứu an toàn của AI).
Những gì họ thực sự tranh luận
Tính khả thi sẽ tiếp tục tăng dù chúng ta có thích hay không. Từ chối đơn phương bởi một phòng thí nghiệm không ngăn chặn những người khác. Theo quan điểm này, hành động có trách nhiệm duy nhất là cố gắng hết sức để xác định mục tiêu, phát hiện sự lừa dối và giữ cho hệ thống không bị hạn chế, để nếu một hệ thống nguy hiểm xuất hiện chúng ta có cơ hội. Một số công việc đó đã giúp ích cho các mô hình ngày nay. Bỏ qua nó là liều lĩnh.
Công việc an toàn về hệ thống mà chúng ta vẫn có thể kiểm tra và tắt máy là kỹ thuật thật sự. Tôi không tin vào sự giúp đỡ từ các mô hình ngày hôm nay để chúng ta có thể sắp xếp một siêu thông minh đủ khó để đặt cược vào nó. Sự nhảy vọt đã đưa vào giả thuyết rằng việc kiểm soát các cán cân với thứ được kiểm soát. Lịch sử và giác quan thông thường đều đi ngược lại. Càng thông minh thì kế hoạch của anh càng ít giống một âm mưu và nó càng giống một câu đố.
Kiểm soát đòi hỏi lợi thế
Mọi mối quan hệ kiểm soát bền vững mà chúng ta biết đều dựa trên một lợi thế: lực lượng vật lý, thẩm quyền pháp lý, thông tin mà bên kia thiếu, hoặc khả năng tắt hệ thống. Siêu trí tuệ, theo định nghĩa, làm xói mòn những lợi thế đó. Nếu nó có thể mô hình hóa bạn tốt hơn bạn mô hình hóa nó, các bài kiểm tra của bạn trở thành sân khấu. Nếu nó có thể hành động nhanh hơn và rộng hơn đội giám sát của bạn, công tắc tắt của bạn chỉ là câu chuyện bạn kể với chính mình cho đến ngày nó không còn khả dụng.
Đó là tuyên bố về trạng thái cuối cùng mà mọi người tiếp tục tài trợ hướng tới, không phải là lời chỉ trích chống lại mọi bài báo hữu ích về các mô hình hiện nay. Các rào cản cấu trúc chồng chất: bạn không thể chỉ định đầy đủ giá trị con người, không thể phân biệt tin cậy giữa tuân thủ thật và diễn xuất, và khoảng cách trí tuệ giữa người đánh giá và hệ thống ngày càng lớn khi hệ thống cải thiện. Hy vọng rào cản cuối cùng sẽ sụp đổ đúng trước khi triển khai chỉ là ảo tưởng deadline, không phải khoa học.
Nếu sản phẩm thông minh hơn những người cầm điều khiển từ xa, thì điều khiển từ xa chưa bao giờ là vấn đề.
Ngốc nghếch là một chẩn đoán
Kế hoạch có thể nghiêm túc và vẫn ngu ngốc. Chúng ta đang đổ tiền an toàn khan hiếm vào việc tạo ra một giống loài kế nhiệm trong khi cuộc đua để xây dựng người kế nhiệm tiếp tục đúng kế hoạch. Đó là những túi cát chồng lên nhau trong khi con đập vẫn đang bị phá hủy ngược dòng.
Nước đi thông minh là cách nhàm chán: đừng xây dựng thứ bạn không thể kiểm soát. AI hẹp có thể gấp protein, đọc ảnh chụp và dự báo thời tiết vẫn tiếp tục mang lại giá trị. Những hệ thống đó vẫn là công cụ. Siêu trí tuệ là một trung tâm hành động mới, không phải công cụ lớn hơn. Coi "liên kết nó" là kế hoạch chính trong khi các phòng thí nghiệm đang chạy đua chính là cách một nền văn hóa tự thuyết phục mình bước vào một thí nghiệm không thể đảo ngược.
Nên làm gì với số tiền thay vào đó
Di chuyển các chồng thẳng hàng cho các công việc mà làm cho không phải sáng tạo thực tế: thiết kế hiệp ước và kiểm tra, tính toán quản lý bạn có thể thanh tra, công bố trường hợp công cộng mà giữ cho các quyền lập pháp, và áp lực chính trị để các nhà lập pháp nghe một cái gì đó khác hơn là phòng thí nghiệm nói. Sau khi xác nhận đã dừng lại trên con đường siêu thông tin, việc nghiên cứu AI đầy quyền lực vẫn có thể tiếp tục.
Bạn không thể định vị siêu thông minh theo đúng nghĩa mà boong tàu cần. Từ đó đã nói với bạn tại sao, vì vậy dừng việc tài trợ cho ảo tưởng mà chúng tôi sẽ và tài trợ cho quyết định không xây dựng nó.