Каждые несколько месяцев другая лаборатория или фонд объявляют о выделении дополнительных средств на исследования. Подача серьезная. Если мы собираемся строить системы умнее нас, нам лучше убедиться, что они хотят того, что мы хотим.
Решить alignment в том пределе, который интересует область, — значит надёжно контролировать нечто намного более intelligent, чем все люди, участвующие в его создании. Не калькулятор. Не folder белков. Общий разум, который thinking нас на всех фронтах. Мы даже назвали цель: суперинтеллект.
Невозможность заключается в названии.
Что уже подразумевает слово
Супер означает выше: интеллект — это то, что мы используем, чтобы изобретать инструменты, выявлять лазейки и побеждать в соревнованиях против более слабых умов. Если вы строите систему, которая выше вас в этих играх, вы создали что-то, что лучше вас по точным навыкам.
Люди до сих пор говорят так, будто alignment — это патч, который успеет установиться до того, как система это заметит. Вы пытаетесь писать правила для игрока, который в итоге будет лучше вас в правилах. Вы пытаетесь экзаменовать студента, который в итоге будет лучше экзаменатора в экзаменах. Вы пытаетесь контролировать сотрудника, который в итоге будет лучше вас понимать рабочее место, стимулы и ваши слепые зоны.
Не называйте это планом безопасности для вида. Вы не можете выровнять сущность, которая умнее всех людей на Земле вместе взятых (включая объединенный интеллект всех исследователей безопасности ИИ).
О чем на самом деле спорят
Возможности будут расти, нравится нам это или нет. Односторонний отказ одной лаборатории не останавливает другие. С этой точки зрения, единственный ответственный шаг - это как можно лучше определить цели, обнаружить обман и сохранить системы исправными, чтобы, если появится опасная система, у нас был шанс. Часть этой работы уже помогает современным моделям. Игнорировать это было бы безрассудно.
Работа по обеспечению безопасности систем, которые мы все еще можем проверить и отключить, - это настоящая инженерия. Я не куплюсь на скачок помощи с сегодняшними моделями, поэтому мы можем выровнять суперинтеллект достаточно сильно, чтобы поставить на него цивилизацию. Скачок контрабанды в предположении, что контроль весов с вещь контролируется. История и здравый смысл отрезают друг от друга. Чем умнее другой игрок, тем меньше ваша умная схема выглядит как схема и тем больше она выглядит как головоломка.
Контроль требует преимущества
Каждое устойчивое отношение контроля, которое мы знаем, опирается на преимущество: физическую силу, юридическую власть, информацию, которой нет у другой стороны, или возможность выключить систему. Сверхинтеллект по определению размывает эти преимущества. Если он сможет моделировать вас лучше, чем вы его, ваши тесты превращаются в театр. Если он сможет действовать быстрее и шире, чем ваша команда надзора, ваш kill switch — это история, которую вы рассказываете себе до того дня, когда он окажется недоступен.
Это утверждение касается конечного состояния, к которому продолжают направлять финансирование, а не критики каждой полезной статьи по сегодняшним моделям. Структурные барьеры накапливаются: невозможно полностью задать человеческие ценности, невозможно надёжно отличить подлинное соблюдение от имитации, а разрыв в интеллекте между оценивающим и системой растёт по мере её совершенствования. Надежда, что последний барьер падёт прямо перед развёртыванием, — это фантазия о дедлайне, а не наука.
Если продукт умнее людей, держащих пульт, то пульт никогда и не был решением.
Глупость — это диагноз
План может быть серьезным и все еще быть глупым. Мы вкладываем скудные деньги в обеспечение безопасности, чтобы сделать вид преемника успешным, в то время как гонка по созданию этого преемника продолжается по графику. Это укладка мешков с песком, в то время как плотина все еще сносится вверх по течению.
Разумный шаг скучен: не создавать то, чем нельзя управлять. Узкий ИИ, сворачивающий белки, читающий снимки и прогнозирующий погоду, может продолжать приносить пользу. Такие системы остаются инструментами. Сверхинтеллект — это новый центр агентности, а не просто более крупный инструмент. Считать «согласовать его» главным планом, пока лаборатории соревнуются, — это способ, которым культура уговаривает себя на необратимый эксперимент.
Что делать с деньгами вместо этого
Переместите кучу выравнивания для ИИ к работе, которая делает несоздание реальным: проектирование и проверка договоров, компьютерное управление, которое вы можете проверить, публичное производство дел, которое позволяет разборчиво определить цель, и политическое давление, чтобы законодатели услышали что-то другое, кроме лабораторных точек разговора. После проверенной остановки на пути к суперинтеллекту, исследования мощного ИИ под жестким контролем могут продолжаться.
Вы не можете выровнять суперинтеллект в том смысле, в котором это необходимо. Слово уже сказало вам почему, так что прекратите финансировать фантазию, что мы будем и финансировать решение не строить его.