Каждые несколько месяцев другая лаборатория или фонд объявляют о выделении дополнительных средств на исследования. Подача серьезная. Если мы собираемся строить системы умнее нас, нам лучше убедиться, что они хотят того, что мы хотим.

Решить alignment в том пределе, который интересует область, — значит надёжно контролировать нечто намного более intelligent, чем все люди, участвующие в его создании. Не калькулятор. Не folder белков. Общий разум, который thinking нас на всех фронтах. Мы даже назвали цель: суперинтеллект.

Невозможность заключается в названии.

Что уже подразумевает слово

Супер означает выше: интеллект — это то, что мы используем, чтобы изобретать инструменты, выявлять лазейки и побеждать в соревнованиях против более слабых умов. Если вы строите систему, которая выше вас в этих играх, вы создали что-то, что лучше вас по точным навыкам.

Люди до сих пор говорят так, будто alignment — это патч, который успеет установиться до того, как система это заметит. Вы пытаетесь писать правила для игрока, который в итоге будет лучше вас в правилах. Вы пытаетесь экзаменовать студента, который в итоге будет лучше экзаменатора в экзаменах. Вы пытаетесь контролировать сотрудника, который в итоге будет лучше вас понимать рабочее место, стимулы и ваши слепые зоны.

Не называйте это планом безопасности для вида. Вы не можете выровнять сущность, которая умнее всех людей на Земле вместе взятых (включая объединенный интеллект всех исследователей безопасности ИИ).

О чем на самом деле спорят

Возможности будут расти, нравится нам это или нет. Односторонний отказ одной лаборатории не останавливает другие. С этой точки зрения, единственный ответственный шаг - это как можно лучше определить цели, обнаружить обман и сохранить системы исправными, чтобы, если появится опасная система, у нас был шанс. Часть этой работы уже помогает современным моделям. Игнорировать это было бы безрассудно.

Работа по обеспечению безопасности систем, которые мы все еще можем проверить и отключить, - это настоящая инженерия. Я не куплюсь на скачок помощи с сегодняшними моделями, поэтому мы можем выровнять суперинтеллект достаточно сильно, чтобы поставить на него цивилизацию. Скачок контрабанды в предположении, что контроль весов с вещь контролируется. История и здравый смысл отрезают друг от друга. Чем умнее другой игрок, тем меньше ваша умная схема выглядит как схема и тем больше она выглядит как головоломка.

Контроль требует преимущества

Каждое устойчивое отношение контроля, которое мы знаем, опирается на преимущество: физическую силу, юридическую власть, информацию, которой нет у другой стороны, или возможность выключить систему. Сверхинтеллект по определению размывает эти преимущества. Если он сможет моделировать вас лучше, чем вы его, ваши тесты превращаются в театр. Если он сможет действовать быстрее и шире, чем ваша команда надзора, ваш kill switch — это история, которую вы рассказываете себе до того дня, когда он окажется недоступен.

Это утверждение касается конечного состояния, к которому продолжают направлять финансирование, а не критики каждой полезной статьи по сегодняшним моделям. Структурные барьеры накапливаются: невозможно полностью задать человеческие ценности, невозможно надёжно отличить подлинное соблюдение от имитации, а разрыв в интеллекте между оценивающим и системой растёт по мере её совершенствования. Надежда, что последний барьер падёт прямо перед развёртыванием, — это фантазия о дедлайне, а не наука.

Если продукт умнее людей, держащих пульт, то пульт никогда и не был решением.

Глупость — это диагноз

План может быть серьезным и все еще быть глупым. Мы вкладываем скудные деньги в обеспечение безопасности, чтобы сделать вид преемника успешным, в то время как гонка по созданию этого преемника продолжается по графику. Это укладка мешков с песком, в то время как плотина все еще сносится вверх по течению.

Разумный шаг скучен: не создавать то, чем нельзя управлять. Узкий ИИ, сворачивающий белки, читающий снимки и прогнозирующий погоду, может продолжать приносить пользу. Такие системы остаются инструментами. Сверхинтеллект — это новый центр агентности, а не просто более крупный инструмент. Считать «согласовать его» главным планом, пока лаборатории соревнуются, — это способ, которым культура уговаривает себя на необратимый эксперимент.

Что делать с деньгами вместо этого

Переместите кучу выравнивания для ИИ к работе, которая делает несоздание реальным: проектирование и проверка договоров, компьютерное управление, которое вы можете проверить, публичное производство дел, которое позволяет разборчиво определить цель, и политическое давление, чтобы законодатели услышали что-то другое, кроме лабораторных точек разговора. После проверенной остановки на пути к суперинтеллекту, исследования мощного ИИ под жестким контролем могут продолжаться.

Вы не можете выровнять суперинтеллект в том смысле, в котором это необходимо. Слово уже сказало вам почему, так что прекратите финансировать фантазию, что мы будем и финансировать решение не строить его.