每隔几个月,另一个实验室或基金会会宣布更多的资金用于校正研究. 投出是真诚的。 如果我们要建立比我们更聪明的系统, 我们最好确保他们想要的东西。

在该领域关心的极限上,解决对齐意味着可靠控制比参与构建的每位人类都聪明得多的东西。不是计算器。不是蛋白质折叠器。而是在各方面都比我们更会思考的通用心智。我们甚至给目标起了名字:: 超级智能.

无法做到的就是这个名字。

这个词已经承认的内容

以上"超级"的意思:智能是我们用来发明工具,发现漏洞,并赢得对弱智的竞争. 如果你在那些游戏上建立了一个系统, 你创造了一个比你更好的东西, 用你需要的技能来保持它。

人们仍像谈论对齐是一个在系统注意到前落地的软件补丁。你在试图为最终比你更懂规则的玩家制定规则。你在试图考查最终比考官更擅考试的学生。你在试图监督最终比你更了解职场、激励与你盲点的员工。

不要称之为该物种的安全计划。 你不能把一个比地球上所有人类加起来更聪明的实体(包括所有AI安全研究者的综合智能)联系起来.

他们到底在争论什么

无论我们喜不喜欢 能力都会不断提高 一个实验室的单方面拒绝并不能阻止其他实验室。 从这个观点来看,唯一负责的举动是尽可能地做到明确目标,侦测欺骗,使系统坚固,这样,如果出现危险的系统,我们就有机会. 其中一些工作已经有助于当今的模型。 忽略它会是鲁莽的。

系统的安全工作 我们仍然可以检查和关闭 是真正的工程。 我从今天的模型的帮助中买不到这个飞跃,因此我们可以把一个足以打赌文明的超级智能联系起来。 飞跃的假想是 控制范围与控制的东西。 历史和常识都截然相反。 另一个玩家越聪明,你越聪明的计谋看起来越像个计谋,越像个谜题.

控制需要占据上风

我们所知的每一种持久控制关系都依赖优势:物理力量、法律权威、对方缺乏的信息,或关闭系统的能力。超级智能按定义会侵蚀这些优势。如果它能比你更好地建模你,你的测试就成了表演。如果它能比你的监督团队更快、更广地行动,你的关机开关就只是你讲给自己的故事,直到某天它不再可用。

这一主张针对的是人们持续资助的最终状态,而非反对当今模型所有有用论文的简短陈述。 结构性障碍堆积: :你无法完整指定人类价值观,无法可靠区分真实合规与表演性合规,而且评估者与系统之间的智能差距会随系统进步而扩大。指望最后一道屏障在部署前一刻自行消失,这是截止日期幻想,而非科学。

如果产品比握遥控器的人还聪明,那遥控器从来就不是重点。

愚蠢是一种诊断

计划可以是认真的,还是愚蠢的. 我们正投入稀少的安全资金,使一个继承物种发展顺利,而建设该继承人的竞赛继续如期进行。 这是堆放沙袋,而水坝仍在被拆除。

明智之举是无聊的:不要建造你无法控制的东西。能折叠蛋白质、阅读扫描、预测天气的狭义 AI 可以继续交付。这些系统仍是工具。超级智能是一个新的能动性中心,而非更大的工具。在实验室竞逐时把“对齐它”当作主要计划,是文化如何说服自己进行不可逆实验的方式。

用这些钱做别的什么

将“超级智能”的组合推向让非创造成为现实的工作:条约设计和核查、计算治理,你可以检查、公开立案,使目标清晰可见,以及政治压力,使立法者听到的不是实验室的谈话点。 在经过核实的停止了通向超级智能的路径后,可以在严密控制下继续研究强大的AI.

从投球甲板需要的意义上讲,你无法对准超智能. 这个词已经告诉你为什么了, 所以停止资助我们的幻想 并资助决定不建造它。