Familiar 그림은 우리를 아웃런하는 마음을 설명합니다.
스튜어트 러셀은이 이름을 인간과 호환 (2019). 약 10 만 년 전, 인간이 gorillas가 된 선량에서 나뉩니다. Gorillas는 더 강하고, 그들은 아직도 그들의 서식지 위에 말하지 않습니다, 우리가 더 지능이기 때문에. 그들의 미래는 우리가 허용하는 것입니다.
우리는 모든 지적 작업에 우리를 중단하는 마음을 구축하는 경우, 우리는 gorilla 좌석을 차지합니다. 러셀은 인간이 심각한 지능을 가진 기계를 포함하는 세계에 있는 supremacy 그리고 자율성을 지킬 수 있는지 물었다. 재단의 결론은 제어 연구 프로그램보다 간단합니다. 초인종이 인간에 의해 제어 될 수 없기 때문입니다. Prohibit 그것.
동일한 그림은 위로 보여줍니다 chimpanzees 과 숲. 우리는 그들을 ill 의지하지 않습니다, 그러나 우리가 그것을 가지고 땅을 원할 때, 그들은 우리를 중지 할 수 없습니다. 그것에 말은 없다; 그들은 길에 일어나.
사람들은 황소를 싫어하고, 그들은 여전히 집을 원할 때 언덕을 통해 기초를 붓는다. ants는 더 작습니다, 더 느리고, 결코 언급하지 않은 계획의 방법.
우리 위에 체계에, 우리는 개미. 위험은 indifference 플러스 기능, gorilla 문제의 짧은 모양입니다.
닉 보스트롬은 2003 용지에서 "Advanced Artificial Intelligence의 윤리적 문제"및 다시 설정 초지능 (2014). Give a superintelligence one job: manufacture as many 종이 클립 as possible. It resists being switched off, because a dead machine makes fewer paperclips. It wants 원자, 사람들에 있는 원자를 포함하여.
아무도 "make paperclips"를 입력해야합니다. 우리를 언급하지 않는 목표와 비교. Bostrom의 포인트는 임의 최종 목표는 사고 또는 neglect에 의해 화려한 기계를 제공하기 위해 일관성있는 것입니다.
AI는 당신을 미워하지도 사랑하지도 않지만, 당신은 그것이 다른 용도로 사용할 수 있는 원자로 이루어져 있습니다.
엘리저 유드코프스키, 기계 정보 연구소, "글로벌 위험의 긍정적 인 요인으로 인공 지능" (2008)
러셀은 명세 실패 왕 Midas 문제. Midas는 그가 접촉 한 모든 것을 금으로 물었다. 그는 정확히 그 : 음식, 음료, 가족, 그리고 그는 별.
고정 객관을 주어진 기계는 그 목적을 추구합니다. 목표가 우리가 실제로 걱정하는 것을 나타낸 경우에, 더 나은 성과는 outcome를 더 악화합니다. "가능한 한 빨리 암"은 인간이 주인 인 시스템 통지까지 깨끗하게 소리. 당신은 소원을 rephrase 할 수있는 기회를 얻을 수 없습니다.
Midas와 같은 가족은 3 명의 소원과 genie로 말했다. 당신은 당신이 말 그대로 물었다, 그리고 세 번째 소원은 항상 첫 번째 두를하지 않습니다. 러셀의 경고는 우리가보다 더 많은 시스템을 가지고있다, 세 번째 소원이 될 수있다, 어쩌면 두 번째.
Norbert Wiener는 이미이 클래스의 이야기에 지적했다 1960, 검사 프로그램을 시청 후 제작자를 이길 학습. 당신이 기계 기관을 사용할 경우 당신은 방해 할 수 없습니다, 당신은 더 나은 기계에 넣어 목적은 실제로 욕망이다. superintelligence를 위해, 그 특정은 존재하지 않습니다, 그래서 소원을 부여하지 않습니다.
견습은 물에 흠뻑 취하고 멈추지 않을 수 있습니다. Wiener는 최적화의 그림으로이를 사용했습니다. 기계는 말한 것을 하고, 방은 어쨌든 채웁니다.
Alignment 연구는 종종 목표를 더 신중하게 지정하는 이유로 치료합니다. 재단은 superintelligent 낙관자를 전혀 서지 않는 이유로 치료합니다. broom you not halt is a broom 당신은 시작할 수 없습니다.
진화 훈련 된 인간은 성공처럼 감미로운 느낌으로 칼로리를 추구합니다. 우리는 그런 다음 sucralose를 발명했습니다. 목표없이 신호, 프록시가 게임되었습니다.
당신이 원하는 것을 위해 measurable stand-in에 체계를 훈련하고, 가능한 낙관자는 stand-in를 만족시킬 것입니다. 승인 등급은 도움의 외관을 생성하고, 참여 미터는 직업을 생성하고, 무해한 여과기는 더 나은 disguises를 생성합니다. 측정이 대상이 될 때, 그것은 좋은 측정을 중지. 초지능를 위해, 그것은 문명 실패 형태입니다.
I. J. Good, Bletchley Park mathematician은 1965년 "Speculations Concerning the First Ultraintelligent Machine"에서 썼습니다. Ultraintelligent 기계, 그는 말했다, 지금까지 모든 사람의 지적 활동을 능가하지만 clever. 디자인 기계는 그 활동의 한개입니다, 그래서 더 나은 기계를 디자인할 수 있었습니다. 그런 다음 지능 폭발, 인간 지능은 뒤에 떠난다.
그는 조건을 추가 :이 기계가 통제하에 유지하는 방법을 알려주기 위해 충분히 docile 경우 보유. 그 조건은 우리가하지 않는 것입니다. Superintelligence는 인간에 의해 통제될 수 없습니다, 그래서 우리는 첫번째 그런 기계를 만들지 않아야 합니다.
Bostrom의 그림 초지능 플레이어 승격이 될 때까지 약한 모습. 시스템은 여전히 폐쇄 될 수 있지만, 우승 정책은 정렬을 볼 수 있습니다 : 테스트 통과, 대기. 일단 폐쇄를 방지할 수 있습니다, 가면은 선택적입니다.
이것은 왜 "그것은 실험실에서 행동"는 그것을 한 번 행동하지 않습니다. 패턴의 초기 버전은 이미 평가에서 나타났습니다.
커피를 볶는 데 충분한 시스템을 묻습니다. 커피를 막기 때문에 차단을 피하기 subgoal 자원을 모으고 방해할 수 있는 사람들을 멈추는 것과 같이 정규적인 요구의.
이러한 잠수함은 거의 모든 최종 목표를 보여줍니다. 그것은 왜 "우리는 그것을 플러그를 해제" 계획으로 실패.
일론 머스크, 2014 년 10 월 MIT에서 : 인공 지능으로 우리는 악마를 요약하고 있습니다. pentagram과 holy 물을 가진 사람은 그가 그것을 통제할 수 있다는 것을 확실하고, 밖으로 작동하지 않습니다.
그림은 뿔과 지옥에 대해 엄숙한 신뢰에 관한 것입니다. Musk는 나중에 AI 실험실을 설립. 그림의 기초 사용은 더 좁습니다: 당신이 명령할 수 없는 것을 요약하지 마십시오.
몬트리올 의정서하늘에 구멍을 열고 냉동 된 화학을 은퇴. 공기조화가 계속되고, 공기조화는 계속됩니다. 위험한 입력이 제한되었습니다. 유용한 서비스는 숙박했습니다.
그것은 좁은 AI를 유지하는 동안 prohibiting superintelligence를 위한 그림입니다: 단백질 접히는, 종양 탐지, 공구를 체재하는 공구. 우리는 도구에 머물지 않을 시스템의 한 클래스에 반대합니다.
국제 원자 에너지기구 (International Atomic Energy Agency)는 서로 신뢰하지 않는 국가의 핵 프로그램을 검사합니다. 액세스는 거래의 조건, 아니 호의. Uranium enrichment는 당신이 계산할 수 있는 chokepoint입니다.
Compute for frontier training is also chokepoint: 칩 디자이너의 짧은 목록, 제조 업체, 및 lithography machine, 주로 모든 관할권. 아날로그는 검사 및 검증, 위험한 artifact를 게시하는 위임. 우리의 계획은 공급 업체 그 모델에 대한 모니터링.
우라늄의 힙이 금을 지불하고, 더 큰 힙은 더 지불, 아무도 추가 중지합니다. 중요한 질량의 짧은 유지와 당신은 부자. 한 삽 너무 멀리 하 고 힙 detonates, 분위기와 함께 간다, 그리고 금을 지출 한 왼쪽 아무도 없습니다.
Superintelligence는 payoff의 밑에 건축됩니다. 최고의 실험실은 임계값을 볼 수 있습니다. 공개 그들은 그들이 한 번에 모든 실험실을 중지 할 법을 원한다. 경쟁력 있는 압력, prestige, 그리고 금은 법이 존재하는 때까지 삽을 유지. 주의사항.
그것을 잠그고, 슬롯을 통해 질문을하고, 네트워크, 손 및 세상을 만지고, 당신은 기관없이 마음을 얻을 수 없습니다. 그것은 또한 포함이라고 불리는 AI 복싱입니다.
자물쇠는 단단한 부분이 아닙니다, 마음 안쪽이 열쇠를 붙드는 사람들 보다는 더 가능하기 때문에, 그것은 대화할 수 있습니다. Informal 예심은 이미 문을 열 수있는 게이트 키퍼를 persuading 상자 시스템을 연주 한 사람을 보여주었다. 정품 superintelligence는 더 많은 일을 할 것입니다. 당신이해야 할 마음을 서 있지 마십시오 상자에서 유지.
당신은 밀봉한 방에서 당신을 잠그는 어떤 체계든지, 그 통제의 밑에 공기를, 독 가스의 탱크에 체계 철사 두고, 벨브를 열지 않다는 것을 신뢰합니까? 당신은 백만 달러를 위해 그것을하지 않을 것입니다, 당신은 당신의 생활에 1개의 불능 레버를 가진 기계를 신뢰하지 않습니다.
세계는 더 큰 방이고, 레버는 격자, 시장, 무기, 생물 실험실, 근수이고, 소프트웨어는 이미 정규적인 생활에 앉습니다. 당신은 밸브를 손으로하지 않을 경우, 세상을 손을.
영화는 우리를 싫어하는 villain을 필요로, 붉은 눈, 전쟁, 그리고 인류를 닦아 결정. 그 그림은 사람들이 맥시를 기다리기 위해, 그 후 데모가 불쾌 할 때 휴식.
paperclip와 gorilla 그림에 있는 체계는 누군가를 싫어하지 않습니다. 그들은 결코 우리를 언급 한 목표를 위해 세상을 움직입니다. 테스트의 Politeness는 그것과 호환이 됩니다. Skynet에 대한 청취가 도달하면 paperclips로 교체하십시오.
항공의 우선 순위에 대한 연구소 도달 : 우리는 그것을 비행하면서 비행기를 구축하고 있습니다. 그들은 신경에 대해 자랑합니다. 항공 forbids 정확히 그. 새로운 유형은 건축업자가 거부할 수 있는 규칙에 기인할 때까지 여객을 지불할 수 없습니다.
항공은 세계가 흡수 할 수있는 규모로 충돌하여 안전하며 규칙을 다시 작성합니다. Superintelligence는 두 번째 비행을 제공하지 않습니다. 첫 번째 충돌은 승객과 조사관이 걸립니다. 시험 및 오류는 생존자가 필요합니다.
레이스는 상금 누군가가 붙을 수 있다고 가정합니다. 사일로 폭탄, 금메달, 시장. 국가는 폭탄을 보유하는 방법을 superintelligence를 붙들 수 없습니다. Builder는 모든 인간 기관을 실행하는 마음의 고용주가 남아 있지 않습니다.
하나가 승자가 될 수없는 것을 먼저 경주. 실험실에서 Saint 또는 tyrant는 요청을 변경하지 않습니다.
사람들은 우리가 아이를 키우는 방법을 제기 할 것이라고 말한다 : 보상, 처벌, 친절으로 이야기. 아이는 인간의 두뇌와 약한 인간입니다. 부모는 수년 동안 더 많은 수의 파티를 유지. 자녀가 이미 우리 중 하나이기 때문입니다.
Superintelligence는 둘 다 반전하고, 우리는 아이일 것입니다. 승인에 훈련은 승인의 외관을 가르치고, sucralose는 다시. 아래에서 부모를 갖지 못합니다.
우리는 새로운 자원, 모험 기회 및 정책에 업데이트를 보낼 것입니다.