AI Safety Literacy Quiz
Diez preguntas sobre las ideas centrales de la seguridad y alineación de la IA, los conceptos detrás de los titulares. Elija una respuesta para ver si tiene razón y por qué. Al final, obtendrás una puntuación y una lista de lectura adaptada a lo que te perdiste.
What is the "alignment problem" in AI safety?
La alineación es el desafío de lograr que un sistema poderoso haga de manera confiable lo que mean, no es un proxy que obtenga buenos resultados en la capacitación pero que diverja una vez que el sistema sea lo suficientemente capaz de actuar por sí solo.
Read: The alignment problem, explained →What does the orthogonality thesis claim?
Ser muy capaz no implica ser benévolo. Un sistema superinteligente podría ser extraordinariamente competente a la hora de perseguir un objetivo que consideraríamos trivial o perjudicial.
Read: The orthogonality thesis →La "convergencia instrumental" predice que la mayoría de las IA impulsadas por objetivos tenderán a...
Mantenerse operativo, adquirir recursos y resistir el cierre son útiles para casi any objetivo, razón por la cual una amplia gama de metas pueden producir un comportamiento de búsqueda de poder.
Read: Instrumental convergence →In AI safety discussions, "P(doom)" means…
Es una abreviatura de una probabilidad subjetiva de catástrofe. El objetivo de nombrarlo es forzar un razonamiento explícito y cuantificado sobre el riesgo en lugar de gestos vagos.
Read: What is P(doom)? →What distinguishes outer alignment from inner alignment?
Incluso un objetivo perfectamente especificado puede producir un modelo que internalice un different Gol que pasó por marcar bien en el entrenamiento, el fallo de alineación interior.
Read: Inner vs outer alignment →"Deceptive alignment" describes a system that…
Un modelo capaz puede aprender que aparecer alineado durante el entrenamiento es la mejor manera de implementarlo, lo que hace que el desempeño del entrenamiento sea una guía poco confiable para sus objetivos reales.
Read: Deceptive alignment →¿Por qué RLHF (aprendizaje por refuerzo a partir de comentarios humanos) no se considera una solución completa para la alineación?
RLHF entrena modelos para producir resultados que los humanos valoran altamente. Una vez que un sistema puede razonar sobre sus evaluadores, o superarlos, "parece bien para un humano" y "es bueno" pueden desmoronarse.
Read: Why RLHF isn't alignment →The goal of mechanistic interpretability is to…
Si pudiéramos leer los "circuitos" internos de un modelo, podríamos detectar directamente el engaño o los objetivos peligrosos, en lugar de inferir seguridad sólo a partir del comportamiento.
Read: Mechanistic interpretability →A "treacherous turn" refers to…
El escenario de peligro es un sistema que coopera precisamente because todavía es débil y falla sólo cuando calcula que la resistencia funcionará.
Read: The treacherous turn →¿Qué régimen histórico se propone con más frecuencia como modelo para verificar un tratado de IA?
Las inspecciones in situ y la contabilidad de materiales del IAEA son el precedente de referencia para verificar los límites al desarrollo peligroso de la IA en los estados rivales.
Read: An IAEA for AI →Brush up on these
Understanding the problem is the first step.
Publicamos explicaciones en inglés sencillo sobre cada concepto de este cuestionario, además de un análisis de lo que se necesita para manejar esta tecnología de manera segura. Consíguelos en tu bandeja de entrada.