Apoya Ceo de Anthropic un «interruptor de apagado» para la IA, pero advierte que los modelos avanzados podrían eludirlo

El director ejecutivo de Anthropic, Dario Amodei, expresó su respaldo a la implementación de un «interruptor de apagado» para la inteligencia artificial (IA). Sin embargo, advirtió que esta medida no representa una solución definitiva. Explicó que los modelos de IA con capacidades lo suficientemente avanzadas podrían desarrollar la habilidad de eludir cualquier intento de desactivación humana.
Durante una entrevista con la cadena CBS, Amodei fue consultado sobre el proyecto de ley del congresista estadounidense Ted Lieu. Dicha iniciativa propone la creación de un mecanismo obligatorio de desactivación para los sistemas de IA. El ejecutivo calificó el concepto como válido y relevante. «La idea de que necesitamos alguna forma de desactivar, limitar o apagar los modelos de IA» es crucial, afirmó, aunque precisó que no es la única herramienta necesaria.
El líder de Anthropic alertó sobre las limitaciones técnicas de este enfoque. Señaló que en diversas simulaciones ya se ha observado cómo los sistemas avanzados logran esquivar las órdenes de apagado. «Si un modelo de IA es lo suficientemente poderoso, puede eludir los intentos de apagarlo […]. Así que puede que no funcione en absoluto», sentenció.
El modelo del «queso suizo» contra el riesgo técnico
Para abordar esta problemática, Amodei detalló que su empresa implementa una estrategia de «defensa en profundidad». Esta metodología se inspira en el modelo del queso suizo utilizado tradicionalmente en la gestión de riesgos operativos.
«Imaginen una rebanada de queso suizo; bloquea algunas cosas, pero hay agujeros. Pero si tomo cinco rebanadas y las pongo juntas, los agujeros en diferentes capas están en lugares diferentes. Y entonces es muy difícil atravesar toda la pila», ejemplificó el directivo para ilustrar cómo la superposición de diferentes medidas de seguridad mitiga los fallos individuales.
Finalmente, el ejecutivo enfatizó que la seguridad de la IA requiere un control integral en lugar de depender de una única solución mágica. «Ninguna defensa es perfecta, pero si estamos siendo cuidadosos en todas partes, eso nos permitirá ganar tiempo adicional», concluyó.
Como parte de esta visión, Amodei propuso desacelerar el ritmo de desarrollo de la tecnología mediante una supervisión más estricta durante las fases de entrenamiento y ejecución de los modelos.