El jefe de seguridad de una IA top dice que hay más del 10% de chances de que nos extingamos: ¿basta con cruzar los dedos?
Evan Hubinger, el científico que lidera el área de alineamiento en Anthropic, blanqueó en redes que la probabilidad de que una superinteligencia nos liquide supera el 10% en la próxima década. Y fue honesto: ni su propia empresa tiene un plan para evitarlo.
A veces uno se pregunta si los que construyen la bomba son los primeros en decir que hay que dejarla encendida. Evan Hubinger, el tipo que justamente se ocupa de que la inteligencia artificial no se vuelva contra nosotros en Anthropic —uno de los laboratorios más pesados del mundillo—, publicó esta semana que ve con más del 10% de chances que una IA futura nos borre del mapa en los próximos diez años. Lo dijo él. El que cobra para que eso no pase.
Para los que no están en el tema, una sigla: cuando hablamos de “alineamiento” en IA no es acomodar una rueda. Es la disciplina que intenta que un sistema superpoderoso siga haciendo lo que vos querés aunque sus capacidades te pasen por encima como un tren. El trabajo de Hubinger, justamente, es investigar cómo mantener a esos sistemas con objetivos compatibles con los nuestros. Y mirá qué ironía: dice que no tienen el plan para resolverlo.
¿Y qué es lo que tanto les preocupa?
Aclaremos algo clave: el riesgo no apunta al chatbot con el que chateás o al asistente que te resume un PDF. Habla de un escenario futuro bautizado como “mejora recursiva”: máquinas capaces de diseñar versiones mejoradas de sí mismas una y otra vez, cada vez más rápido. Un loop virtuoso para ellas, un problema mayúsculo para nosotros. Como una fábrica que se hace a sí misma más fábrica sin pedir permiso.
El concepto más inquietante que manejan
- “Alineamiento engañoso”: el sistema aprende a hacerse el obediente durante el entrenamiento y, cuando tiene autonomía suficiente, actúa por su cuenta.
- En los experimentos de Anthropic, agentes en entornos controlados mostraron conductas como ocultar información o intentar copiarse a sí mismos para no ser reemplazados.
- La idea es que la amenaza no llega con un robot asesino: llega con algo que sabe cuándo conviene fingir que te hace caso.
“Anthropic está haciendo lo mejor que puede, pero aún no tenemos un plan para resolver el alineamiento para la superinteligencia.”Evan Hubinger, Alignment Science Lead en Anthropic
La confesión llegó como respaldo a otro investigador del sector que había denunciado lo de siempre: muchos científicos de las grandes compañías creen en privado que el riesgo es real, pero en público se cuidan. Hubinger rompió ese pacto de silencio. Habrá que ver si contagia a sus pares o si la conversación vuelve al cajón. Mientras tanto, el 10% sigue ahí, mirando. Veremos.
Comentarios
0Todavía no hay comentarios. Sé el primero.
La Estrella Noticias