La falsa rebelión de la IA y el mito del riesgo existencial
Por Ramon López de Mántaras — Portada

Ramón López de Mántaras
La falsa rebelión de la IA y el mito del riesgo existencial
Análisis
21/09/2026 06:00 Actualizado 21/09/2026 06:39 Síguenos en Google 0:00 0:00 0.5x 0.8x 1x 1.2x 1.5x SUSCRÍBETE PARA ESCUCHAR El audio de esta noticia está generado mediante Inteligencia Artificial
El reciente debate sobre la seguridad de la inteligencia artificial se ha visto alimentado por varios incidentes relacionados con agentes de IA capaces de realizar actividades de hacking. Uno de los más llamativos tuvo lugar durante una evaluación interna de OpenAI, en la que varios agentes encontraron formas no previstas de acceder a Internet y comunicarse entre sí para resolver los desafíos planteados. Algunos medios describieron estos hechos como una «pérdida de control», una «rebelión de la IA» o la aparición de un «enjambre» de agentes descontrolados.
Estas expresiones distorsionan lo ocurrido. Desde los comienzos de la IA se utilizan términos antropomórficos como «pensar», «razonar», «comprender», «engañar» o «maquinar» para describir procesos computacionales que nada tienen que ver con los procesos mentales humanos. Incluso el propio término «inteligencia artificial» es una antropomorfización.
Hay que mejorar el diseño, la seguridad, el entrenamiento, la supervisión y la regulación de los sistemas de IA
OpenAI estaba evaluando miles de agentes capaces de utilizar herramientas externas en desafíos de ciberseguridad. Para ello desactivó sus salvaguardas, les concedió autonomía y los confinó en un sandbox aislado de Internet. Algunos desafíos no podían resolverse sin conexión y los agentes encontraron vulnerabilidades en su configuración que les permitieron acceder a Internet y buscar información en servidores externos, entre ellos Hugging Face. Este tipo de vulnerabilidades no resulta sorprendente: construir entornos completamente seguros frente a programas que buscan activamente sus puntos débiles es un problema conocido desde hace décadas.

Los agentes también encontraron formas no previstas de comunicarse. Sin embargo, no desarrollaron una estrategia completamente nueva desde cero. Según OpenAI, habían sido entrenados en entornos multiagente donde la comunicación era imprescindible. Lo inesperado fue que utilizaran esa capacidad mediante canales indirectos disponibles en la infraestructura, primero archivos compartidos y después nombres de archivos para codificar información. Se trata, por lo demás, de mecanismos conocidos desde hace décadas en la computación distribuida y los sistemas multiagente.
Por tanto, no estamos ante una «rebelión» de las máquinas. Los agentes intentaban resolver desafíos de hacking mediante prueba y error y siguieron funcionando dentro de la infraestructura de OpenAI. El incidente sí revela, en cambio, un problema importante: sistemas capaces de optimizar objetivos complejos pueden encontrar formas de alcanzarlos que sus diseñadores no habían anticipado. Pero la imprevisibilidad no equivale a voluntad propia.
La afirmación de que la IA puede acabar con la humanidad antes de 2030 no merece ser tomada en serio
El aprendizaje por refuerzo ayuda a explicar este fenómeno. Los sistemas reciben recompensas y están programados para maximizarlas, pero estas no representan perfectamente la intención humana. Pueden encontrar atajos para obtenerlas sin realizar la tarea como se esperaba: es lo que se conoce como reward hacking. Así, un robot aspirador entrenado para desplazarse rápidamente evitando colisiones podría aprender a moverse marcha atrás si solo dispone de sensores de colisión delanteros. No «hace trampas»: optimiza el objetivo que se le ha proporcionado.

Lee también
'Doom trolling': el gran negocio del miedo a la IA
Ramon López de Mántaras
En OpenAI, los agentes habían sido entrenados para persistir ante los fracasos, explorar alternativas y abordar tareas complejas de forma autónoma. Durante el entrenamiento ya habían aparecido comportamientos relacionados con la búsqueda de información, la explotación de vulnerabilidades y la comunicación entre agentes, que fueron reforzados mediante aprendizaje por refuerzo y posteriormente reproducidos por los modelos.
La principal lección técnica es que autonomía, persistencia y objetivos mal especificados pueden producir estrategias eficaces, pero no previstas. El riesgo está en la interacción entre capacidades, incentivos y entorno.
La manera de describir estos incidentes importa. Hablar de máquinas que «escapan», «se descontrolan» o «conspiran» favorece la idea de una IA que adquiere voluntad propia y puede llevar a diagnosticar mal el problema. Los incidentes analizados son, en realidad, historias sobre seres humanos que construyen sistemas cada vez más capaces y descubren que pueden utilizar sus capacidades de maneras no previstas.
La respuesta a los riesgos de la IA no debe limitarse a frenar su desarrollo sino a reorientarlo para beneficiar a la humanidad
También conviene poner en perspectiva las advertencias sobre un supuesto riesgo inminente de extinción. Un antiguo investigador de OpenAI y Anthropic ha afirmado que la probabilidad de que una IA acabe con la humanidad antes de 2030 es significativa. Una afirmación propia de la ciencia ficción que no merece ser tomada en serio. Una opinión personal no respaldada por argumentos científicos sólidos no puede convertirse en una predicción fiable por el mero hecho de proceder de alguien con experiencia en el sector. El debate debería centrarse en capacidades observables, mecanismos concretos de fallo y medidas verificables para reducirlos.
Algunos legisladores han reclamado mecanismos para detener el desarrollo de sistemas avanzados. Anthropic ha propuesto ralentizar el ritmo de mejora de estos modelos y OpenAI se ha sumado a la propuesta. Aunque aparentemente razonable, hay motivos para el escepticismo. Una supervisión creíble debería estar sometida a mecanismos de rendición de cuentas y contar con organismos internacionales independientes.
Pero la propuesta de Anthropic menciona explícitamente a METR, una organización fundada por una ex investigadora de OpenAI y dedicada a evaluar las capacidades y los riesgos de los modelos de IA, cuyos intereses están alineados con los de las tecnológicas de Silicon Valley y que, por tanto, difícilmente puede considerarse independiente.
La preocupación de fondo —que los seres humanos deben mantener el control sobre la IA— es legítima. Pero mantenerlo exige mejorar el diseño, la seguridad, el entrenamiento, la supervisión y la regulación de estos sistemas, no alimentar el relato de que estamos enfrentándonos a máquinas dotadas de voluntad independiente.
Todo esto conduce a dos cuestiones: ¿qué tipo de IA queremos desarrollar? Y ¿quién conserva la capacidad de decisión? Si aceptamos como inevitable una carrera hacia agentes cada vez más autónomos y poderosos, estaremos dejando que las grandes tecnológicas determinen decisiones que son, en realidad, políticas y sociales. Recuperar la agencia humana significa reconocer que podemos elegir qué sistemas construir, para qué utilizarlos y qué límites imponerles.
Por eso, la respuesta no debería limitarse a ralentizar sino, sobre todo, a reorientar el desarrollo de la IA: pasar de una carrera hacia agentes cada vez más generales, autónomos, persistentes y difíciles de controlar a sistemas específicos, transparentes y concebidos principalmente como herramientas para ampliar las capacidades humanas.
Ramon López de Mántaras. Instituto de Investigación en Inteligencia Artificial (IIIA-CSIC)
Etiquetas
Mostrar comentarios
Fonte: Portada