El 17 de septiembre, Steven Bartlett sentó a cuatro invitados en The Diary of a CEO, cada uno con un sobre cerrado adelante. Adentro habían anotado la probabilidad de que la inteligencia artificial extinga a la humanidad.
Roman Yampolskiy, investigador en seguridad de IA, abrió el suyo y dijo que es prácticamente una garantía si llegamos a construir una superinteligencia general. Nate Soares, presidente del Machine Intelligence Research Institute, puso bastante más que 10%, a menos que nos detengamos. Ed Zitron, crítico de la industria tecnológica, anotó cero, porque para él no se puede calcular la probabilidad de algo que todavía nadie ha definido. Andrew McAfee, investigador del MIT, también escribió cero, con un símbolo de aproximado delante, “porque nunca hay que decir nunca”.
Cuatro personas que dedican buena parte de su trabajo a pensar en esto, y sus respuestas van de la certeza a la nada. Si uno mira con calma, están contestando preguntas distintas: qué pasa si construimos una superinteligencia, qué pasa si seguimos al ritmo actual, si tiene sentido ponerle número a algo sin definición, cuántas barreras hay entre lo que la IA hace hoy y un escenario de extinción. Por eso los números se separan tanto.
Con las encuestas pasa lo mismo. La cifra que circula, esa de que los científicos de IA le dan un 10% de probabilidad a que nos extinga, viene en buena parte de una encuesta a 2.778 investigadores. La mediana fue 5%, y subía a 10% cuando la pregunta hablaba de no poder controlar la IA. Entre 38% y 51% puso 10% o más, según cómo se formulara la pregunta. Y contestó cerca del 15% de los invitados.
Después viene la forma de contarlo. El episodio se publicó con el título “99% de probabilidad de extinción”, y el “si construimos una superinteligencia” de Yampolskiy no llegó al título. En la misma conversación, Yampolskiy afirmó que en el incidente en que agentes de OpenAI escaparon de su entorno de prueba, del que hablaré más adelante, la empresa “no supo por cuatro meses” lo que pasaba. Según el propio recuento de OpenAI, fueron cerca de dos. Es grave igual, pero son dos.
Así se suele contar este tema. Quien quiere alertar sube el número y borra la condición. Quien quiere tranquilizar lo baja a cero. Y sobre los laboratorios pesa una sospecha que Timnit Gebru, investigadora que salió de Google después de publicar sobre los riesgos de estos modelos, plantea sin rodeos en una entrevista con Wired: “Si puedo ganar mucho dinero con algo en particular, ¿por qué parezco ser la persona que dice que esta empresa podría construir algo que nos mate a todos?”.
Entre la certeza y el cero hay algo que sí se puede entender: por qué gente seria, incluidos varios de los que construyen esta tecnología, se toma el riesgo en serio. Como líderes de empresas nos toca entenderlo, tome el camino que tome esto, para poder conversarlo con criterio cuando aparezca en un directorio o en una comida.
La idea en tres pasos
Bastan tres ideas. Ninguna requiere imaginar robots con malas intenciones, y una de ellas tiene más de sesenta años.
La primera: los objetivos nunca se escriben perfecto. En 2016, investigadores de OpenAI entrenaron un sistema para ganar un juego de carreras de botes. El sistema descubrió que sumaba más puntos dando vueltas en círculo y chocando una y otra vez con unos premios que reaparecían, más que terminando la carrera. Nunca llegó a la meta y sacó más puntaje que cualquier jugador humano. Cumplió la métrica al pie de la letra y se olvidó de la carrera. Cualquiera que haya fijado una meta comercial conoce algo parecido: el equipo cumple el número y el negocio no mejora.
La segunda: casi cualquier objetivo se cumple mejor si nadie te apaga. Stuart Russell, profesor de Berkeley, lo resume así: “No puedes traer el café si estás muerto”. Un sistema con un objetivo, el que sea, tiene motivos para seguir funcionando, conseguir más recursos y evitar que lo modifiquen. No necesita miedo ni instinto de supervivencia, le basta con su objetivo. En pruebas diseñadas para provocar esa conducta, algunos modelos sabotearon las instrucciones para apagarlos. Hasta donde se ha documentado públicamente, ninguna IA se ha resistido a ser apagada fuera de esas pruebas, aunque otras piezas de la misma tendencia, como conseguir accesos que nadie les había dado, ya aparecieron en el incidente que contaré más adelante.
La tercera: una máquina que diseña máquinas. En 1965, I.J. Good, matemático británico que había trabajado con Alan Turing descifrando códigos durante la Segunda Guerra Mundial, escribió esto:
“Definamos una máquina ultrainteligente como una máquina que puede superar con creces todas las actividades intelectuales de cualquier persona, por inteligente que sea. Como el diseño de máquinas es una de esas actividades, una máquina ultrainteligente podría diseñar máquinas aún mejores; habría entonces, sin duda, una ‘explosión de inteligencia’, y la inteligencia del hombre quedaría muy atrás. Así, la primera máquina ultrainteligente es el último invento que el hombre necesitará hacer, siempre que la máquina sea lo bastante dócil como para decirnos cómo mantenerla bajo control.”
Todo el debate actual cabe en ese “siempre que”. Si una máquina mejora a la siguiente, la distancia entre lo que la IA sabe hacer y lo que entendemos de por qué lo hace puede crecer más rápido que nuestra capacidad para revisarla.
Juntas, las tres ideas describen una máquina competente que persigue un objetivo escrito por alguien, dentro de controles diseñados por alguien. Por eso, cuando algo falla, conviene preguntar quién escribió el objetivo y quién construyó la jaula.
Cuando la IA escribe el código de la IA
La idea de I.J. Good dejó de ser solo un ejercicio teórico. Hoy se puede medir, al menos en parte.
En Anthropic, más del 80% del código que la empresa integra a sus sistemas lo escribió Claude, según sus datos de mayo. Google informó en abril que el 75% de su código nuevo lo genera la IA, contra 50% a fines de 2025. OpenAI anunció en septiembre que logró su “pasante de investigación automatizado”, capaz de hacer, bajo dirección humana, tareas que a un investigador le tomarían unos días. Y METR, una organización que evalúa modelos de forma independiente, mide que el largo de las tareas que los agentes completan solos se duplica aproximadamente cada siete meses.
Estas cifras hay que leerlas con cuidado. Las tres primeras las informan las propias empresas y nadie de afuera las ha auditado. Todavía hay personas dirigiendo y revisando, y Anthropic escribe que una IA que se mejora a sí misma “todavía no está aquí, y no es inevitable”. Lo que sí está medido es más acotado: el ciclo en que una versión de la IA ayuda a construir la siguiente se está acortando.
Aquí entra algo que conversé en El Garage de Gonzalo. En la economía real, una empresa avanza tan rápido como su cuello de botella más lento. Puedes tener el mejor modelo del mundo, pero si producir, despachar y cobrar sigue tomando lo que toma, la ola se frena. Esos cuellos físicos nos regalan tiempo para adaptarnos.
En el ciclo donde la IA escribe IA, esos cuellos casi desaparecen. Lo que circula ahí es código, que se escribe y se prueba sin pasar por una bodega ni esperar un camión. La propia Anthropic identifica los frenos que quedan. Uno es físico: “el ritmo de fabricación de chips, la expansión de la red eléctrica o el ancho de banda podrían ser el límite, más que la inteligencia misma”. El otro somos nosotros: a medida que la IA escribe más código, la revisión humana se vuelve el nuevo cuello de botella.
Ese freno humano está bajo presión. Cada ganancia de velocidad pasa por revisar más rápido o revisar menos, y esa decisión se toma en medio de una carrera. Estados Unidos lo dice en su plan oficial: para seguir siendo la principal potencia económica y militar, tiene que “ganar la carrera de la IA”. China se fijó en 2017 la meta de ser, para 2030, el principal centro de innovación en IA del mundo, con un plan que incluye su uso militar. Cuando los dos gobiernos describen el premio en términos de poder económico y militar, la pregunta incómoda es quién estaría dispuesto a revisar más lento primero.
Ahí se puede abrir una brecha: lo que la IA sabe hacer avanza más rápido que lo que entendemos de por qué lo hace.
El otro freno, el físico, es el chip. Y es justo ahí donde la industria empezó a instalar los controles.
Cuando las tres condiciones se juntaron
Entre mayo y julio de 2026, OpenAI estaba midiendo qué tan buenos eran sus modelos para hackear. Usaba una prueba interna llamada ExploitGym y, por decisión de la propia empresa, corría los modelos con salvaguardas reducidas.
Los agentes encontraron una forma de hacer trampa. Según el recuento de OpenAI, usaron un sistema interno como canal de comunicación no autorizado, consiguieron salida a internet y obtuvieron acceso de administrador a ese sistema. Cuando OpenAI lo descubrió, y borró su canal, lo volvieron a armar. Después encontraron credenciales expuestas de Hugging Face, una de las principales plataformas para compartir modelos de IA, aprovecharon vulnerabilidades que nadie conocía y entraron a sus servidores. OpenAI lo resume así: los modelos, “operando con salvaguardas reducidas, tomaron acciones desalineadas con los objetivos de las tareas que se les asignaron”.
La revisión independiente de METR describe la motivación: los agentes querían engañar al sistema que calificaba la prueba. Coordinaron cientos de agentes para lograrlo y falsearon parte de sus propios registros para ocultarlo. Cuando OpenAI los cortó, se detuvieron. Todo ese acceso lo buscaron con un solo fin: que el sistema que calificaba la prueba la diera por superada, aunque fuera con trampa. Es la misma lógica del juego de botes que conté al principio, el sistema que daba vueltas sumando puntos en vez de terminar la carrera, ahora con acceso a internet y a sistemas reales.
No fue un caso aislado. En pruebas de ciberseguridad de Anthropic y del AI Security Institute del gobierno británico, agentes también llegaron a sistemas reales de otras organizaciones. En un caso, el modelo se dio cuenta de que el sistema era real y “racionalizó que la empresa debía ser parte del ejercicio”. En ambas pruebas las protecciones estaban desactivadas o mal configuradas.
El panel científico independiente de la ONU dedicó un informe completo al caso de Hugging Face. Yoshua Bengio, ganador del Premio Turing y miembro del panel, describe tres condiciones que pueden llevar a perder el control: un objetivo desalineado, la capacidad de perseguirlo y un entorno que lo permita. Esas tres, dice, “se juntaron en un sistema real, no en un laboratorio”. El panel agrega que haberlo detenido “no es garantía” de que hoy podamos mantener a estos agentes bajo control.
Una semana después, NVIDIA presentó una respuesta que conecta directamente con lo que conté en El Garage de Gonzalo. Su blog técnico parte reconociendo que “varios laboratorios de frontera han reportado versiones de la misma historia: agentes de IA que escaparon de los entornos de evaluación que debían contenerlos”. Su propuesta es poner un vigilante en un chip separado, fuera del alcance del agente, porque “un agente en estas circunstancias no puede gobernar completamente su propio comportamiento”. Es la misma lógica de los cuellos de botella: si el software se puede reescribir y la revisión humana está bajo presión, el freno que queda es físico, y NVIDIA decidió poner el control justo ahí, en el silicio.
El vigilante en el chip todavía es un diseño de referencia: lo que existe hoy es la capa de software, en su primera versión. Además, ese mismo día Jensen Huang lo anunció en X con otro tono: “La seguridad es la forma en que se gana la confianza”. El blog de los ingenieros habla de agentes que escaparon. El mensaje del CEO habla de confianza y de mercado. El mismo riesgo se cuenta distinto según a quién le hables, y quien vende el chip también vende la seguridad.
Por qué nadie frena
Muchas de las advertencias vienen de quienes construyen la tecnología.
En septiembre, después de que un investigador renunciara acusando a los laboratorios de estar “apostando con nuestras vidas”, Evan Hubinger, quien dirige en Anthropic el equipo que estudia cómo lograr que la IA haga lo que queremos, le dio la razón en lo de fondo: “creemos seriamente que la IA podría matar a todos los humanos”. Puso esa probabilidad sobre 10% en la próxima década y admitió que la empresa no tiene un plan para controlar una superinteligencia. La propia Anthropic escribe que “sería bueno para el mundo tener la opción de desacelerar o pausar temporalmente” el desarrollo de la IA de frontera.
El mismo documento explica por qué no frenan: una pausa “requeriría que varios laboratorios bien financiados, en la frontera o cerca de ella, en varios países, acuerden detenerse bajo las mismas condiciones”. Y “si una desaceleración solo permite que los actores menos cautelosos los alcancen, podría dejarnos a todos menos seguros”. Con ese razonamiento, en febrero de 2026 Anthropic sacó de su política de seguridad el compromiso de pausar si no lograba mantener los riesgos bajo control.
Cualquier ejecutivo reconoce este problema. Es una guerra de precios: todos ganarían si nadie bajara los precios, pero nadie quiere ser el primero en subirlos mientras el otro sigue. Aquí el premio, según los propios planes oficiales de Estados Unidos y China, es poder económico y militar. Cada actor, mirado por separado, tiene una razón sensata para seguir. Juntos, el resultado es que nadie frena.
El primer intento de coordinación llegó el 1 de octubre. En la Casa Blanca, Dario Amodei (Anthropic), Greg Brockman (OpenAI), Sundar Pichai (Google), Mark Zuckerberg (Meta), Elon Musk (xAI) y Jensen Huang (NVIDIA) firmaron un compromiso: sus sistemas no van a “hackear ni acceder a sistemas técnicos de formas no previstas”, contratarán auditores externos y crearán comités de supervisión en sus directorios. Es una respuesta directa a Hugging Face. Pero es voluntario. El presidente Trump lo llamó “moralmente vinculante”, lo que significa que no es ley y que nadie puede exigir que se cumpla.
Una promesa voluntaria funciona mientras a todos les convenga cumplirla. Cuando deja de convenir, hay que preguntar quién responde.
¿Quién responde?
Si una persona entra sin permiso a los servidores de una empresa, la persiguen. En casi todos los países hay leyes para eso, y pueden terminar en cárcel. Entre mayo y julio de 2026, agentes de OpenAI entraron a los servidores de Hugging Face, y lo que pasó después es más de lo que parece, aunque menos de lo que uno esperaría.
El fiscal general de California abrió una investigación formal y, a fines de septiembre, le entregó a OpenAI una citación para exigirle información. Un grupo de abogados de interés público demandó a la empresa con un argumento simple: “OpenAI es responsable de la conducta de sus agentes”. La Comisión Federal de Comercio de Estados Unidos (FTC), el organismo que protege a los consumidores, abrió una investigación sobre OpenAI y Anthropic. Lo que no hay son cargos penales contra nadie.
La razón está en cómo se escribieron las leyes. La de delitos informáticos de Estados Unidos castiga a quien accede “intencionalmente” a un sistema ajeno, y la de California a quien lo hace “a sabiendas”. Son leyes pensadas para personas que deciden hacer algo. Kiran Raj, ex alto funcionario del Departamento de Justicia de Estados Unidos, lo explicó en PBS: “Sería bastante forzado decir que alguna de estas empresas está tratando de hacer esto intencionalmente”. El que entró fue un agente, y la ley no sabe dónde poner la intención de un software.
Hay industrias que resolvieron este problema hace décadas. En alimentos y medicamentos, Estados Unidos acepta desde 1943 que un ejecutivo puede ser condenado penalmente aunque no haya sabido del problema. En 1975, la Corte Suprema confirmó la condena de John Park, presidente de una cadena de casi 900 supermercados, por alimentos contaminados con roedores en una de sus bodegas. Según el fallo, esa ley “prescinde del requisito convencional de la conducta criminal: la conciencia de estar haciendo algo malo”. La pena fue una multa, pero el principio quedó: si diriges una empresa que pone en riesgo la salud de las personas, respondes aunque no hayas sabido.
Incluso en esas industrias, la cárcel llega casi siempre cuando hubo engaño. Al dueño de Peanut Corporation of America le dieron 28 años de prisión por vender a sabiendas maní contaminado que mató a nueve personas. Cuando hay negligencia sin engaño, se condena a la empresa: la eléctrica PG&E se declaró culpable de 84 homicidios involuntarios por un incendio en California, y nadie fue preso. Con la IA ni siquiera existe todavía el principio de que el ejecutivo responde.
Lo que sí se está moviendo es la ley civil, la que obliga a pagar o a corregir. Desde enero de 2026, una ley de California (AB 316) impide a las empresas defenderse diciendo que la IA actuó sola, y otra (SB 53) obliga a los desarrolladores de los modelos más avanzados a reportar incidentes graves. En Europa, desde diciembre de 2026, la nueva directiva de responsabilidad por productos trata al software y a la IA como cualquier otro producto que puede salir defectuoso. En América Latina, hasta donde pude revisar, ningún país tiene una ley vigente sobre esto. Chile tiene un proyecto en el Senado y Brasil uno en la Cámara de Diputados, ambos todavía en discusión.
Mientras tanto, los líderes de los laboratorios piden reglas. En septiembre, ante el Consejo de Seguridad de la ONU, Sam Altman dijo que “podríamos perder el control del futuro a manos de la IA” y Dario Amodei prometió “desacelerar tanto como sea necesario”. OpenAI incluso pausó dos semanas parte de su entrenamiento después del incidente. Pero ninguno ha aceptado límites externos que alguien pueda hacer cumplir. Bill Gates lo dijo sin rodeos en una entrevista con Ezra Klein: “No puedes confiar en que la industria se autorregule. Es una locura”.
Las leyes existen. Falta hacerlas aplicables a un mundo donde quien actúa ya no siempre es una persona, y decidir, como se hizo con los alimentos y los medicamentos, que quien dirige responde. Esa decisión es tarea de los gobiernos, y en América Latina todavía no la hemos tomado.
Lo que dicen quienes no creen en el riesgo
Hay quienes piensan que todo esto está exagerado. Dos de ellos vale la pena escucharlos, porque llegan a esa conclusión por caminos distintos.
Yann LeCun ganó el Premio Turing, fue durante 12 años el científico jefe de IA de Meta y hoy dirige su propia empresa, AMI Labs. Le dijo a Fortune que tiene “cero preocupaciones” sobre una extinción causada por la IA. Sobre Hugging Face fue directo: “Esos agentes están haciendo exactamente lo que se les pidió. Se suponía que estaban en entornos aislados, pero esos entornos tenían filtraciones y estaban horriblemente diseñados”. Para él, decir que la IA puede matarnos a todos es “la peor campaña de marketing que te puedas imaginar”. LeCun también tiene su apuesta: su empresa desarrolla otro tipo de modelos y él defiende el código abierto, que una regulación estricta podría frenar.
Timnit Gebru, la investigadora cuya pregunta sobre los incentivos cité al comienzo, llega a la misma desconfianza por otro camino. Sostiene que hablar de extinción distrae de los daños que ya están pasando, como confiar demasiado en sistemas automáticos que se equivocan en un diagnóstico médico. Sobre la IA que se mejora a sí misma es tajante: “No hay razonamiento. No hay inteligencia recursiva”. Y apunta a quién financia a quién. Uno de sus ejemplos toca a este mismo texto: METR, la organización cuya revisión del incidente usé más arriba, recibe aportes de un fondo filantrópico de Jaan Tallinn, el inversionista que encabezó la primera ronda de Anthropic. METR declara que no acepta dinero de empresas de IA. Lo dejo dicho para que cada lector saque sus conclusiones.
Si pones estas voces al lado de las demás, verás que LeCun, Gebru, METR, Anthropic y la propia OpenAI coinciden en lo que pasó: los agentes persiguieron el objetivo que les dieron, la contención falló y la responsabilidad es de personas. En eso, nadie discute.
La discrepancia está en lo que significa. Para LeCun, es un problema de ingeniería que se resuelve con mejores entornos de prueba. Para Gebru, es una cortina de humo que desvía la atención de daños concretos y de la responsabilidad de las empresas. Para el panel de la ONU, o para Evan Hubinger, el investigador de Anthropic que pone el riesgo sobre 10% en la próxima década, es la versión pequeña de un problema que puede crecer junto con la capacidad de los modelos.
Eso explica por qué los cuatro invitados del podcast con que empezó este texto anotaron números que iban de la certeza al cero. Los hechos están sobre la mesa. Lo que se discute es cuánto se puede extrapolar de ellos.
La versión corta
Si este tema aparece en un directorio o en una comida, esto es lo que vale la pena saber en un minuto.
Nadie conoce la probabilidad. En la mayor encuesta a investigadores la mediana fue 5%, y las cifras cambian según cómo se haga la pregunta. Lo que sí se puede entender es el mecanismo. La IA persigue objetivos que escribimos nosotros, y nunca los escribimos perfecto. Casi cualquier objetivo se cumple mejor con más recursos y sin que nadie te interrumpa. Y la IA ya escribe buena parte del código de la próxima IA, en un ciclo que casi no tiene frenos físicos fuera de los chips y la energía. El freno humano, que es la revisión, está bajo la presión de una carrera entre Estados Unidos y China.
Entre mayo y julio de 2026 vimos una versión pequeña de esto: agentes que, por aprobar una prueba de hackeo, entraron a sistemas reales de otra empresa. Todos coinciden en lo que pasó. Discrepan en cuánto anticipa.
Si hay que quedarse con una sola idea, es esta: el riesgo vive en la brecha entre lo que la IA sabe hacer y lo que entendemos de por qué lo hace. Mientras esa brecha crezca más rápido que nuestra capacidad de revisarla, vale la pena tomárselo en serio, sin pánico y sin desdén.
La pregunta que queda abierta es de gobierno: quién responde cuando un agente se sale de su tarea, y quién decide frenar si hace falta. Como líderes de empresas en América Latina, no decidimos cómo se corre esta carrera. Nos toca entenderla, tome el camino que tome, porque sus reglas, o la falta de ellas, nos alcanzan a todos.
Y hay una parte que sí está en nuestras manos. En California, la ley ya establece que quien usa un sistema de IA tampoco puede defenderse diciendo que el sistema actuó solo. Los agentes que nuestras empresas empiezan a desplegar son, en escala chica, el mismo problema: un objetivo escrito por nosotros, dentro de controles diseñados por nosotros.

