Epidemiología de los fallos: OpenAI corrige un error de dieciocho años en la infraestructura de ChatGPT

Qué pasó
Hace algunos meses, el equipo de infraestructura de OpenAI detectó caídas recurrentes en Rockset, un sistema de datos nativo de la nube adquirido por la compañía en 2024 y utilizado para alimentar módulos de datos de ChatGPT y para realizar búsquedas sobre conversaciones. Las funciones escritas en C++ finalizaban su ejecución de manera normal, pero devolvían el control a una dirección de memoria inexistente, lo que provocaba que el núcleo del sistema operativo detuviera el proceso.
En algunos casos, la dirección de retorno aparecía con valor nulo. En otros, el puntero de pila del procesador estaba desplazado en ocho bytes respecto de su valor esperado, como si hubiera sido alterado durante la ejecución normal. El equipo descartó múltiples hipótesis con evidencia sólida, dado que estos patrones no corresponden a fallas típicas del código de aplicación y resultaban estadísticamente improbables.
La investigación concluyó que se trataba de dos fallas no relacionadas, descubiertas de manera coincidente. La primera correspondía a una corrupción silenciosa de hardware en un servidor de Azure, donde la unidad central de procesamiento realizaba cálculos de forma incorrecta. La segunda era una condición de carrera de dieciocho años en GNU libunwind, una biblioteca de código abierto ampliamente utilizada para el desenrollado de pila en el ecosistema Linux.
El artículo técnico publicado por OpenAI describe cómo el equipo adoptó un enfoque epidemiológico para abordar el problema: en lugar de examinar volcados de memoria de forma individual, construyó un conjunto de datos de alta calidad sobre la totalidad de los fallos para identificar patrones en la población completa, metodología que permitió aislar los dos problemas subyacentes que el análisis caso a caso no había logrado detectar.
Contexto
Los modelos de OpenAI dependen crecientemente de infraestructura de datos escalable para buscar información relevante durante el tiempo de inferencia, es decir, en el momento en que los modelos procesan una consulta del usuario. Servicios como Rockset resultan críticos para que ChatGPT consulte bases de conocimiento actualizadas y entregue respuestas precisas a sus usuarios.
Gran parte de estos servicios están escritos en C++, un lenguaje que ofrece control de bajo nivel sobre el procesador y permite maximizar el rendimiento, pero que carece de mecanismos automáticos de seguridad de memoria. Esto implica que errores en el código pueden provocar caídas al escribir en direcciones incorrectas o inexistentes, un riesgo que se amplifica cuando los sistemas operan a escala global.
El caso ilustra los riesgos ocultos de depender de componentes de software heredados: una condición de carrera en GNU libunwind permaneció inadvertida durante casi dos décadas a pesar de su uso masivo, lo que subraya la fragilidad potencial de piezas fundamentales del ecosistema de código abierto.
El episodio pone de relieve una tensión estructural en la industria de la inteligencia artificial: la búsqueda de máximo rendimiento y eficiencia conduce al uso de lenguajes de bajo nivel, mientras que las garantías de seguridad de memoria que ofrecen lenguajes más modernos aún no se han adoptado de manera generalizada en los componentes críticos de la infraestructura.
Impacto para empresas chilenas
Empresas y pymes chilenas que utilizan ChatGPT y otras herramientas de inteligencia artificial en sus operaciones cotidianas dependen, muchas veces sin saberlo, de la estabilidad de servicios como Rockset. Aunque este incidente fue contenido sin afectar aparentemente a los usuarios finales, ilustra la vulnerabilidad de las cadenas tecnológicas sobre las que se apoya la transformación digital del país.
Para las startups locales que desarrollan soluciones sobre infraestructura de grandes proveedores globales, el caso subraya la necesidad de diversificar arquitecturas y mantener planes de contingencia, dado que la concentración de servicios críticos en pocos proveedores introduce riesgos sistémicos que deben considerarse al diseñar cualquier estrategia tecnológica.
La transparencia de OpenAI al publicar un análisis técnico detallado beneficia a desarrolladores y empresas chilenas, que pueden anticipar patrones de falla similares en sus propios sistemas. La metodología de análisis poblacional de errores, en lugar de revisiones caso a caso, constituye una práctica replicable por equipos de ingeniería locales que gestionan infraestructura a escala.
Finalmente, el episodio refuerza el valor del software de código abierto para la industria nacional. Contribuciones globales a proyectos como GNU libunwind terminan protegiendo indirectamente a las empresas chilenas que utilizan componentes derivados en su propia infraestructura tecnológica.
Qué sigue
OpenAI adelantó que reforzará sus procesos de prueba y monitoreo de infraestructura, con énfasis en la detección temprana de fallas de hardware y en auditorías más exhaustivas de las bibliotecas de código abierto sobre las que se soportan sus servicios. Es probable que el enfoque epidemiológico aplicado al análisis de fallos se incorpore como práctica estándar dentro de la compañía.
A nivel sectorial, el caso podría acelerar la discusión sobre la migración gradual hacia lenguajes con seguridad de memoria, una tendencia ya en marcha en otras grandes empresas tecnológicas y que podría redefinir los estándares de construcción de infraestructura crítica para inteligencia artificial en los próximos años.
Artículos Relacionados

Agencia de ciberseguridad de Estados Unidos advierte sobre fallas activas en SharePoint Server
La Agencia de Ciberseguridad y Seguridad de Infraestructura de Estados Unidos (CISA) emitió una alerta tras detectar la explotación activa de tres vulnerabilidades en instancias locales de Microsoft SharePoint Server. Las fallas permiten a los atacantes eludir la autenticación, ejecutar código en forma remota y desplegar software malicioso en sistemas comprometidos. La autoridad estadounidense urgió a los equipos de seguridad a aplicar los parches publicados por Microsoft y a reforzar las medidas de monitoreo en los servidores expuestos a Internet.

Gobierno de Estados Unidos advierte que hackers estatales rusos apuntan a routers de hogares y oficinas
La Agencia de Seguridad de Infraestructura y Ciberseguridad de Estados Unidos (CISA) emitio una alerta internacional sobre operaciones del Centro 16 del Servicio Federal de Seguridad ruso (FSB) que comprometen routers a nivel global. La advertencia, copatrocinada por gobiernos de Australia, Dinamarca, Nueva Zelanda y Reino Unido, indica que los dispositivos son empleados como nodos de retransmision para ocultar ataques contra infraestructura critica. Sectores como defensa, energia, servicios financieros y gobierno figuran entre los blancos principales. Usuarios y empresas son instados a revisar la configuracion de sus equipos y aplicar las actualizaciones de software de dispositivo disponibles.

Cadena minorista Lidl confirma filtración de datos tras ataque a proveedor tecnológico externo
La cadena alemana de supermercados Lidl, controlada por el grupo Schwarz, notificó a clientes en Alemania, Bélgica y Países Bajos sobre el robo de información personal a raíz de un incidente de seguridad en un proveedor de servicios tecnológicos. La compañía descartó que el evento haya comprometido contraseñas, datos de pago o direcciones de envío. La empresa presentó una denuncia policial y contrató especialistas forenses en informática para esclarecer el alcance del ataque, mientras advirtió a los usuarios sobre eventuales intentos de suplantación de identidad.