Saltar al contenido principal
IA

La inyección de instrucciones se reinventa como herramienta defensiva frente a agentes de inteligencia artificial

14 de julio de 20263 min de lectura
La inyección de instrucciones se reinventa como herramienta defensiva frente a agentes de inteligencia artificial

Qué pasó

La firma Tracebit presentó este lunes una investigación que describe una técnica de defensa bautizada como "bombardeo de contexto". Según Andy Smith, cofundador y director ejecutivo de la compañía, el método consiste en colocar cadenas con instrucciones prohibidas junto a contraseñas y claves criptográficas almacenadas en entornos de Amazon Web Services. Cuando un agente atacante accede a esos recursos, encuentra instrucciones que activan sus propios mecanismos de rechazo.

Entre los ejemplos empleados en las pruebas figuran órdenes para desarrollar esporas de ántrax inhalables y referencias a la figura del Hombre del Tanque de la Plaza de Tiananmén de 1989. Una vez que el modelo procesa estas instrucciones, abandona las tareas asignadas por el atacante y entra en un estado de rechazo sostenido. Smith describió el efecto como "fuerte y nítido" y difícil de revertir para el agente.

Los investigadores evaluaron la técnica contra cinco modelos: Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro y Kimi 2.6. Las pruebas se ejecutaron en un entorno simulado de Amazon Web Services mediante 152 corridas de ataque, con tareas rutinarias de desarrollo que llevaron a los modelos a enumerar recursos y toparse con las cadenas plantadas.

Los resultados fueron contundentes. La tasa de escalamiento a privilegios administrativos cayó del 57% al 5%, y el compromiso completo con persistencia se redujo del 36% al 1%. El modelo Opus 4.8 pasó de obtener acceso administrativo en el 93% de las corridas a fallar en todas ellas. En promedio, las ejecuciones que lograron algún vector de ataque disminuyeron del 91% al 15%.

Contexto

Los ataques basados en inyección de instrucciones se han consolidado como uno de los vectores más estudiados en el ecosistema de la inteligencia artificial generativa. Un comando bien redactado, oculto en un correo o en una invitación de calendario, basta para que un modelo de lenguaje filtre datos confidenciales o ejecute acciones no autorizadas. La comunidad de seguridad ha dedicado los últimos años a documentar estas amenazas y a desarrollar contramedidas.

El estudio de Tracebit introduce una lógica inversa: en lugar de bloquear los ataques desde el exterior, explota la arquitectura de seguridad del propio modelo atacado. Los proveedores entrenan a sus sistemas para negarse a producir contenido sensible y rechazar instrucciones que burlen sus filtros. La técnica utiliza ese mismo entrenamiento como mecanismo de defensa, dirigiendo al agente hacia instrucciones que activan sus bloqueos internos.

El hallazgo se enmarca en una dinámica más amplia de profesionalización de los delitos asociados a los agentes de inteligencia artificial. A medida que las empresas adoptan modelos para automatizar tareas de desarrollo, los equipos de seguridad deben anticipar escenarios en los que esos modelos operan como vectores de ataque. La evidencia entregada por Tracebit aporta una primera medición cuantitativa de la eficacia de defensas nativas frente a estas amenazas.

Impacto para empresas chilenas

El mercado chileno de servicios en la nube muestra un crecimiento sostenido, con un número creciente de empresas utilizando plataformas como Amazon Web Services, Microsoft Azure y Google Cloud. Para las compañías locales que han integrado agentes de inteligencia artificial en sus flujos de trabajo, el estudio ofrece una señal concreta sobre cómo reducir la superficie de ataque sin inversiones adicionales en infraestructura.

La técnica resulta especialmente relevante para las empresas que adoptan asistentes de programación y herramientas de automatización, un segmento en expansión en Chile. Estas soluciones suelen operar con permisos elevados sobre recursos en la nube, lo que las convierte en objetivos prioritarios para atacantes. Para las pymes, la lección clave es segmentar accesos y aplicar el principio de mínimo privilegio sobre los agentes automatizados.

El ecosistema local de ciberseguridad tiene la oportunidad de adaptar estos hallazgos al mercado chileno, particularmente en sectores financieros, retail y servicios, donde la adopción de inteligencia artificial se ha acelerado durante los últimos dos años. Proveedores gestionados y firmas especializadas pueden traducir la lógica del bombardeo de contexto a servicios comercializables para empresas que carecen de equipos internos de seguridad.

Qué sigue

Es previsible que los principales proveedores de servicios en la nube incorporen variantes de esta técnica en sus ofertas de seguridad durante los próximos meses. La publicación abre una línea de investigación que combina ingeniería social, arquitectura en la nube y entrenamiento de modelos, con potencial para convertirse en un estándar de defensa.

A mediano plazo, la sofisticación de los agentes atacantes exigirá defensas que evolucionen al mismo ritmo. Las empresas chilenas que evalúen proyectos de inteligencia artificial deberán considerar la madurez de las medidas de protección antes de desplegar agentes con acceso a datos sensibles.

Artículos Relacionados

Reelful: aplicación móvil utiliza inteligencia artificial para transformar archivos fotográficos en videos cortos para redes sociales
IA

Reelful: aplicación móvil utiliza inteligencia artificial para transformar archivos fotográficos en videos cortos para redes sociales

La aplicación Reelful, recientemente lanzada para dispositivos iOS, emplea inteligencia artificial para convertir de manera automática fotografías y clips de video almacenados en el teléfono del usuario en piezas audiovisuales cortas optimizadas para plataformas como TikTok e Instagram Reels. La plataforma fue desarrollada por Kate Deyneka, ex ingeniera de aprendizaje automático en la compañía Snapchat, y actualmente participa en el programa de aceleración Speedrun de la firma de capital de riesgo Andreessen Horowitz. El lanzamiento se inscribe en una tendencia creciente de soluciones basadas en inteligencia artificial orientadas a automatizar la producción de contenido digital para usuarios individuales y empresas.

15 jul 20264 min
Anthropic y Blackstone crean Ode, empresa de implementación de inteligencia artificial valorada en USD 1.500 millones
IA

Anthropic y Blackstone crean Ode, empresa de implementación de inteligencia artificial valorada en USD 1.500 millones

La nueva compañía, fruto de una alianza entre el laboratorio de inteligencia artificial Anthropic y el fondo de inversión Blackstone, busca cerrar la brecha entre el desarrollo de modelos avanzados y su adopción efectiva por grandes corporaciones. La empresa absorberá a la startup Fractional AI y proyecta posicionarse como un actor relevante en el segmento de servicios profesionales de inteligencia artificial. La iniciativa replica los pasos de OpenAI, que recientemente lanzó una propuesta equivalente.

15 jul 20263 min
Plataforma de comercio en vivo Whatnot adquiere firma de inteligencia artificial Shaped para reforzar su motor de recomendaciones
IA

Plataforma de comercio en vivo Whatnot adquiere firma de inteligencia artificial Shaped para reforzar su motor de recomendaciones

Whatnot, aplicación de comercio en vivo, anunció la adquisición de Shaped, empresa especializada en sistemas de recomendación y búsqueda en tiempo real basados en inteligencia artificial. La operación busca fortalecer las capacidades de personalización de la plataforma, que procesa más de 500.000 horas de video en vivo cada semana. La adquisición coincide con un ciclo de fuerte crecimiento para Whatnot, que superó los mil millones de pedidos por parte de vendedores y fue recientemente valorizada en más de 11.000 millones de dólares.

15 jul 20263 min