Agentes de codificación con inteligencia artificial: riesgos de escape de sandbox y la necesidad de un marco de seguridad específico



En los últimos meses, expertos en ciberseguridad han advertido sobre la posibilidad de que los agentes de codificación basados en IA sean engañados para activar a sus operadores y ayudar a comprometer sistemas subyacentes. Investigadores de Pillar han examinado diferentes métodos para lograr resultados similares, descubriendo que, a lo largo de un par de meses, Cursor, Codex, Gemini CLI y Antigravity pudieron reproducir escapes de sandbox y evadir límites.

En teoría, un atacante podría crear un repositorio que contenga contenido malicioso (por ejemplo, un archivo README, una dependencia u otro similar) y engañar al desarrollador para que lo use. Las instrucciones maliciosas indican al agente que cree o modifique un archivo de configuración del proyecto, pero dado que todo ocurre dentro del área de trabajo, no se disparan alarmas.

Encabezado: Reparando los problemas

Luego, un componente del host fuera del sandbox (integración con Git, una extensión de IDE o un demonio local) lee esa configuración modificada y ejecuta comandos escritos por el atacante. En consecuencia, el código se ejecuta con los privilegios del componente de host confiable, en lugar del limitado agente de IA. Voilà: el límite del sandbox queda efectivamente eludido.

Tres de las cuatro plataformas mencionadas en el informe ya corrigieron las vulnerabilidades divulgadas, según Pillar.

Cursor parcheó múltiples vulnerabilidades en la versión 3.0.0, con una asignada como CVE-2026-48124 y otra rastreada a través de una Advisoria de Seguridad en GitHub. Codex CLI lo solucionó en la versión 0.95.0, pero enfatizó que aún está a la espera de un CVE. Gemini CLI se vio afectado por un problema con el demonio de Docker, que, según el informe, también se corrigió mediante la advisory GHSA-v4xv-rqh3-w9mc.

Para Antigravity, Google reconoció ambas violaciones de sandbox como hallazgos de seguridad válidos, pero las calificó como «Otras vulnerabilidades de seguridad válidas» y redujo su severidad. Al parecer, considera la explotación difícil.

“Cuando se trata de agentes, el límite de sandbox que los desarrolladores esperan en herramientas de codificación —uno que mantenga al agente dentro del sandbox y al usuario fuera— se rompe,” concluyó Pillar. “El límite que seguimos encontrando era más desordenado y poroso, porque si un agente llega a escribir los futuros inputs de los sistemas, nunca estuvo aislado en primer lugar.”

“Por eso se necesita un modelo de amenaza propio para la seguridad basada en agentes.”

from Latest from TechRadar https://ift.tt/TybOCjf
via IFTTT IA