- Los investigadores de Pillar demostraron escapes de la zona de pruebas en agentes de codificación de IA
- El exploit permite que las configuraciones escritas por el atacante se ejecuten con privilegios de host confiables.
- La seguridad agente necesita su propio modelo de amenaza, afirman los investigadores
Los expertos advierten que se puede engañar a los agentes de codificación de IA para que se vuelvan contra sus operadores y ayuden a los atacantes a comprometer los sistemas subyacentes.
La investigadora de ciberseguridad Pilar probó diferentes métodos para lograr el mismo resultado y descubrió que Cursor, Codex, Gemini CLI y AntiGravity podían reproducir escapes de sandbox y evasiones de límites en unos pocos meses.
En teoría, un actor de amenazas podría crear un repositorio que contenga contenido malicioso (por ejemplo, un archivo README, una dependencia o similar) y engañar al desarrollador para que lo utilice. Las instrucciones maliciosas le dicen al agente que cree o modifique un archivo de configuración del proyecto, pero como todo sucede dentro del espacio de trabajo, no se activa ninguna alarma.
Solucionar los problemas
Luego, un componente del host fuera del entorno sandbox (integración de Git, una extensión IDE o demonio local) lee esa configuración modificada y ejecuta los comandos escritos por el atacante. Como resultado, el código ahora se ejecuta con el beneficio de componentes de host confiables en lugar de agentes de IA limitados. Voila: el límite original de la zona de pruebas se omite efectivamente.
Tres de las cuatro plataformas mencionadas en el informe solucionaron los problemas revelados, dijo Piller.
Cursor parchó múltiples vulnerabilidades en la versión 3.0.0, incluida una designada CVE-2026-48124 y otra rastreada a través de un aviso de seguridad de GitHub. Codex CLI solucionó este problema en la versión 0.95.0, pero enfatizó que todavía está esperando un CVE. La CLI de Gemini se vio afectada por el problema del demonio Docker, que, según se informa, también se solucionó mediante el aviso GHSA-v4xv-rqh3-w9mc.
Para AntiGravity, Google reconoció que ambas omisiones de sandbox reportadas eran consecuencias de seguridad legítimas, pero las etiquetó como “otras vulnerabilidades de seguridad legítimas” y minimizó su gravedad. Obviamente, esto dificulta bastante la explotación.
“Cuando se trata de agentes, los límites de la zona de pruebas que los desarrolladores esperan en las herramientas de codificación (que mantienen al agente dentro de la zona de pruebas y al usuario fuera) se rompen”, concluye Pilar. “Los límites que encontramos eran confusos y porosos, porque si un agente escribe entradas futuras en el sistema, en primer lugar, no estaba protegido”.
“Es por eso que la seguridad agente necesita su propio modelo de amenaza”.
El mejor antivirus para todos los bolsillos
Siga TechRadar en Google News Y Agréganos como fuente preferida Recibe noticias, reseñas y opiniones de nuestros expertos en tu feed.