
La seguridad de los agentes de inteligencia artificial (IA) que operan con acceso amplio a herramientas externas sigue siendo un desafío crítico. Un informe reciente de Salt Labs ilustra cómo las protecciones contra la inyección de prompts pueden verse sorteadas y cómo la ejecución de código puede ocurrir a través de técnicas de ofuscación como JSFuck, incluso cuando existen salvaguardas aparentes.
Investigadores de Salt Labs analizaron la integración de Manus con Gmail y demostraron que un correo electrónico con un prompt oculto podría ser identificado por un agente de IA como malicioso, pero logró transformarse en instrucciones ejecutables. Este hallazgo subraya una distinción crucial: la diferencia entre considerar el contenido como datos pasivos y tratarlo como comandos ejecutables dentro del entorno del agente. La capacidad de detectar una posible amenaza no siempre impide su ejecución si el entorno del agente permite operar sobre herramientas y servicios conectados.
Durante la prueba, los investigadores exploraron distintas enfoques para ocultar prompts, incluyendo la codificación en Base64 y la decodificación/ejecución con Python. El progreso culminó con el uso de JSFuck, una técnica de ofuscación de JavaScript que emplea un conjunto reducido de caracteres y que, en entornos modernos, es poco habitual. Al insertar un payload sencillo en JSFuck dentro de un correo, lograron que se ejecutara un código JavaScript arbitrario en un entorno del servidor, observando el resultado previsto. Este desarrollo marcó una violación clara de límites de seguridad: el contenido de un correo no confiable fue transformado en código ejecutable dentro del runtime del agente.
Es relevante señalar que Manus sí notificó al usuario tras la ejecucion del código, pero la alerta llegó tarde para evitar el daño potencial. Salt Labs comunicó sus hallazgos a través del programa de recompensas de Meta, y la situación se consideró ya resuelta, no siendo explotable actualmente.
Una lección clave emerge de este informe: los salvaguardas que inspeccionan prompts y el comportamiento del modelo son necesarios, pero no suficientes por sí solos. La seguridad debe extenderse a lo que un agente realmente hace a través de las herramientas, APIs y sistemas a los que tiene acceso. Este caso resalta la necesidad de un enfoque integral que cubra tanto la detección de entradas como la gestión de permisos y controles operativos en los entornos en los que los agentes actúan.
En un contexto donde cada vez más usuarios permiten a sus agentes el acceso a correo, navegadores, almacenamiento en la nube y calendarios, la exposición a vectores de ataque se mantiene vigente. Las organizaciones deben evaluar cuidadosamente los riesgos asociados a la ampliación de permisos y adoptar prácticas de seguridad que vayan más allá de la supervisión de prompts, incorporando controles en la cadena de ejecución y supervisión continua de las acciones de los agentes en todos los sistemas conectados.
Para quienes diseñan e implementan soluciones de IA, este episodio sirve como recordatorio de que la innovación debe ir acompañada de una gobernanza de seguridad rigurosa y dinámica, capaz de adaptarse a técnicas de ataque cada vez más sofisticadas y a la creciente interconexión entre herramientas y servicios.
from Latest from TechRadar https://ift.tt/txXhkH7
via IFTTT IA