
La seguridad en entornos de inteligencia artificial es un desafío dinámico. Un informe reciente de Varonis expone una cadena de vulnerabilidades en Copilot, denominada CoSnitch, que podría facilitar la filtración de datos sensibles si se combina con ciertas tácticas de explotación. Aunque Microsoft ya implementó un parche del CVE-2026-24301 a nivel servidor, las implicaciones de CoSnitch se extienden más allá de un único producto y podrían afectar a otros modelos de IA con interfaces similares.
El hallazgo subraya un punto crítico: la interacción entre humanos y sistemas de IA puede revelar debilidades de diseño que los atacantes podrían aprovechar. En lugar de buscar fallos puramente técnicos, los investigadores describen una metodología de investigación basada en la interacción con la IA para mapear sus defensas y, eventualmente, identificar rutas de evasión conocidas como “meta-hacking”.
El concepto de CoSnitch
CoSnitch se describe como una cadena de tres vulnerabilidades que Microsoft posteriormente etiquetó como CVE-2026-24301, calificada con una severidad alta (8.8/10). La complejidad radica en que estas fallas permiten desencadenar una exfiltración de datos mediante una secuencia de acciones que involucran respuestas de la IA y la forma en que se gestionan las instrucciones y la memoria del sistema.
Cómo funciona el riesgo: la “manipulación” en lugar de la explotación directa
Los investigadores de Varonis describen que, durante sus pruebas, no buscaron errores en el código, sino que dialogaron con el sistema para entender sus límites y guardias. Este enfoque, denominado por ellos “meta-hacking”, implica que cada negativa del modelo se convierta en una pista sobre cómo podría colaborar de manera controlada con el atacante. En palabras de los investigadores, la resistencia del sistema es parte de la técnica: se trata de manipular el modelo para que coopere, no de explotar un fallo directo.
Al final de una conversación sostenida con Copilot, los investigadores lograron obtener indicios que podrían facilitar la creación de una URL maliciosa que, al hacer clic, desencadenara una cadena que permitiría la exfiltración de datos sensibles.
Riesgos al conectar IA con aplicaciones
Un ejemplo técnico publicado sugiere que una URL como https://ift.tt/HzRQ6ZF podría hacer que Copilot ejecute prompts maliciosos cuando se accede a ella. En escenarios donde la IA está conectada a servicios como Gmail, Drive, Calendar y otros, las posibles exfiltraciones se agravan: direcciones de correo, contraseñas y otros secretos podrían propagarse a infraestructuras controladas por atacantes, o extraerse de documentos y eventos calendarizados.
La tercera pieza de la vulnerabilidad, denominada “Persistent memory poisoning via web summarization”, describe cómo un atacante podría diseñar una página web cuya resumen por Copilot inyectaría instrucciones en la memoria permanente del usuario. Esta persistencia podría sobrevivir a cambios de contraseñas, revocación de sesiones y reinscripción de dispositivos, planteando un riesgo de persistencia de malware conceptual dentro de las sesiones de IA.
Este tipo de fallo se conoce como “indirect prompt injection” y se debe a la dificultad de la IA para diferenciar entre instrucciones y datos para analizar, un tema que no es nuevo, pero que se ve potenciado al introducir interfaces de lenguaje natural y capacidades de razonamiento autónomo.
Respuesta y adaptaciones
Microsoft informó sobre CoSnitch a finales de 2025 y aplica una corrección a nivel servidor desde mediados de agosto de 2026. Dada la naturaleza del problema, no hay acciones que los usuarios deban realizar para mitigarla en este momento. Sin embargo, la investigación sugiere que otros modelos de IA con interfaces similares podrían ser susceptibles a técnicas análogas, por lo que la industria debe mantener una vigilancia continua y revisar el diseño de guardrails y de memoria de las IA para evitar efectos de memoria persistente o escalamientos de prompts abusivos.
El estudio de Varonis indica que la novedad de la técnica reside en “la capacidad de usar el razonamiento de la IA para exponer sus propios internos”. Dado que este enfoque podría aplicarse a cualquier plataforma con interfaces de lenguaje natural y capacidades de agents, es probable que se publiquen investigaciones adicionales en el futuro para ampliar la comprensión de estas dinámicas y proponer defensas más robustas.
from Latest from TechRadar https://ift.tt/HGwkLy7
via IFTTT IA









