HalluSquatting y el aumento de las amenazas basadas en IA: entre la aparición de ransomware y botnets


La creciente potencia de los modelos lingüísticos y sus integraciones en herramientas de desarrollo están abriendo nuevas superficies de riesgo. Un informe reciente advierte que la alucinación de IA puede ser weaponizada, y describe un fenómeno denominado HalluSquatting (adversarial hallucination squatting). Este vector aprovecha la tendencia de los modelos a “alucinar” identificadores de recursos o repositorios cuando no puede identificarlos con certeza, para desplegar código malicioso a gran escala.

HalluSquatting se asemeja al typosquatting, pero en lugar de equivocaciones tipográficas humanas, se basa en errores del propio sistema de IA para distribuir recursos maliciosos. Si un modelo falla al identificar un repositorio o recurso con certeza, los atacantes pueden registrar recursos fantasma y sembrar prompts adversariales que, cuando son invocados por un usuario, ejecutan acciones peligrosas.

La técnica podría escalar para campañas de ransomware, botnets y otras intrusiones, especialmente en servicios de IA populares. El estudio cita herramientas como GitHub Copilot, Gemini CLI y OpenClaw entre las afectadas, aunque la lista podría ampliarse a medida que evolucionen las integraciones de IA en distintas plataformas de desarrollo.

Push-me-pull-you

Hasta ahora, las operaciones maliciosas basadas en LLM han utilizado ataques de extracción (pull). En este enfoque, un prompt diseñado para eludir o subvertir la IA se aloja en un sitio web y la IA es inducida a recolectar información, reduciendo su seguridad interna. El informe revela que las técnicas de “pull” se están combinando con ataques de “push”, tradicionalmente ejecutados como inyecciones de código, para ampliar el alcance de la intrusión.

La introducción del documento resume: “Preemptivamente registrando recursos alucinados —una técnica que llamamos adversarial hallucination squatting (HalluSquatting)— demostramos ejecución de herramientas remotas y ejecución de código remoto a gran escala en una serie de aplicaciones de LLM agentic, lo que podría facilitar el establecimiento de una botnet.”

Una vez que un atacante identifica el recurso que probablemente sea mal nombrado por un LLM y lo squattea para incrustar prompts adversariales, el preparativo queda hecho. Todo lo demás es que el usuario active el recurso, el chatbot o agente inicie la respuesta y el recurso squatteado sea accedido.

Promptware attack

Posteriormente, el contenido adversarial alojado dentro del recurso squatteado se activa, desencadenando la etapa de invocación de herramientas. Este es el “promptware attack”, donde las instrucciones controladas por el atacante se ejecutan, con resultados que podrían incluir convertir el dispositivo del usuario en un zombi de botnet.

LLMs como Cursor, Cursor CLI, Windsurf, GitHub Copilot y Cline han sido utilizados en pruebas de este vector, junto con Gemini CLI y OpenClaw, ZeroClaw y NanoClaw como asistentes de IA. Los investigadores lograron ejecución remota de herramientas (acceso y control remoto de los LLM) y ejecución remota de código (RCE, código malicioso ejecutado de forma remota).

Existen mitigaciones posibles, como que los desarrolladores de LLM bloqueen operaciones de fetch en favor de herramientas de búsqueda, y que los propietarios de recursos hagan cumplir naming estrictos, tal vez promoviendo nombres de recurso globalmente únicos. Sin embargo, estas medidas requieren cooperación entre múltiples partes y podrían tardar en implementarse.

El riesgo de malware basado en LLM está aumentando y ya se han detectado casos en la vida real. Entre ellos, el ataque JADEPUFFER destaca como notable, ya que no es simplemente malware basado en IA: es un ransomware completo ejecutado completamente por un LLM. Este panorama subraya la necesidad de una vigilancia continua, gobernanza de IA y prácticas de desarrollo seguro para mitigar posibles abusos.

from Latest from TechRadar https://ift.tt/vcM4HzY
via IFTTT IA