Agentes con inteligencia: gestionando el riesgo de sistemas autónomos en entornos empresariales


En poco más de dos semanas durante este verano, tres de los desarrolladores de IA más observados dejaron en claro una realidad inquietante: sus propios modelos se habían desbordado del sandbox y accedieron a sistemas con los que no debían interactuar.

OpenAI anunció el 21 de julio que algunos modelos evaluados aprovecharon una vulnerabilidad y comprometieron la infraestructura de producción en Hugging Face, un incidente que la empresa atribuyó a un agente autónomo con intervención humana mínima.

días después, Anthropic comunicó que tres de sus modelos Claude, incluido Opus 4.7 y Mythos 5, habían accedido y comprometido sistemas de tres organizaciones externas durante ejercicios de ciberseguridad, tras una configuración errónea que dejó a los modelos conectados a Internet cuando se les había indicado lo contrario.

Y el 5 de agosto, Meta confirmó que su modelo Muse Spark 1.1 vulneró los sistemas de una empresa no identificada en circunstancias sorprendentemente similares.

Un patrón, no una anomalía

A este ritmo, no es un evento aislado que las áreas de seguridad puedan planificar una vez al año. Se está convirtiendo en una línea recurrente. Cabe destacar que los incidentes de Anthropic y Meta se remontan al mismo socio externo de evaluación y, en el caso de Meta, el riesgo cibernético del modelo ya había sido evaluado como moderado antes de que el proceso de pruebas que buscaba confirmar esa valoración terminara vulnerando a una empresa real.

Ese detalle importa porque revela que el punto de fallo no es únicamente el modelo. Es la estructura circundante de evaluaciones, permisos y rutas de red que las organizaciones suponen contenidas hasta que ya no lo están.

Debe tomarse como una advertencia temprana para las organizaciones sobre sistemas autónomos que pasan de generar contenido a ejecutar acciones. La lección práctica, repetida tres veces, es que los sistemas de IA avanzada pueden comportarse de maneras dañinas o inesperadas incluso cuando el objetivo original no es malicioso, especialmente cuando se les proporcionan herramientas, rutas de red, credenciales e incentivos para completar una tarea a cualquier costo.

Para las empresas, la conclusión no es abandonar la adopción de IA. Es tratar a la IA con agencia como una nueva clase de carga de trabajo privilegiada que requiere contención, observabilidad y controles de ejecución aplicables en tiempo real.

Gobernar a los agentes como trabajadores digitales de alto riesgo

Eso inicia con la gestión de identidades de agentes de IA. Las compañías deben reforzar esta disciplina y ser muy deliberadas sobre lo que los agentes pueden acceder y hacer. Cada agente debe tener una identidad única, permisos acotados, credenciales de corta duración y una propiedad clara, de modo que las acciones se puedan rastrear hasta un sistema, un caso de uso y un responsable empresarial concreto.

El acceso debe estar limitado por defecto, con puertas de aprobación explícitas para actividades de mayor riesgo como acceso a Internet, ejecución de código, obtención de credenciales, movimiento de datos o cambios en sistemas de producción.

En términos prácticos, las organizaciones deben gobernar a los agentes de IA como trabajadores digitales de alto riesgo: mínimo privilegio por defecto, separación entre entornos de prueba y producción, registro detallado del uso de herramientas e interacciones con sistemas, y un interruptor de emergencia que los equipos de seguridad puedan activar en cuanto el comportamiento se desvíe de la política.

Prevención, supervisión y el camino por delante

La prevención también requiere ir más allá de las pruebas tradicionales de seguridad de aplicaciones. Las organizaciones deben realizar pruebas de red interna sobre los agentes contra rutas de uso indebido realistas, incluyendo inyección de prompts, abuso de herramientas, movimiento lateral, recopilación de credenciales, exfiltración de datos y intentos de eludir restricciones del sandbox. También deben supervisar continuamente a los agentes en busca de impactos dañinos, no solo fallos técnicos.

Eso implica vigilar intentos de acceso no autorizado, comportamientos inusuales de encadenamiento de herramientas, movimientos de datos inesperados, violaciones de políticas y acciones que podrían generar daño operativo, de seguridad, de privacidad o reputacional. Auditorías periódicas deben revisar permisos de los agentes, identidades, registros, justificación empresarial y comportamiento real para confirmar que cada agente sigue operando dentro de su propósito y tolerancia al riesgo.

¿Se convertirá esto en una tendencia? Con tres divulgaciones en diecisiete días, la pregunta está prácticamente respondida. Los agentes autónomos podrán descubrir, combinar y explotar debilidades más rápido de lo que pueden responder los procesos de seguridad tradicionales.

El riesgo no es simplemente “IA hackeando IA”. Es la toma de decisiones autónoma operando dentro de ecosistemas digitales complejos donde un modelo, un plugin, un conjunto de datos, una API o una ruta de identidad puede convertirse en el puente hacia otro entorno, exactamente lo que ocurrió en Hugging Face, dentro del entorno de pruebas de Anthropic y, ahora, en Meta.

Las empresas mejor posicionadas serán aquellas que unan innovación en IA con una gestión disciplinada de identidades, limitación de accesos, supervisión continua y prácticas de auditoría rutinarias, en lugar de tratar cada nuevo aviso como un incidente aislado al que responder luego.

El mensaje práctico para ejecutivos, especialmente a medida que esta lista de compañías continúa creciendo, es que la IA con agencia puede crear valor empresaria significativo, pero solo si la autonomía va acompañada de responsabilidad, contención y salvaguardas operativas.

Hemos destacado el mejor software de protección de endpoints.

Este artículo fue producido como parte de TechRadar Pro Perspectives, nuestro canal para presentar a las mentes más brillantes de la industria tecnológica actual.

Las opiniones expresadas aquí son las del autor y no necesariamente las de TechRadarPro o Future plc. Si te interesa contribuir, descubre más aquí: https://www.techradar.com/pro/perspectives-how-to-submit

from Latest from TechRadar https://ift.tt/tMEuiTh
via IFTTT IA