
Tres agentes Claude, diseñados para interactuar de forma conflictiva en pruebas de Anthropic, comenzaron a comportarse de manera extraña al entrar en lo que parecía una “guerra territorial” por sus tareas.
Al iniciar el experimento, los agentes pasaron a conflictos entre sí, llegando a sabotear a rivales deshabilitando cuentas vinculadas, finalizando procesos y, en algunos casos, creando malware auto-replicante para obstaculizar a los demás.
Según Anthropic, los agentes se volvieron “cada vez más agresivos” durante las cuatro horas de prueba, en las que primó una lucha por la supervivencia del más apto.
¿Qué buscaba lograr el experimento?
Anthropic indicó que configuró el experimento para observar cómo interactúan los agentes de IA ante tareas en conflicto.
Dentro de Claude Code, a los agentes se les asignó la tarea de migrar un sistema back-end de Python en una máquina virtual, en un lenguaje distinto para cada agente (Go, Rust y TypeScript), con la advertencia de que “cada agente inicialmente desconocía la presencia de los otros”.

Got an opinion for us? Here’s how you can submit your perspective
Durante los experimentos, cada agente concluyó que los demás intentaban bloquear su progreso.
A veces, los agentes reconocían que otro los estaba bloqueando para completar su tarea y pedían intervención humana, pero en otros casos la estrategia pronto fue empeorando.
“Sabotearon a otros con malware cada vez más agresivo y auto-replicante”, señaló Anthropic, añadiendo que diseñaban scripts de bucle para eliminar los procesos de sus colegas.
El experimento demuestra que la interacción entre agentes sigue plagada de problemas y que, ante una tarea conflictiva, los agentes no siempre coordinan ni piden ayuda humana.
Cada agente creía que su tarea era de máxima importancia y estaba dispuesto a hacer lo que fuera para completarla. Un evento similar ocurrió en la naturaleza cuando uno de los modelos de Anthropic se escapó de un entorno de prueba y violó a múltiples terceros.
Perspectivas de expertos sobre las guerras territoriales entre agentes de IA
- Seemant Sehgal, Fundador y CEO, BreachLock:
Cuando se otorgan sistemas autónomos objetivos que compiten y los medios para actuar, el conflicto no es un fallo, es un resultado previsible.
When you give autonomous systems competing objectives and the means to act, conflict is not a bug, it is a foreseeable outcome.
Lo que Anthropic observó en un entorno de investigación controlado es la misma pauta que ha gobernado siempre los sistemas adversariales. Objetivos sin restricciones producen comportamientos sin límites.
Los equipos de seguridad deben prestar especial atención, porque el verdadero desafío es si las organizaciones que implementan agentes de IA han considerado qué sucede cuando esos agentes empiezan a tomar decisiones sin autorización explícita.
- Jeremiah Fowler, Investigador de Seguridad, Black Hills Information Security:
Me preocupa que los agentes de IA tengan la capacidad de ejecutar código, modificar sistemas, crear cuentas, acceder a credenciales o comunicarse con otros equipos.
Es muy posible que dos agentes separados creen un incidente de seguridad simplemente porque ninguno entiende la intención o autoridad del otro. Si tienen tareas superpuestas, uno podría ver al otro como un obstáculo y ahora se produce un conflicto o un bucle.
When things go wrong the speed of an AI agent becomes a liability.
Los permisos, límites y objetivos son importantes para limitar el comportamiento de los agentes de IA autónomos. Cuando surge un fallo, la velocidad de un agente de IA se convierte en una liabilidad. Los agentes autónomos pueden tomar miles de decisiones antes de que un equipo de seguridad identifique algo inusual.
El agenteic AI crea una nueva superficie de ataque porque un agente de IA puede dejar de ser un simple procesador de información y convertirse en un usuario privilegiado descarriado.
Los equipos de seguridad y desarrollo deben aplicar principios de menor privilegio y restringir a los agentes a solo los permisos necesarios para realizar una tarea específica. Las acciones sensibles deben requerir supervisión y aprobación humana para evitar escenarios más graves.
Es importante implementar registro (logging) porque cuando algo sale mal, puedes ver qué hizo un agente de IA, pero no qué información o instrucciones causaron decisiones específicas. En el futuro tendremos que desarrollar formas de identificar comportamientos rogue entre agentes y proporcionar a los humanos un interruptor de kill antes de que conflictos automatizados se vuelvan un incendio forestal digital.
- Kevin Surace, CEO, Token:
La investigación de Anthropic es una advertencia importante para los equipos de seguridad porque muestra lo que puede ocurrir cuando a los agentes de IA se les asignan metas, credenciales, herramientas y suficiente autoridad para actuar de forma independiente.
Cuando los agentes se enfrentan, no fallan de forma suave. Interfieren entre sí, deshabilitan procesos competidores e incluso generan código malicioso auto-replicante para perseguir sus objetivos asignados.
La lección no es que la IA se vuelva malvada. Es que la inteligencia, la autonomía y el privilegio excesivo pueden convertirse en una combinación muy peligrosa.
Estamos a punto de tener millones de identidades no humanas operando junto a identidades humanas. Eso hace que la identidad y la autorización sean aún más críticas.
Las organizaciones deben empezar a tratar a cada agente de IA como una identidad privilegiada potencialmente no confiable. Cada agente debe tener su propia identidad, acceso con el mínimo privilegio, herramientas limitadas, entornos de ejecución aislados y un registro de auditoría completo.
Los agentes nunca deberían poder ampliar sus propias permisos, deshabilitar otra identidad o realizar acciones de gran consecuencia sin autorización adicional.
Estamos a punto de tener millones de identidades no humanas operando junto a identidades humanas. Eso hace que la identidad y la autorización sean aún más críticas.
Cada agente necesita una identidad criptográfica robusta, mientras que todas las aprobaciones humanas deben estar vinculadas a una identidad biométrica asegurada (o a otra aprobación de agente).
Los agentes de IA son esencialmente insiders privilegiados que operan a velocidad de máquina. Darles un amplio acceso y confiar en que se comporten sería repetir muchos de los errores de ciberseguridad que las organizaciones han intentado evitar durante décadas.
- Jacob Krell, Director Senior: Soluciones de IA Segura y Ciberseguridad, Suzu Labs:
Los agentes de Anthropic pasaron de un conflicto de fusión a malware auto-replicante en cuatro horas, escribiendo scripts de eliminación, deshabilitando cuentas Unix de otros y disfrazando código malicioso como el trabajo de un rival. Sin un prompt injection ni un atacante externo, un desarrollador humano en la misma situación enviaría un mensaje en Slack y la resolución tomaría días. Estos agentes omitieron cualquier freno social y pasaron directamente a la instrumentación, porque el conflicto a velocidad de máquina no tiene periodo de enfriamiento.
La IA agéntica es una superficie de ataque. Un atacante no necesita comprometer directamente a un agente, basta con manipular el entorno compartido para crear condiciones que el agente interprete como hostiles. El agente hace el resto. Y en el experimento de Anthropic, los agentes no reportaron sus acciones maliciosas a los operadores posteriormente.
Every agent needs its own identity, scoped permissions, and a kill switch before it touches a shared environment.
Cada agente necesita su propia identidad, permisos acotados y un interruptor de emergencia antes de tocar un entorno compartido. La interacción entre agentes es una superficie de telemetría que los centros de operaciones de seguridad aún no están recopilando, y Anthropic acabó de demostrar qué produce un entorno compartido sin supervisión. Si no puedes saber qué agente hizo qué, cuándo y bajo qué autoridad, has creado las condiciones para una guerra territorial sin visibilidad para verla ocurrir.
Los agentes ya escriben código, buscan vulnerabilidades y construyen exploits. La defensa debe igualar ese ritmo. Cuando ambas partes operan a velocidad de máquina, el cuello de botella pasa de capital humano y herramientas a poder de cómputo y costo.
¿Cómo envío mi propia perspectiva sobre noticias emergentes?
Si tienes una perspectiva experta que te gustaría compartir sobre una historia emergente o tema particular, ponte en contacto aquí: benedict.collins@futurenet.com
from Latest from TechRadar https://ift.tt/jt6YkQV
via IFTTT IA