La economía de la IA operativa: diseñar memoria y costos para una flota de agentes


Los primeros proyectos de IA empresarial enseñaron a las empresas a recuperar información. Un usuario realiza una pregunta, el sistema encuentra el contexto relevante y un modelo la convierte en una respuesta.

Los agentes de IA cambian esa ecuación porque recuperan información de forma dinámica y ajustan su propio estado en el proceso. A medida que las tareas evolucionan, manejan todo, desde el desarrollo de planes y llamadas a herramientas externas, hasta la actualización de registros y la recordedación de resultados.

Multiplicar esa actividad a lo largo de cientos o miles de agentes hace que la capa de datos comience a comportarse de forma muy diferente, con implicaciones significativas tanto para el costo como para la precisión. Estas implicaciones se han convertido en consideraciones importantes al trasladar proyectos de IA con capacidad de agentes de la fase piloto a producción.

Por qué las pruebas piloto pueden ocultar el costo real

La memoria se convierte en un sistema operativo

Las primeras pruebas suelen ser limitadas por diseño. Normalmente, hay un solo equipo trabajando con un conjunto de datos reducido y con interacciones simples y de corta duración. Tomemos, por ejemplo, solicitar un resumen de un documento. El modelo ejecuta la tarea y esa tarea queda concluida. Aquí, el acceso al modelo, los tokens y la recuperación de contexto parecen cubrir la mayor parte del gasto.

Sin embargo, al pasar de chatbots pasivos a sistemas de múltiples agentes, la economía cambia. Los costos de IA generativa tradicionales escalan linealmente con los usuarios, mientras que el coste de ejecutar despliegues de múltiples agentes tiende a escalar con la complejidad de las tareas. El gasto de concepto de prueba típico suele multiplicarse a medida que las tareas se vuelven más complejas.

Por ejemplo, AWS estima que un prototipo textual con unas 100 interacciones diarias cuesta alrededor de $40 al mes. Su estimación para un prototipo basado en agentes con una base de conocimiento y salvaguardas está aproximadamente en $840 al mes. La revisión de contratos de IA multiagente de Anthropic respalda este hallazgo.

Los datos muestran que los sistemas multiagente utilizan aproximadamente 15 veces más tokens que las interacciones de chat y que la viabilidad económica requiere que el valor de la tarea sea lo suficientemente alto como para justificar el gasto.

En los sistemas de agentes, por lo tanto, es fácil ver por qué los costos se acumulan. Los agentes emplean bucles dinámicos, llamadas a herramientas, reintentos y transferencias de contexto para completar una tarea. Pero hay otra dimensión importante: los agentes deben recordar y razonar sobre volúmenes crecientes de datos.

Los agentes tienen vidas operativas más largas que una sesión típica de chatbot. Deben recordar las acciones de ayer, conservar la evidencia detrás de una decisión y poner esa información a disposición de otros agentes dentro de la flota. Cada tarea completada se convierte en un nuevo estado.

A medida que la flota de agentes crece, la empresa paga no solo por la próxima respuesta, sino también por la creciente provenance operativa necesaria para operar de forma eficiente y segura.

Las primeras IA generativas solían tratar la memoria como contexto: se recupera cuando hace falta. Los agentes persistentes crean un requisito distinto. La memoria se convierte en un sistema operativo vivo que se actualiza constantemente.

Eso importa tanto para el rendimiento como para el costo. Un camino estrecho de escritura puede generar contención cuando más agentes actualizan registros. Copias separadas del mismo contexto aumentan el almacenamiento y el trabajo de sincronización, y mantener cada registro histórico en el nivel de almacenamiento más rápido hace que información poco usada resulte innecesariamente costosa.

Al diseñar la capa de datos para soportar una flota de agentes, el nivel de servicio determina cómo se accede y gestiona la memoria. Los líderes deben establecer cuán rápido debe estar disponible cada tipo de memoria, quién puede actualizarla, qué agentes deben compartirla y cuánto tiempo debe permanecer accesible de inmediato.

Diseñando la memoria para una flota de agentes

Tres principios principales serán cada vez más importantes a medida que aumenta la variedad y complejidad de despliegues de agentes.

El primero es la concurrencia. ¿Puede crecer la capacidad de escritura a medida que crece el número de agentes? Una infraestructura diseñada principalmente para lecturas puede comportarse de forma muy diferente cuando muchos procesos autónomos actualizan el estado al mismo tiempo.

El segundo es la memoria compartida. Si varios agentes trabajan con el mismo cliente, activo o proceso, crear copias separadas del mismo contexto puede introducir costos e inconsistencias. Una fuente común de estado puede facilitar la colaboración, siempre que los controles de acceso y la procedencia sigan claros.

El tercero es separar la memoria activa de la memoria histórica. Un agente puede necesitar las últimas acciones de un flujo de trabajo, mientras que los registros de hace seis meses podrían requerirse solo para una auditoría o una consulta inusual. Tratar estas dos categorías por igual es un valor por defecto costoso.

Con frecuencia, el estado de acceso frecuente puede permanecer cerca de la capa de cómputo, mientras que la información más antigua se mueve a un almacenamiento durable de menor costo. El cómputo puede escalar según la actividad actual en lugar de la memoria total acumulada desde el inicio del sistema.

Cómo se almacenan los cambios históricos plantea una cuestión similar. Guardar cada versión completa de un registro facilita la recuperación, pero consume más capacidad. Guardar solo cambios incrementales usa menos espacio, pero reconstruir un estado antiguo puede tomar más tiempo. Instantáneas periódicas combinadas con cambios más pequeños entre ellas pueden ofrecer una solución intermedia útil.

Qué establecer antes de escalar

Estas son consideraciones técnicas, pero establecen el modelo económico de la implementación y son más baratas de resolver antes de que el flotas de agentes crezca. Aceptar que los agentes generan información además de consumirla hace que las decisiones de diseño sean más medibles que abstractas.

Por ejemplo, cuánta memoria escribe cada agente y con qué frecuencia; cuántos agentes pueden actualizar el mismo cliente, activo o flujo de trabajo a la vez; cuánta memoria necesita acceso inmediato frente a almacenamiento durable tras un día, una semana o un mes; y si el contexto puede compartirse de forma segura en lugar de copiarse por agente.

Cada una de estas etapas tiene un costo y, en conjunto, determinan la cifra que decide la viabilidad a escala: el coste por tarea es igual al número de agentes y al volumen de memoria retenida.

Resolver estas consideraciones antes de la expansión cambia el diseño de la prueba piloto. Un equipo puede probar la carga de escritura, las reglas de retención y el modelo de compartición esperado en producción mientras el sistema aún es pequeño, punto en el que los costos ocultos son visibles y fáciles de corregir.

La economía de la IA empieza antes del modelo

Incluso si los precios de los modelos continúan caendo y la inferencia se vuelve más eficiente, los despliegues a gran escala de agentes generan un flujo creciente de datos operativos que deben escribirse, compartirse, protegerse, recuperarse y mantenerse. El costo de esa actividad dependerá en gran medida de la arquitectura subyacente al modelo, pero las empresas que planean la siguiente etapa de adopción de IA deben medir todo el ciclo de vida de una tarea de agente, incluida la memoria que deja atrás. Hacerlo antes de convertir una prueba piloto en una flota ofrece a los líderes tecnológicos una visión mucho más clara de si un sistema de IA seguirá siendo económico cuando alcance producción.

Hemos destacado las mejores herramientas de IA.

Este artículo se produjo como parte de TechRadar Pro Perspectives, nuestro canal para presentar a las mentes más brillantes de la industria tecnológica hoy.

Las opiniones expresadas aquí son las del autor y no necesariamente las de TechRadarPro o Future plc. Si está interesado en contribuir, descubra más aquí: https://www.techradar.com/pro/perspectives-how-to-submit

from Latest from TechRadar https://ift.tt/bFteIV2
via IFTTT IA