El estado actual de los agentes IA: rendimiento, límites y recomendaciones para elegir según el uso


Las investigaciones recientes de Decodo señalan que los agentes de IA aún no pueden realizar tareas de navegación en el mundo real de manera autónoma. Esto incluye acciones como completar formularios, gestionar transacciones, mantener conciencia entre varias pestañas y manejar integraciones con terceros. En un análisis que evaluó 45 agentes repartidos en 10 capacidades distintas, ningún participante logró la puntuación máxima de 20 puntos.

El estudio también revela discrepancias entre lo que los proveedores y desarrolladores afirman que sus agentes pueden hacer y lo que realmente pueden entregar. En este sentido, la evaluación sugiere que, si bien existen avances, la ejecución práctica de tareas complejas sigue enfrentando obstáculos importantes.

El estado actual de la navegación autónoma

Claude for Chrome obtuvo la puntuación más alta, con 18 puntos (dos puntos por debajo del máximo teórico). Por otro lado, la extensión de ChatGPT para Chrome obtuvo 14 puntos, quedando por detrás. En general, los agentes tienden a quedarse rezagados principalmente en las transacciones: la categoría de menor puntuación promedia 0.43 de 2. Aunque pueden avanzar hasta la etapa de pago, no logran completar la compra en nombre del usuario.

Además, aunque un agente pueda efectuar una compra, el informe advierte que puede no contar con salvaguardas adecuadas para proteger información sensible como números de tarjetas de crédito. Las salvaguardas son un tema crítico en el trabajo de Decodo; el estudio también señala que, en flujos de trabajo de varias etapas, más de la mitad de los agentes carecían de salvaguardas documentadas antes de realizar acciones irreversibles.

Aunque la tecnología de agentes sigue sin cumplir sus promesas completas, una tipología parece estar cerca de destacar: varios agentes nativos del navegador lograron puntuar la máxima en la competencia de conciencia entre pestañas. Esta capacidad podría indicar una dirección prometedora para escenarios que requieren coordinación entre contextos diferentes dentro del navegador.

Como señala Gabriele Vitke, líder del equipo de Marketing de Producto: “Coincide la herramienta con la tarea, no la lista de características más larga”. Este enfoque invita a los usuarios de agentes IA a evaluar sus propias necesidades y no dejarse llevar por estrategias de marketing que prometen capacidades amplias sin evidencia sólida de implementación en tareas reales.

En resumen, aunque las soluciones actuales de agentes IC (agentic) muestran progresos notables, aún no alcanzan un nivel de autonomía total para navegación y transacciones complejas. La selección del agente adecuado debe basarse en el uso previsto, priorizando aquellos que demuestren seguridad, salvaguardas adecuadas y capacidades específicas para las tareas que se desean automatizar.

Imagen destacada: una visualización que acompaña el análisis muestra un enfoque orientado a la evaluación objetiva de capacidades, recordando que la adecuación de la herramienta al trabajo es fundamental para obtener beneficios reales.

from Latest from TechRadar https://ift.tt/XseWMnN
via IFTTT IA