
Nvidia ha lanzado NeMo Switchyard, un enrutador de modelos de código abierto que se sitúa entre una aplicación y un conjunto de modelos de lenguaje y decide, por solicitud o por turno, cuál modelo debería encargarse de una tarea concreta. El objetivo es maximizar la eficiencia eligiendo el modelo adecuado para cada tarea: empujar modelos de nivel frontier a realizar tareas simples que modelos más pequeños o más baratos podrían gestionar no solo resulta ineficiente, sino también costoso para clientes empresariales.
Este movimiento llega en un momento en que las empresas ya lidian con costos crecientes que pueden dispararse rápidamente a medida que adoptan IA. La solución de Nvidia se inscribe en una tendencia de ahorro de costos que ya está bien asentada en el sector, con actores como RouteLLM, LiteLLM y OpenRouter, además de iniciativas internas en OpenAI y AT&T.
Un enrutador de código abierto como Switchyard comparte similitudes con sus pares: funciona como un proxy que utiliza un algoritmo de enrutamiento para decidir a qué modelo enviar las consultas, al tiempo que entrega una respuesta en el formato requerido por la aplicación o el usuario que llama. Acepta solicitudes de OpenAI, Anthropic y API de Respuestas, traduce entre ellas y documenta el modelo seleccionado, la racionalidad de la decisión, el uso de tokens y la latencia de cada llamada, dando transparencia y permitiendo ajustar su enfoque con el tiempo.
Esta estrategia tiene sentido en un mundo donde el cómputo de IA de nivel frontier es limitado y donde los LLMs continúan creciendo en tamaño y demanda. Un ejemplo citado por Nvidia es Nemotron Parse, un modelo de mil millones de parámetros diseñado para extraer estructuras de PDFs.
Sin embargo, la viabilidad de este enfoque no es absoluta. Pruebas como la de LangChain sobre Nemotron 3.5 Lightning detectaron que su modelo evaluador, el que determina si la tarea aún está en curso tras cada turno, puede consumir hasta el 21,2% del costo total, situándose como el segundo mayor gasto después de Claude Opus 4.8. Ejecutar un evaluador más optimizado podría generar mayores ahorros o menos sobrecostes, pero podría obstaculizar casos donde se necesita un modelo de IA más básico; además, el evaluador incrementa costos al leer o verificar la salida en cada turno.
Otra preocupación es la variabilidad de costos: aunque en pruebas el enrutamiento reduce el gasto medio frente a correr solo Opus 4.8, la distribución de costos se ensancha, variando entre aproximadamente $2.16 y $3.61, una oscilación del 67% motivada por cuándo se escaló a un modelo más grande o más capaz. Esta trade-off dificulta la predicción de costos: el enrutamiento reduce el gasto medio, pero ensancha la distribución.
LangChain advierte además que Switchyard no es adecuado para cargas de trabajo cortas o con alta sensibilidad a la latencia; estiman que añade aproximadamente 700 ms de latencia debido a la necesidad del evaluador de leer toda la salida.
La visión de Nvidia es clara: empujar una solución empaquetada y de código abierto que ofrece un conjunto amplio de integraciones en un espacio relativamente fragmentado. Enviar el trabajo de inferencia a modelos más pequeños de código abierto impulsa la inferencia hacia el hardware propio que Nvidia vende a las empresas.
Al mismo tiempo, la inferencia más barata por tarea históricamente ha significado más inferencia, no menos, lo que podría favorecer a una empresa que comercializa aceleradores para atraer a las empresas, muchas de las cuales aún se muestran reacias a invertir directamente en el hardware que impulsa todo.
En conjunto, NeMo Switchyard representa una propuesta atractiva para clientes que buscan optimizar costos y mejorar la trazabilidad de decisiones en entornos de IA, al tiempo que abre un debate sobre el equilibrio entre costo, latencia y precisión frente a modelos de diferentes tamaños y capacidades.
from Latest from TechRadar https://ift.tt/qLI0ABS
via IFTTT IA