Jalapeño de OpenAI: eficiencia frente a rendimiento en la competencia de chips de IA


OpenAI presentó en Hot Chips las primeras cifras de rendimiento de Jalapeño, el acelerador de inferencia que co-desharrolló con Broadcom, y los números están destinados a leerlos enfatizando la eficiencia. En una propuesta centrada en la gestión de recursos, la compañía afirma obtener 1.5 a 1.9 veces más rendimiento por kilovatio y entre 1.7 y 3.6 veces menor latencia de extremo a extremo en tres modelos abiertos frente a sistemas en rack de Nvidia.

Jalapeño se presenta como un ASIC (circuito integrado específico para una aplicación) concebido para cargas de trabajo de IA muy concretas, en este caso las necesidades de inferencia de OpenAI. El equipo de hardware, liderado por Richard Ho, señaló que los resultados constituyen un avance significativo frente al estado del arte, destacando la eficiencia como eje central.

La comparación pública se realizó con medidas de rendimiento a 700 W frente a 1200–1400 W de silicio de Nvidia, lo que ya establece una diferencia clave en un contexto de benchmarks con información limitada para investigadores que buscan un claro ganador. Sin embargo, estas cifras son autopublicadas y la producción en volumen de Jalapeño no se espera que aumente hasta 2027, lo que invita a interpretar los resultados con cautela.

La eficiencia en IA toma protagonismo

Jalapeño es un ASIC diseñado para mantener el estado del modelo localmente, minimizando el movimiento de datos y las demoras de comunicación. Las arquitecturas agrupan cores y memoria en cortes que comparten vistas de memoria de baja latencia, con sincronización gestionada por una red colectiva dedicada. Cada paquete combina un dado de cálculo con seis pilas de HBM4, alcanzando 216 GiB a 15.4 TB/s, lo que implica menos capacidad bruta que el Gb300 de Nvidia, pero mayor ancho de banda y aproximadamente un 50% más de memoria por vatio en potencia nominal.

Todos los datos publicados provienen del silicio A0, la primera iteración. Se espera una versión más eficiente, B0, con aproximadamente un 25% más rendimiento por vatio, y la producción está prevista para escalar de manera gradual durante 2027.

OpenAI afirma que Jalapeño está diseñado para limitar la movilidad de datos y demoras de sincronización, con una división de núcleos y memoria en cortes que comparten memorias de baja latencia y una red dedicada para la sincronización. Cada paquete empareja un dado de cómputo con seis pilas de HBM4 para 216 GiB y 15.4 TB/s, lo que aporta una capacidad de memoria por vatio competitiva frente a la competencia.

En la presentación se mencionó que las pruebas utilizaron predicción de un solo token, sin decodificación especulativa y sin desagregación de prefill-decode. Nvidia, por su parte, ha desplegado con frecuencia predicción multin-token; cuando Jalapeño se compara con un GB300 configurado así, la ventaja de eficiencia máxima se reduce a aproximadamente 1.5x.

OpenAI sostiene que el diseño mantiene el estado del modelo de forma local, reduciendo movimientos de datos y retardos de comunicación. Sin embargo, la comparación entre rendimiento por vatio y rendimiento por paquete puede presentar una visión sesgada si no se consideran las condiciones de uso reales, como la predicción multin-token frente a escenarios de inferencia más limitados.

La investigación sugiere que, aunque Jalapeño no iguala a Vera Rubin de Nvidia en rendimiento absoluto, podría no necesitar hacerlo para cumplir con su objetivo: impulsar la eficiencia en inferencia. Nvidia ha indicado que ya está desplegando vera Rubin, y OpenAI no ha publicado comparaciones directas con la tecnología Vera Rubin, lo que deja abierta la discusión sobre las diferencias de arquitectura y rendimiento en distintos escenarios de uso.

Además de la capacidad de cómputo, el diseño de Jalapeño prioriza la localización de datos y la reducción de movimientos, un factor clave para la eficiencia energética en infraestructuras de IA. Con una producción que se prevé escale gradualmente hasta 2027, el ecosistema de IA podría ver una dinámica de competencia entre eficiencia y rendimiento brutos, especialmente en entornos donde la relación costo-energía es crítica.

La conversación se enmarca en un momento en que Nvidia continúa expandiendo su cartera y se siente la presión de un mercado en crecimiento para soluciones de inferencia con márgenes variables. Analistas señalan que esta rivalidad podría afectar las decisiones de inversión en infraestructura de IA, donde la eficiencia de la inferencia se está convirtiendo en un factor cada vez más relevante para el costo total de propiedad.

from Latest from TechRadar https://ift.tt/jr9Qzkl
via IFTTT IA