
AMD y Cerebras Systems han anunciado una asociación técnica que empareja el sistema Helios a escala de rack de AMD con la Wafer-Scale Engine (WSE) de Cerebras, en lo que ambas compañías denominan una solución de inferencia desagregada. Este movimiento ha permitido una configuración combinada de AMD Helios y Cerebras WSE para entregar hasta cinco veces más tokens por segundo por vatio (TPS/W) en pruebas internas realizadas por los dos diseñadores de chips.
El objetivo es abordar un desafío de eficiencia de la WSE de Cerebras desplazando el procesamiento de prompts hacia la oferta en rack de AMD. A la vez, la noticia se enmarca en un esfuerzo más amplio de ampliar la capacidad de inferencia de IA manteniendo la eficiencia energética, una prioridad para un sector que busca escalar sin disparar el consumo energético.
¿Una jugada centrada en ganancias de eficiencia?
Tanto AMD como Cerebras presentan la noticia como una victoria potencial, y no es difícil ver por qué: mejoras de eficiencia de Cerebras y la capacidad de AMD para acceder a tecnología de decodificación SRAM sin afrontar el gasto asociado a inversiones estratégicas significativas. Sin embargo, es importante señalar que las afirmaciones de 5 tokens por segundo por vatio se comparan con una configuración base existente de Cerebras WSE ejecutando el modelo abierto Kimi 2.6 1T, lo que las hace impresionantes, pero no ofrecen una comparación directa con cifras de una oferta rackscale de Nvidia, lo que aporta contexto limitado cuando la métrica clave es eficiencia.
La idea es sólida y establecida en la industria: la WSE es conocida por tener dificultades con la parte de prellenado (pre-fill) y, en cambio, maneja relativamente bien la decodificación, sustituyendo el hardware de Cerebras por el de AMD donde el equipo de Cerebras queda corto.
No obstante, la elección del modelo Kimi 2.6 merece un análisis más detenido. Moonshot AI lanzó este modelo en abril de 2026; es un diseño de mezcla de expertos con un total de 1 billón de parámetros, pero solo 32 mil millones activos por token, y se entrega de forma nativa en INT4. A INT4, el conjunto completo de pesos se sitúa alrededor de 500 GB. Un wafer de Cerebras contiene 44 GB. Incluso antes del KV cache, una implementación solo con Cerebras requeriría más de una docena de wafers para sostener el modelo, mientras que un rack Helios podría sostenerlo más de sesenta veces. Este desequilibrio implica que la cifra de cinco veces se mide sobre un modelo que es poco favorable para una configuración WSE única. Un modelo denso lo suficientemente pequeño como para residir en un puñado de wafers podría favorecer significativamente a Cerebras. Nada de esto invalida la cifra, pero sí sugiere la necesidad de pruebas adicionales para demostrar fortalezas y debilidades en diferentes modelos.
Una asociación sin números concretos, por ahora
Más importante aún, la ausencia de información financiera podría convertirse en un tema de interés futuro, especialmente en un momento en que existen preocupaciones crecientes sobre el financiamiento circular en una industria donde Nvidia respaldó recientemente compras de data centers para OpenAI, lo que fue visto por los analistas como un posible lastre para el gasto en IA. En el pasado, AMD ha ligado compras de su propio hardware a inversiones o participaciones en empresas de IA, movimientos que inicialmente fueron bien recibidos, pero que podrían ser recibidos con menos entusiasmo en el entorno actual.
El anuncio llega en un momento en que Cerebras podría necesitarlo más que AMD: Cerebras salió a bolsa en Nasdaq en mayo, con una valoración inicial de 185 dólares por acción, abrió en 350, y cerró su primera jornada en 311,07 antes de caer hacia 227 a finales de junio de 2026. Por otro lado, las acciones de AMD han mostrado un incremento significativo en lo que va del año, y la asociación con Cerebras podría verse como una validación adicional de la estrategia de AMD para ampliar su ventaja en el ecosistema de IA, especialmente entre clientes potenciales que buscan soluciones de alto rendimiento y eficiencia.
En resumen, esta colaboración destaca una tendencia clave en la industria: la capacidad de combinar infraestructuras de inferencia de alto rendimiento con racks de procesamiento para optimizar la eficiencia energética y la capacidad de procesamiento de prompts a gran escala. A medida que se dispongan más datos sobre rendimiento y costos, la conversación sobre la valuación y la sostenibilidad de estas inversiones probablemente se clarificará.
from Latest from TechRadar https://ift.tt/btKJO7R
via IFTTT IA