
GenStorAIGE ha presentado su plataforma de aceleración de inferencia AI90 en WAIC 2026, adoptando un enfoque centrado en el almacenamiento para ampliar la capacidad efectiva de memoria en IA. En lugar de depender exclusivamente de la memoria de alta velocidad de la GPU, la plataforma incorpora unidades SSD PCIe Gen5 directamente en la jerarquía de memoria, permitiendo que porciones de la caché de valores clave (KV Cache) utilizadas por grandes modelos de lenguaje se sitúen fuera de la memoria de la GPU.
Tres niveles de memoria para inferencia inteligente
AI90 fusiona HBM, DRAM del sistema y SSD en una estructura de memoria de tres niveles para gestionar cargas de trabajo de inferencia. Al trasladar de forma transparente los datos de la caché KV a los SSD, la plataforma reduce la presión sobre la memoria de la GPU, al tiempo que soporta cargas de trabajo significativamente mayores y ventanas de contexto más largas. Según GenStorAIGE, esta arquitectura reduce la latencia del primer token de varios segundos a tiempos de respuesta por debajo de un segundo en configuraciones compatibles, lo que representa hasta 50 veces una mejora de latencia, junto con ganancias de rendimiento de hasta 5,1 veces y una reducción de alrededor del 39% en el uso de memoria de la GPU.
Cuando se combina con una comunicación entre GPUs inteligente, AI90 puede acelerar la inferencia en sistemas con ocho tarjetas Nvidia GeForce RTX 5090 hasta 5,8 veces, lo que permite que un conjunto de ocho GPUs se comporte más similar a un clúster de 46 GPUs durante tareas de inferencia sostenidas. La arquitectura también soporta ventanas de contexto superiores a 128,000 tokens, posibilitando un procesamiento de documentos y conversaciones mucho más amplios sin agotar la memoria disponible.
El SSD PT200Z para cargas intensivas de escritura
Para apoyar las cargas de escritura continuas generadas por actualizaciones constantes de la caché KV, GenStorAIGE empareja AI90 con su nueva solución SSD PT200Z AI. Construido con Flash pSLC y conectado a través de PCIe Gen5 x4, el drive ofrece velocidades de lectura secuencial de hasta 14,8 GB/s y un rendimiento de lectura aleatoria de aproximadamente 3,1 millones de IOPS, con una latencia de lectura de tan solo 54 microsegundos. La latencia de escritura se reduce aún más a 10 microsegundos, soportando las rápidas actualizaciones de caché de las que depende la arquitectura AI90. Las credenciales de durabilidad llegan a 100 escrituras por día por unidad, lo que resulta adecuado para cargas empresariales de IA sostenidas con datos de caché en constante cambio.
Una tendencia de memoria por capas en IA
Este enfoque refleja un cambio más amplio en la infraestructura de IA hacia la jerarquía de memoria, ya que los LLMs continúan superando los límites prácticos de la HBM de la GPU. Integrar almacenamiento SSD extremadamente rápido en las canalizaciones de inferencia ofrece una vía para escalar la longitud del contexto sin requerir GPUs adicionales o configuraciones de HBM más grandes. Aun así, es importante señalar que, como ocurre con la mayoría de anuncios de proveedores, estas métricas de rendimiento provienen directamente de GenStorAIGE y requieren validación independiente a través de pruebas en cargas de trabajo de IA del mundo real.
Fuentes y contexto
– El anuncio de AI90 y su enfoque de memoria en WAIC 2026.
– Descripciones de la arquitectura de tres niveles que integran HBM, DRAM y SSD.
– Especificaciones del SSD PT200Z: lectura secuencial y aleatoria, latencias, durabilidad y su papel en actualizaciones de caché de KV.
– Observaciones sobre la necesidad de verificación independiente más allá de pruebas controladas.
Nota final
La visión de GenStorAIGE subraya una pregunta crítica para la comunidad de IA: ¿cuánto de la capacidad de memoria efectiva puede descentrarse de la GPU sin comprometer la latencia ni la coherencia de caché en escenarios de inferencia de gran escala? AI90 propone una vía para ampliar ventanas de contexto y rendimiento, pero su adopción dependerá de la validación en casos de uso diversos y de la madurez de las soluciones de gestión de caché entre CPU, GPU y almacenamiento.
from Latest from TechRadar https://ift.tt/9yu7tYf
via IFTTT IA