Coherencia a gran escala: una visión sobre un datacenter de IA con casi 1,000 GPUs conectadas por CXL



En el mundo de la inteligencia artificial, la escala y la cohesión del procesamiento se han convertido en factores decisivos para lograr avances sustantivos. Recientemente, se ha presentado una propuesta de diseño de data center que busca habilitar miles de procesadores trabajando dentro de un dominio coherente, aprovechando una arquitectura basada en Compute Express Link (CXL). Este enfoque, desarrollado en colaboración con Meta y Panmnesia, pretende conectar CPUs, aceleradores y memoria a través de múltiples bastidores, sin depender de las redes convencionales para la interconexión de nodos.

La clave de la propuesta es extender la conectividad entre acceleradores a lo largo de racks mediante CXL, una tecnología que facilita un mecanismo de coherencia compartida entre componentes. Con ello, se busca reducir la variabilidad de latencia que suele acompañar a las redes Ethernet o InfiniBand, especialmente cuando las cargas de trabajo abarcan cientos o miles de acceleradores que deben coordinarse de forma estrecha durante las diferentes etapas de cómputo.

El diseño propone varias piezas de hardware dedicadas para mantener caminos de comunicación y comportamientos de procesamiento más consistentes en una red extendida. Entre ellas figuran un conmutador de alta dispersión (high-fan-out switch), una unidad de aceleración de enlaces (link acceleration unit) y un controlador de fabric para gestionar el tráfico a través del sistema. Todo ello se organiza en bandejas, pods y una fabric, análogos a las prácticas de organización interna de bloques funcionales en semiconductores. Hasta la fecha, Panmnesia indica que su controlador de fabric y la unidad de aceleración de enlaces han superado validaciones de silicio, y el conmutador ya ha sido fabricado. Además, se afirma que se dispone de silicio en pre-lanzamiento para continuar con las pruebas de desarrollo hacia productos comerciales.

En términos de capacidad, la propuesta sugiere la posibilidad de reunir hasta 960 aceleradores en un solo dominio de coherencia. Tomando como referencia un diseño de NVIDIA, donde un CPU coordina dos aceleradores mediante NVLink-C2C, el esquema de Panmnesia permitiría que una única CPU coordine 16 aceleradores, lo que representaría un incremento de ocho veces respecto al caso de referencia. El diseño describe que aproximadamente 60 de estos grupos podrían formar un dominio de coherencia con cerca de 960 aceleradores. Además, se estima que el acceso entre racks podría reducirse de tiempos en el rango de microsegundos a cientos de nanosegundos, aproximadamente un orden de magnitud en la reducción de latencia.

Este enfoque también contempla la resiliencia operativa: un fallo en un dispositivo aislado podría permitir que el resto siga funcionando sin necesidad de sacar todo un servidor de servicio. Si bien estas ventajas dependen de la implementación práctica, la separación de componentes dañados puede reducir la cantidad de hardware funcional que se debe retirar para mantenimientos o reemplazos.

En palabras de Myoungsoo Jung, CEO de Panmnesia, “CXL permite que todo el data center opere como un único sistema de cómputo”. Sin embargo, existen límites físicos a la tecnología: la señalización eléctrica de CXL alcanza aproximadamente siete metros a 128 GT/s con dos retimers, lo que motiva la exploración de enlaces ópticos para distancias más largas. Panmnesia afirma haber completado validaciones de concepto de hardware para esta trayectoria óptica y continúa avanzando hacia productos comerciales.

En resumen, la propuesta de Panmnesia y Meta dibuja un escenario en el que un dominio de coherencia a gran escala, sustentado en CXL, podría transformar la manera en que se coordinan y aprovechan cientos o miles de aceleradores dentro de un data center. Aunque quedan desafíos técnicos y de implementación por resolver, la visión apunta a un futuro en el que el datacenter opere como una única unidad de cómputo, con beneficios potenciales en rendimiento, latencia y disponibilidad.

from Latest from TechRadar https://ift.tt/j8dhB91
via IFTTT IA