
El auge de la IA está acercándose rápidamente a los límites físicos de la capacidad de la red y de la disipación térmica. La red eléctrica está estirada como nunca, provocando esperas más largas para la conexión de centros de datos de IA, y los sistemas convencionales de enfriamiento por aire y por líquido luchan por satisfacer las demandas de instalaciones en rápido crecimiento.
A medida que estas infraestructuras continúan expandiéndose a un ritmo vertiginoso, los centros de datos de IA se enfrentan a una mezcla de desafíos: desde un poder de cómputo que supera las capacidades de transferencia de datos de las interconexiones GPU, hasta oscilaciones de carga volátiles que tensan los sistemas de corrección de factor de potencia (PFC) de la red y sobrecargan el consumo de energía por rack, agotando los enfriamientos tradicionales.
A continuación, desglosamos los principales cuellos de botella térmicos y eléctricos que frenan el auge de la IA y las innovaciones que las empresas están adoptando para superarlos.
The thermal wall (Rack-level friction)
Los racks estándar generan mucho calor, y los cúmulos de GPU de alto rendimiento aún más, lo que lleva a superar los límites térmicos ya de por sí desafiantes. Los racks modernos de GPU pueden superar entre 50 y 100 kW de consumo por gabinete, lo que hace que los métodos tradicionales de enfriamiento por aire y por líquido sean insuficientes.
Los sistemas de enfriamiento convencionales mantienen las clusters entre 65 y 85 grados; sin embargo, a 90–100 grados se activan limitaciones de rendimiento para prevenir daños permanentes en las GPU. Con racks de GPU que consumen grandes cantidades de energía eléctrica y se convierten en calor, evitar que alcancen los límites de throttling es más difícil que nunca.
Los sistemas de enfriamiento por aire no fueron diseñados para densidades de rack superiores a 30–40 kW, y AI clusters suelen superar ampliamente ese umbral, con 100 kW o más como norma. Mantener un flujo de aire adecuado a densidades tan altas para enfriar racks de 100 kW+ requiere ventiladores de alto consumo, lo que absorbe energía eléctrica y empeora la eficiencia energética (PUE) de los centros de datos. En entornos tan densos, lograr un enfriamiento con aire puro resulta impráctico. ¿Y el enfriamiento por líquido?
El enfriamiento líquido se basa en la mecánica de fluidos, donde placas frías utilizan microcanales para forzar flujos turbulentos directamente sobre los chips y mantenerlos a buena temperatura. Lograr un caudal suficiente en estos microcanales exige potentes bombas, una restricción creciente para los operadores. Para mitigar este desafío, muchos están migrando a placas de refrigeración directa al chip (direct-to-chip) montadas directamente en el procesador, en lugar de cubrirlo, para mantenerlo frío consumiendo menos energía de bombeo.
La mecánica de cambio de fase también ayuda a enfriar de forma más eficiente. En estos sistemas, el calor masivo generado por racks de GPU se absorbe mediante la vaporización de un fluido dieléctrico que, al transformarse en vapor, lo arrastra fuera de las superficies calientes; luego el vapor es condensado y vuelto a convertirse en líquido para reiniciar el ciclo. Este proceso, conocido como enfriamiento por inmersión en dos fases, puede reducir el consumo de enfriamiento hasta en un 40%.
Algunos operadores están adoptando sistemas de enfriamiento líquido en circuito cerrado, donde el fluido recircula con pérdidas de evaporación mínimas y se evita la necesidad de recargas frecuentes.
Por ejemplo, Microsoft, uno de los tres mayores operadores de centros de datos, ha implementado un sistema de circuito cerrado en centros de datos más recientes, donde el agua se llena una vez y circula para absorber calor, se enfría mediante enfriadores de aire y luego se recircula para absorber más calor sin necesitar suministros frescos. Este sistema es costoso y llevará tiempo escalarlo, pero demuestra cómo las empresas están innovando frente a los cuellos de botella térmicos.
The interconnect and board-level limits
Los clústeres de GPU dependen de interconexiones eléctricas de cobre u ópticas para compartir datos, memoria y cargas. Las interconexiones eléctricas de cobre han sido el estándar, pero las cargas de trabajo de IA las han llevado al límite.
Las señales eléctricas pierden intensidad en distancias largas (más de dos metros), y la capacidad utilizable se reduce a la mitad cada vez que la demanda de ancho de banda se duplica. Los clústeres masivos de GPU hacen que las distancias de comunicación sean más largas que nunca. Las interconexiones de cobre cercanas entre sí generan interferencia electromagnética que molesta otras señales, lo que requiere sistemas de igualación complejos que consumen más energía.
Además, hay pérdidas de potencia a través de las placas de cobre en las tarjetas de GPU debido a la resistencia; cuanto más corriente circula, más calor se genera, lo que exige más energía de enfriamiento.
Con las interconexiones eléctricas al límite, los operadores de centros de datos deben migrar a interconexiones ópticas, que convierten datos en pulsos de luz que viajan por cables de fibra óptica con pérdidas mínimas a largas distancias. Estos cables son mucho más delgados que los haces de cobre, lo que facilita el flujo de aire en racks densos y calorosos.
Las empresas están yendo incluso más allá, moviéndose de cables de fibra óptica desmontables a interconexiones silicon fotónicas (silicon photonics) o co-packaged optics (CPO), donde circuitos ópticos están integrados directamente en las GPUs para transmitir la luz a largas distancias. Actualmente, las interconexiones ópticas son mucho más costosas que el cobre, llegando a costar hasta 7 veces más en algunas configuraciones, pero es una necesidad a corto plazo debido a que el cobre ha alcanzado sus límites físicos. A medida que más empresas adopten interconexiones ópticas y se invierta en su fabricación en masa, es probable que los costos bajen.
The grid & substation crisis
Por último, la conexión a la red eléctrica es el principal desafío para los centros de datos de IA. Las redes modernas no fueron diseñadas para soportar las cargas cada vez mayores de los centros de datos de IA, y se añadieron 30 GW de capacidad nueva en todo el mundo entre 2021 y 2025. Estas incorporaciones rápidas han tensado la cadena de suministro de componentes de la red eléctrica y han introducido desafíos de ingeniería que los operadores deben sortear.
Por ejemplo, los transformadores de alto voltaje, necesarios para entregar una tensión segura a las GPU, están en escasez. Los tiempos de espera han pasado de 6–12 meses en 2020 a entre dos y cuatro años actualmente, lo que dificulta que los mega clústeres de GPU operen a pleno rendimiento.
Los sistemas de corrección de factor de potencia existentes se han visto estresados por cargas masivas que consumen la red en fracciones de segundo: un segundo con baja demanda de inferencia puede extraer energía estable, y al siguiente segundo la demanda dispara picos desproporcionados. Estas fluctuaciones generan armónicos complejos que sobrecalientan transformadores y afectan a la red, obligando a invertir mucho en mitigación.
Los clústeres de IA están escalando a niveles de gigavatio, llevando la capacidad de los interruptores y el equipo de caída de tensión a sus límites. Transformadores más grandes, necesarios para atender estas cargas, reducen la impedancia eléctrica, lo que puede aumentar la corriente de cortocircuito y provocar fallos si ocurre un problema.
Frente a estos cuellos de botella, las soluciones están emergiendo. Una gran parte de la solución es la adopción de transformadores de estado sólido (solid-state transformers, SST), que emplean electrónica y semiconductores de alta frecuencia para regular la tensión y filtrar armónicos, manteniendo estable el sistema eléctrico. Los SSTs son entre un 97% y 99% eficientes, frente al 95–97% de los transformadores convencionales, y son significativamente más compactos y ligeros, acelerando la logística y la implementación.
Sin embargo, los SSTs presentan sus propios retos. Los componentes internos y chips de alta frecuencia que los alimentan son costosos, a veces cinco veces o más por kVA que las alternativas de baja frecuencia. Requieren múltiples etapas de conversión de energía (AC-DC y DC-AC/DC-DC), y las pérdidas menores se acumulan durante estas conversiones, lo que dificulta alcanzar la eficiencia máxima. Los componentes internos generan calor y envejecen más rápido, demandando más mantenimiento.
El costo también es un factor; los SSTs son actualmente significativamente más caros de construir y mantener que los transformadores magnéticos. Sin embargo, con mayor inversión en producción en masa, es probable que los costos bajen con el tiempo. Siemens, uno de los mayores fabricantes de transformadores, se asoció con la firma alemana Reinhausen para posicionar a gran escala transformadores sólidos modulares para centros de datos de IA, como ejemplo de la dirección del sector.
Como los SSTs no pueden adoptarse de inmediato a gran escala y las escaseces de transformadores tradicionales han contribuido a esperas largas para los operadores de redes, los propietarios de centros de datos han tomado medidas propias. Algunos han construido generación de energía y subestaciones detrás de la cuenta para alimentar sus clústeres mientras esperan la conexión a la red local. xAI, la empresa de IA liderada por Elon Musk, añadió 59 turbinas de gas portátiles con capacidad total superior a 400 MW para alimentar su centro de datos Colossus en Memphis, mientras espera la conexión a la red.
Algunas empresas están buscando también Reactores Modulares Pequeños (Small Modular Reactors, SMRs) para generar energía en sitio, pero esto sigue principalmente en etapa conceptual. Los SMRs enfrentan costos muy altos en comparación con turbinas de gas o energías renovables.
Aún así, muchos centros de datos, ya en fases tempranas o ya funcionando, siguen en largas filas para conexiones a la red. En el Norte de Virginia, que alberga el mayor cluster mundial de centros de datos, las nuevas instalaciones enfrentan esperas de hasta 14 años para una conexión a la red.
Los operadores de redes eléctricas estadounidenses han invertido grandes sumas en mejoras (208 mil millones de dólares solo en 2025 y 1,1 billones de dólares en inversiones planificadas entre 2025 y 2030), pero siguen luchando para satisfacer la explosión de demanda de centros de datos. Se requieren más inversiones para abordar los cuellos de botella de la red eléctrica, así como nuevas tecnologías para reducir el consumo de energía de los centros de datos y ayudar a que las redes de distribución soporten la carga.
La realidad de la implementación de cómputo de próxima generación
Con estos detalles técnicos, hemos explicado los cuellos de botella de red, térmicos y de interconexión que llevan el auge de la computación de IA al límite. Estos son desafíos físicos y técnicos serios que requieren enfoques innovadores, y afortunadamente no han faltado soluciones.
Hemos presentado ejemplos como operadores de redes eléctricas que recurren a transformadores de estado sólido para regular activamente la tensión y filtrar armónicos, o como algunos operadores de clústeres de GPU que construyen su propia generación de energía mientras esperan conexiones a la red local.
Para los cuellos de botella térmicos, los operadores de clústeres de GPU están aprovechando placas frías directas al chip montadas directamente en las GPUs, en lugar de sobre ellas, para mantenerse frescos consumiendo menos energía. La mecánica de cambio de fase también ayuda, donde el líquido absorbe calor y se condensa para repetir el proceso, reduciendo el consumo energético hasta en un 40%.
Microsoft ha intentado reinventar el enfriamiento con un sistema de enfriamiento líquido en circuito cerrado, que recircula continuamente el fluido en una red sellada con recargas mínimas.
Sin embargo, estos sistemas cerrados son más difíciles de escalar que los abiertos a medida que crecen las necesidades de las GPUs y pueden ser más ruidosos bajo cargas pesadas, ya que las bombas y ventiladores trabajan al unísono. En un momento de creciente rechazo público hacia nuevas instalaciones de centros de datos, el ruido ambiental es un factor a considerar, no solo las limitaciones técnicas. Aunque son más costosos, los sistemas en circuito cerrado pueden reducirse con el tiempo a medida que más compañías los adopten.
Para las limitaciones de interconexión en nivel de placa, las empresas están cambiando de cobre eléctrico a cables de fibra óptica, que transmiten datos más rápido y de manera más fiable a largas distancias, aunque su costo sea mayor. Los fabricantes de GPU trabajan en incrustar circuitos ópticos directamente en los chips para transmitir la luz de forma aún más eficiente que los cables.
A corto plazo, estas tecnologías pueden resultar más caras, pero son necesarias ante los límites físicos del cobre. Con la adopción creciente de interconexiones ópticas y la inversión en su producción, se espera que los costos disminuyan con el tiempo.
Afrontando la realidad: crecimiento y perspectivas
A pesar de estos retos, los centros de datos de IA continúan creciendo a un ritmo acelerado, con decenas de gigavatios de capacidad nueva en construcción en Norteamérica y otras regiones. Mirando al futuro, está claro que hay mucho movimiento en este ámbito y es emocionante observar las diversas estrategias que las empresas han adoptado para superar los cuellos de botella eléctricos, térmicos e de interconexión.
Conclusión: el camino hacia la próxima generación de cómputo de IA combina innovación de red eléctrica, enfriamiento eficiente y soluciones de interconexión avanzadas para sostener un crecimiento que ya es imparable. El éxito dependerá de la colaboración entre proveedores de infrastructure, fabricantes de GPUs y operadores de redes para lograr sistemas más eficientes, confiables y escalables que hagan frente a la demanda de IA en los años por venir.
from Latest from TechRadar https://ift.tt/nNTDYIu
via IFTTT IA