LinkedIn: Mantener la huella de cómputo estable y maximizar la eficiencia en una era de IA


LinkedIn ha revelado que no tiene planes de gastar de manera agresiva para expandir sus centros de datos de IA durante su próximo año fiscal; en cambio, mantendrá la inversión en GPUs estable y aproximadamente su huella de cómputo y almacenamiento en el mismo nivel.

La razón declarada no es una restricción por sí misma: la compañía afirma haber logrado duplicar aproximadamente la eficiencia de sus GPUs existentes en los últimos seis meses gracias a mejoras acumuladas en la utilización, la destilación de modelos y la asignación de cargas de trabajo, en lugar de depender de un único avance tecnológico.

En una entrevista con Wired, Erran Berger, CTO de ingeniería de LinkedIn, enmarca el objetivo como mantener la huella de cómputo plana o cercana a ella mientras se despliegan más capacidades de cómputo intensivas en producción, todo ello reconociendo que es una posición inusual para hacerse pública en este momento.

Saltando la norma, tanto a nivel de la industria como de la empresa matriz

LinkedIn ha estado plenamente propiedad de Microsoft desde su adquisición en diciembre de 2016 por 26.2 mil millones de dólares.

A pesar de formar parte del gigante del software, el enfoque de LinkedIn parece muy diferente al de una empresa que recientemente vio cómo sus acciones se recuperaban al mostrar resultados de gasto en IA con retornos medibles.

Microsoft también cerró recientemente su año fiscal, reportando 41 mil millones de dólares en gasto de capital en el último trimestre y añadiendo 31 centros de datos en ese periodo, y 88 a lo largo del año, con expectativas de gastar más de 50 mil millones en el siguiente trimestre.

Esto establece un paralelismo interesante: mientras una parte de Microsoft despliega capital a una velocidad sin precedentes, una subsidiaria con más de mil millones de usuarios ha decidido mantener el año sin expansión de hardware, citando mejoras de eficiencia. Resulta, por tanto, un enfoque considerablemente más interesante que lo que podría considerarse un simple discurso de disciplina en IA.

Aunque existen paralelismos, conviene señalar que el gasto de Microsoft está impulsado en gran medida por la demanda de Azure y, específicamente, por la capacidad que ha contratado para suministrar a OpenAI, más que por cargas de trabajo de productos internos, mientras que la capacidad de LinkedIn representa una fracción frente a eso.

Aun así, ofrece una perspectiva atractiva cuando una gran plataforma de consumo puede añadir características de IA en un año sin añadir hardware; no obstante, va en contra de la idea predominante de que las características de IA y el crecimiento de capacidad son inseparables.

Qué hace posible esto para LinkedIn

La respuesta se remonta a una decisión que la cobertura de la época consideró una vergüenza. En 2019, LinkedIn anunció que migraría su infraestructura a Azure en un proyecto llamado Blueshift. En 2022 se dejó de lado ese plan de forma discreta. Un memorando interno señalaba presiones de demanda de Azure y decía que LinkedIn se centraría en escalar su infraestructura local; informes posteriores establecieron que la migración también encontró dificultades porque las herramientas internas de LinkedIn no se trasladaron sin problemas a Azure.

En su lugar, LinkedIn se comprometió a mantener centros de datos propios en Oregón, Texas y Virginia.

El CTO de infraestructura de LinkedIn, Raghu Hiremagalur, sostiene que poseer el stack completo es precisamente lo que hace factible el plan de este año, porque la empresa puede instrumentar cada capa y tratar la eficiencia como una inversión permanente en lugar de un ejercicio de recorte puntual de costos.

“Quiero subrayar que para una empresa de nuestra escala, decir que durante un año completo haremos esto sin incremento de almacenamiento y cómputo no es una hazaña menor, pero ha requerido mucho trabajo para lograrlo”, afirmó Hiremagalur.

Leer lo que en 2022 se comentó como una retirada podría verse ahora como una ventaja en 2026, pero no es necesariamente incorrecto. El trabajo de eficiencia se describe como una acumulación en lugar de un avance único: una mejor utilización de las GPUs, una asignación de cargas de trabajo más eficiente, la destilación de modelos más grandes en modelos más pequeños y una reconsideración de cómo se reparte el trabajo entre entrenamiento, inferencia, almacenamiento y diseño de sistemas.

Hiremagalur también ha señalado que el costo de atender cada consulta había aumentado de forma constante mientras que los datos almacenados se duplicaban cada año, una dinámica que él calificó como insostenible. En este sentido, el impulso hacia la eficiencia se percibe menos como una decisión estratégica sobre el mercado de IA y más como una empresa que miró su propia curva de costos y decidió doblarla.

Vale la pena señalar que LinkedIn no ha resuelto por completo las limitaciones, sino que, para una plataforma de este tamaño, ha hecho público que su restricción de cómputo es deliberada en un momento en que los cuatro mayores hyperscalers de EE. UU. han comprometido una inversión de entre 600 y 700 mil millones de dólares para el año calendario.

Casi todos los incentivos de la industria buscan anunciar capacidad en lugar de eficiencia, lo que convierte a LinkedIn en un caso atípico en un campo dominado por anuncios diarios de CAPEX.

La pregunta más útil es si este enfoque se sostiene. Si lo hace, el argumento de que la ambición de producto de IA requiere un crecimiento de hardware proporcional se debilita notablemente. Si no lo hace, esto podría leerse como un impulso de eficiencia que logró adaptarse a la demanda real del roadmap de productos, pero falló en cumplirla en un momento en que la inversión en IA está bajo mayor escrutinio, incluso cuando LinkedIn recientemente permitió a los usuarios marcar lo que perciben como ‘AI slop’.

from Latest from TechRadar https://ift.tt/2p8NgwU
via IFTTT IA