
La discusión sobre la infraestructura de IA suele centrarse en el costo de los data centers, el consumo energético y la potencia de cómputo necesaria para entrenar y ejecutar modelos, incluyendo GPUs y almacenamiento de alto rendimiento. No sorprende, dado lo desorbitante de las cifras que ocupan los titulares.
Otro bien clave, por supuesto, es el dato que alimenta esos modelos. Según el Informe de Índice de IA de Stanford 2025, los tamaños de los conjuntos de datos para entrenar LLMs se duplican cada ocho meses. En términos prácticos, a medida que se construye cada modelo, parte de los datos pasa rápidamente a entornos de curación y desarrollo de modelos, donde el acceso rápido es fundamental.
Muchos datos, sin embargo, esperarán más tiempo mientras los equipos establecen su relevancia para un uso de IA concreto—no se encuentra inactivo, sino que se mantiene de forma segura y lista para moverse rápidamente hacia los pipelines de curación, entrenamiento y transformación cuando sea necesario.
Desde la perspectiva de almacenamiento, surge un punto fácil de pasar por alto: un conjunto de datos no necesita el mismo rendimiento en cada etapa de la pipeline de IA. Lo que importa es que esté disponible cuando se necesite, no que se derive de una infraestructura siempre encendida y de alto rendimiento, lo cual, a gran escala, resulta innecesariamente costoso.
La pregunta para los planificadores de infraestructura, entonces, no es si la IA necesita almacenamiento rápido, sino dónde deberían conservar los conjuntos de datos extremadamente grandes que serán necesarios en el futuro, antes de estar listos para ser procesados. Esa elección es estratégica, no una tarea de housekeeping.
La capacidad adecuada debe mantener los datos protegidos y fácilmente recuperables para su entrada en las pipelines de IA, entrenamiento y transformación, colocar el rendimiento solo donde se está trabajando, y devolver la diferencia al presupuesto.
Como cada misión organizacional es distinta, cada empresa se encontrará en una etapa distinta de su viaje hacia la IA. Algunas ya han avanzado con sistemas en producción, mientras otras aún exploran cómo los datos que ya poseen podrían sostener iniciativas de IA: documentos, imágenes y video, registros operativos, información recogida a través de sistemas conectados; la lista continúa.
Por eso conocer sus propios datos está dejando de ser una tarea de TI para convertirse en una palanca competitiva. Los modelos están disponibles para todos, por lo que los datos propietarios pueden ser su ventaja competitiva, si puede acceder a ellos y utilizarlos a escala.
Las organizaciones que más rápido avanzan son aquellas que ya saben qué poseen, dónde está y qué tan rápido puede ponerse a trabajar. Acortar la distancia entre una pregunta de negocio y los datos que la responden es ahora una medida de cuán rápido puede una empresa ejecutar y triunfar.
Así, los datos no son solo una entrada para la IA: moldean el modelo. Cuantos más datos propios pueda aportar una organización, más afiladas y específicas serán las herramientas resultantes, por lo que la hipótesis operativa debe ser que casi cualquier cosa que tenga el negocio es potencialmente útil.
El enfoque convencional ha sido mantener grandes conjuntos de datos en un lago de datos basado en disco hasta que se necesiten para procesamiento adicional. Pero a medida que los conjuntos crecen, también lo hace el costo. Si cada conjunto candidato debe vivir en infraestructura siempre encendida y de alto rendimiento, el costo fija el techo de cuánto dato puede permanecer en juego.
El desafío, entonces, es mantener todo disponible para los flujos de trabajo cuando se necesite, de modo que el factor decisivo sea el caso de uso y no la factura de almacenamiento.
Tale of the tape
Lo inteligente, por tanto, no es gastar más, sino dejar de overspending cuando existe una vía mejor. Y resulta que una de las respuestas más sólidas aquí es una tecnología que nunca ha dejado de innovar: la cinta magnética. Muchos asocian la cinta con copias de seguridad y archivos a largo plazo, un papel que continúa cumpliendo, pero las generaciones de LTO han transformado su capacidad, rendimiento y seguridad mientras la industria miraba hacia otro lado.
La tecnología y los sistemas de cinta actuales se comportan ya como cualquier otra capa de la pila, listos para transmitir datos a almacenamiento rápido cuando la curación o el entrenamiento lo requieran. Y la economía de la cinta mejora a medida que crece. A escala de varios petabytes para programas de IA, el coste por terabyte es una fracción de la de la infraestructura flash o incluso HDD. El rendimiento y la capacidad pueden escalar de forma independiente, añadiendo más unidades para el rendimiento y más cartuchos para la capacidad.
Si se considera la extraordinaria eficiencia energética de la cinta, esta tecnología se convierte en una capacidad estratégica para incorporar en el data center, permitiendo a una organización mantener su conjunto de datos en juego a un costo que escala de forma previsible.
A safer place for valuable data
El coste de almacenamiento y operación suele obtener la aprobación de proyectos, pero la protección es lo que realmente preocupa. Aquí, la cinta ofrece algo que las capas en línea no pueden garantizar estructuralmente. La encriptación se maneja en hardware en la cartucho. Los medios Write-Once-Read-Many (WORM) hacen que un conjunto de datos sea inmutable en el sentido físico, de modo que datos irremplazables no pueden ser reescritos.
Y para el material más valioso, los conjuntos de cinta pueden salir de la biblioteca y almacenarse en una ubicación segura u offsite, completamente offline, aislados del entorno de producción.
Lo que cuenta ahora para construir tuberías de datos e IA para su organización es asegurar que los datos estén listos para moverse a la capa de rendimiento adecuada en el momento en que se necesiten. Los datos son el combustible de los modelos que una organización crea, de las decisiones que toma y de la rapidez con la que puede actuar sobre ellas.
La cinta permite mantener todo ese ‘combustible de datos’ a escala, proteger lo que no puede ser reemplazado y poner cualquier parte en funcionamiento cuando se requiera. Construya esto ahora y lo que puede hacer con sus datos deja de estar limitado por lo que puede mantener en línea y pasa a ser el medio para adelantarse a la competencia.
Hemos destacado lo mejor del almacenamiento en la nube.
Este artículo se produce como parte de TechRadar Pro Perspectives, nuestro canal para presentar a las mentes más brillantes de la industria tecnológica de hoy.
Las opiniones expresadas aquí son las del autor y no necesariamente las de TechRadarPro o Future plc. Si está interesado en contribuir, obtenga más información aquí: https://ift.tt/CNkzKVj
from Latest from TechRadar https://ift.tt/qWm2cgR
via IFTTT IA