¿Qué es un centro de datos de IA?

¿Qué es un centro de datos de IA? [Vídeo y cuestionario]

En resumen: un centro de datos de IA es un de alta densidad donde la energía, la refrigeración, la infraestructura y el almacenamiento se centran en el entrenamiento y la distribución de modelos, no en una sala de servidores con GPU adicionales. Los chips son los protagonistas; el edificio determina su funcionamiento. Si las imágenes no pueden salir, se puede adaptar una celda pequeña; la mayoría de los equipos deberían alquilar.

Conclusiones clave:

Chips frente a edificios: La alimentación, la refrigeración, la estructura y el almacenamiento determinan si los aceleradores funcionan.

Lugares, no palacios: Instala dos racks cuando los datos no puedan salir; no compres un campus.

Media frente a mediana: En ocho ejecuciones, la mediana ocultó los reinicios; utilice la media de 18 horas.

Resistencia al mal uso: No indique un PUE para dos racks en una sala mixta.

Resultados ilustrativos: Ocho ejecuciones representan un mapa pequeño, no un ahorro de producción del 50 %.

Artículos que quizás te interese leer después de éste:

🔗 ¿ Es fiable la IA? Vídeo y cuestionario.
Descubre la fiabilidad de la IA a través de un vídeo atractivo y un cuestionario interactivo.

🔗 Cómo usar la IA en la vida diaria
Descubre formas prácticas en que la IA puede simplificar las tareas y rutinas cotidianas.

🔗 Cómo usar la IA en el trabajo
Aprenda formas prácticas de usar la IA para una mayor productividad en el lugar de trabajo.

🔗 ¿ Puede la IA pensar por sí misma?
Comprenda si la inteligencia artificial puede pensar o razonar de forma verdaderamente independiente.

En qué se diferencia de un centro de datos "normal"

Las salas tradicionales se optimizan para cargas de trabajo mixtas y tiempo de actividad en muchos servicios pequeños. Claro que te importa la redundancia y el PUE como concepto: la energía adicional que consume el edificio para proporcionar un vatio de procesamiento. Normalmente, no diseñas cada pasillo en torno a un rack que se comporta como una granja de calentadores portátiles.

Los sitios de IA invierten las proporciones. La densidad aumenta. La red se convierte en un tejido del que el proceso de entrenamiento no puede prescindir. El almacenamiento debe mantener los puntos de control en movimiento o los aceleradores se quedan inactivos, como caballos de carreras en un atasco.

También existe una diferencia cultural. En operaciones empresariales, se piensa en tickets y ventanas de cambio. En operaciones de IA, se piensa en colas de trabajo y en la frustración que se siente cuando un nodo falla al final de un ciclo de vida prolongado. Supongo que aún se podría llamar a ambos "centros de datos", porque lo son. La etiqueta simplemente oculta la infraestructura.

Tipo Para qué está construido Hardware excepcional Características de potencia/refrigeración A quién le conviene Por qué existe
Centro de datos empresarial tradicional Informática mixta: bases de datos, máquinas virtuales, correo electrónico, archivos CPU, servidores comunes, almacenamiento habitual Liderado por aire; densidad moderada; PUE como tema de conversación Empresas que gestionan sistemas cotidianos Mantén actualizadas las aplicaciones empresariales
clúster de entrenamiento de IA Trabajos de formación largos y estrechamente vinculados Bastidores de aceleradores de alta densidad; interconexiones de GPU Alta densidad; refrigeración líquida o [intercambiadores de calor de puerta trasera](https://datacenters.lbl.gov/sites/default/files/rdhx-doe-femp.pdf) Laboratorios y constructores de maquetas que viven en listas de espera para trabajos Termina la carrera sin que las patatas fritas se queden sin comer
Instalación de inferencia de IA Servicio de modelos; respuestas en tiempo real y por lotes Aceleradores; balanceadores de carga que importan Sigue siendo atractivo, solo que... menos teatral; latencia sobre densidad bruta Productos que deben dar respuesta ahora Coloca el modelo cerca del usuario
Sala de IA híbrida Formación y servicio bajo un mismo techo; bueno, más o menos Estanterías mixtas; piscinas valladas; tejido compartido Dos personalidades diferentes en una misma sala de plantas; se vuelve incómodo Equipos que no pueden permitirse dos campus El capital es finito; la vida es desordenada

No es una clasificación moral. Son máquinas diferentes, pero de la misma familia.

GPU, aceleradores y el rack que consume energía

Al recorrer una planta elevada tradicional, las estanterías parecen casi discretas. En cambio, en una fila con IA, dan la impresión de que quieren engullir el edificio.

El hardware más destacado no es una CPU sofisticada, sino la plataforma aceleradora: GPU u otros chips de IA, integrados en servidores, luego en racks y finalmente en filas que comparten una red de alto ancho de banda. Las interconexiones de GPU unen los chips para formar un único acelerador gigante; la arquitectura de clúster logra el mismo efecto a escala de fila. El entrenamiento en paralelo solo funciona si estas conexiones son robustas y predecibles. Si se pierde esta característica, el clúster se convierte en un conjunto de costosas estaciones de trabajo que comparten un mismo código postal.

La potencia sigue a los chips. No es una voluminosa PDU de oficina. Megavatios de carga de TI una vez que se llena una sala; no voy a inventar una cifra. La densidad por rack es el giro inesperado. Menos racks. Cada uno un pequeño horno. El factor limitante suele ser la subestación, no la lista de deseos de GPU. Ya sabes cómo es: compras quiere más aceleradores; la compañía eléctrica quiere una larga conversación y un cheque muy grande.

Una metáfora un tanto absurda que no puedo quitarme de la cabeza: el potro de tortura es un animal hambriento. Se puede criar uno más rápido, pero aun así hay que alimentarlo y limpiarlo para eliminar el calor. Si se omite alguna de estas tareas, se convierte en un pisapapeles muy caro.

El problema de la energía, el calor y la refrigeración

Entrada de electricidad. Salida de calor. Esa es toda la esencia.

Los racks de alta densidad disipan el calor de una manera que el aire nunca estuvo realmente diseñado para manejar. Se puede forzar el flujo de aire (intercambiadores de calor en la puerta trasera, pasillos más calientes, sistemas de contención inteligentes), y eso funciona hasta cierto punto. Luego aparece el líquido:

  • Refrigeración directa al chip

  • Circuitos de refrigeración que hacen que la sala de máquinas parezca una planta química

  • Inmersión en unos pocos diseños, que aún sorprenden a las personas que piensan que el agua y los servidores no deberían compartir una frase

Nada de esto es glamuroso. Todo se reduce al producto, porque un acelerador que limita la potencia es algo que ya has pagado y que no puedes aprovechar al máximo.

El PUE sigue siendo importante. Es una proporción, no una característica. Los operadores lo buscan porque cada vatio gastado en ventiladores y bombas es un vatio que no se destina a la GPU. No citaré una cifra "típica"; el clima y cómo se definen los límites lo modifican, y la precisión artificial es peor que ninguna. El agua también influye. Algunas plantas la absorben poco a poco. Otras la absorben rápidamente. La refrigeración por evaporación es eficiente hasta que el río o una sequía la convierten en un tema político.

Redes: por qué la infraestructura es tan importante como los chips

La gente fotografía las GPU. Deberían fotografiar los conmutadores.

El entrenamiento es una conversación. Miles de aceleradores intercambian gradientes, parámetros y fragmentos de un modelo en perfecta sincronía. Si la red falla, todo el proceso se detiene en el enlace más lento. Por eso, en el ámbito de la IA se prioriza la conectividad de banda ancha, la baja latencia y las topologías que no se colapsan ante un fallo de enlace. Redes tipo InfiniBand, Ethernet con la misma función, interconexiones de GPU integradas y un cableado impecable desde el primer momento.

La inferencia es un tema aparte. El servicio de modelos se preocupa por la latencia extrema: la respuesta lenta, no la promedio. El procesamiento por lotes frente al procesamiento en tiempo real genera diferencias. Un clúster de entrenamiento requiere un movimiento masivo, colectivo y prácticamente de todos a todos. Un conjunto de servidores requiere muchas solicitudes más pequeñas y aislamiento, sin congestión en el balanceador de carga.

El error, ya que estoy aquí: la gente trata la red como si fuera la fontanería y los chips como el restaurante. En este edificio, la fontanería es el restaurante. Si no lo entiendes, te compras una cocina que no puede recibir pedidos a domicilio.

Entrenamiento vs. inferencia: dos edificios, a veces literalmente

El entrenamiento es una campaña. Se ensambla un clúster, se le proporcionan datos, se realizan puntos de control rigurosamente, se ejecuta durante horas o semanas y se reza para que la infraestructura se mantenga sin incidentes. Un proceso intensivo, que consume mucho ancho de banda y requiere paciencia, hasta que un nodo averiado interrumpe el funcionamiento. Un acelerador inactivo en un proceso estrechamente acoplado puede paralizar todo el conjunto.

La inferencia es como un escaparate. Modelos ya entrenados, que ahora responden preguntas, clasifican imágenes y generan texto. La latencia importa. Un acelerador ligeramente más antiguo cerca del cliente puede superar a uno sofisticado al otro lado del continente.

Así que se produce una división. Los centros de formación buscan potencia, terreno y densidad. Los centros de inferencia buscan latencia y presencia. También existen salas híbridas, porque el capital no es infinito. Bueno, no siempre son dos edificios. A veces, una sola sala con una cuerda de terciopelo y dos circuitos de refrigeración.

Aquí es donde se bifurcan la colocación, los campus de hiperescala y las soluciones locales. Los proveedores de hiperescala construyen a escalas que hacen que el resto parezca que estamos organizando muebles. Los centros de datos venden densidad por rack. Las soluciones locales siguen siendo necesarias cuando los datos no pueden salir de la red.

Rendimiento de almacenamiento, puntos de control y chips hambrientos

Nadie pone el sistema de archivos paralelos en la portada del folleto.

Los datos de entrenamiento deben llegar lo suficientemente rápido para que las GPU no se saturen. Los puntos de control deben guardarse para que un fallo no haga perder una semana. Los pesos del modelo deben cargarse antes de que una réplica de servicio esté activa. El rendimiento del almacenamiento, no solo la capacidad, es el cuello de botella silencioso. Puedes gastar una fortuna en aceleradores y, aun así, sobrecargarlos con un sistema de almacenamiento diseñado para máquinas virtuales.

El patrón es familiar: un clúster brillante, una cola de trabajos y una espera de E/S que te mira fijamente como una factura impertinente. Agrupar la computación sin agrupar la ruta de datos es la forma de obtener un tiempo de inactividad muy costoso. Mantén los chips alimentados o admite que compraste una escultura.

Software, orquestación y la poco glamurosa capa de operaciones

El hardware es la estrella. Los planificadores hacen el trabajo.

Un centro de datos de IA es inútil si las tareas no encuentran GPU, si dos equipos no pueden compartir un clúster sin pelearse, si no se puede reemplazar un rango fallido, si el firmware se desfasa hasta que la infraestructura falla lentamente. Orquestación, observabilidad, limitación de potencia: la capa de operaciones menos glamurosa, que es lo que demuestra su importancia.

Le tengo un cariño especial a esta capa. Además, cuando una tarjeta de red mal configurada simula un problema de refrigeración durante toda una tarde... uno se da cuenta de eso por las malas.

Cuando un nodo falla a mitad de la ejecución

Un nodo falla. Las ventanas de cambio siguen chocando con las ejecuciones de entrenamiento que no tienen en cuenta tu calendario. Programas tareas grandes en grupo, proteges los grupos de inferencia, escribes manuales de ejecución para fallos que parecen "la tarea es lenta" hasta que parecen "la tarea está muerta". La redundancia sigue siendo importante (alimentación, refrigeración, rutas, almacenamiento), pero el modo de fallo es menos ordenado que el antiguo modelo de nueves de tiempo de actividad. Inferencia: réplica, descarga el nodo averiado, sigue respondiendo. El entrenamiento necesita puntos de control, no optimismo.

Ubicación, agua, red eléctrica y vecinos

No se deja caer uno de estos al lado de una cabaña por las vistas.

La conexión a la red eléctrica suele ser el factor determinante en la selección del emplazamiento. El terreno es fácil de conseguir en comparación con una subestación y una empresa de servicios públicos con otros clientes. El agua para refrigeración, si se utiliza, se convierte en un problema para los vecinos en cuanto empiezan las lluvias. Ruido. Impacto visual. Calor en la valla divisoria. Los comités de planificación descubren opiniones encontradas sobre la nube en el momento en que necesita un terreno y un río.

La latencia actúa en sentido contrario. La inferencia se beneficia de la proximidad a los usuarios y las interconexiones. El entrenamiento puede operar en mercados energéticos más económicos y climas más fríos. La industria habla como si existiera un emplazamiento perfecto. No lo hay. Existe un compromiso, como se indica en los comunicados de prensa.

El calor residual y el horno no deseado

A los folletos les encanta esta idea. Canalizar el calor residual hacia hogares, piscinas e invernaderos; es una frase preciosa. A veces, el circuito del distrito es real. Otras veces, el campus está mal ubicado y el calor se sigue escapando al aire. Soy escéptico respecto a la versión del folleto; no dudo de la física.

¿Quién necesita uno (y quién debería alquilar en su lugar)?

La mayoría de la gente no necesita ser propietaria de uno de estos salones.

La lista sin rodeos:

  • Hiperescaladores, porque el producto es la flota

  • Laboratorios, cuando el tiempo de espera es el cuello de botella o los datos no pueden salir

  • Un banco, un grupo hospitalario, un gobierno o un fabricante con un conjunto de datos secretos, ya sea en sus propias instalaciones o en un centro de datos privado, puede ser racional, incluso si es un engorro

Los demás deberían alquilar. Colocación con densidad preparada para IA. Una reserva en la nube. Un clúster gestionado. Obtienes los aceleradores sin convertirte en operador de una central eléctrica. El romanticismo se desvanece la primera vez que alguien pregunta quién está de guardia para el circuito de refrigeración a las 3 de la mañana.

Admito que hay cierto orgullo en ello. Ser dueño del clúster se siente como tener el control total de la predicción. Luego llega la factura de la luz y el orgullo se desvanece.

¿Para qué sirve el edificio?

¿Qué es un centro de datos de IA? Es un campus especializado de alta densidad donde los aceleradores, la energía, la refrigeración, la infraestructura y el almacenamiento se organizan en torno al entrenamiento y la ejecución de modelos, no una infraestructura informática general con una GPU en un rincón. Parece un almacén, pero funciona como una central eléctrica que realiza cálculos matemáticos.

Si no recuerdas nada más: los chips se llevan la fama; la subestación, el refrigerante y la red deciden si esos chips fueron una buena idea. El entrenamiento y la inferencia pueden compartir el mismo espacio; aun así, requieren métodos diferentes. La mayoría de las organizaciones deberían alquilar. Unas pocas deberían construir. Los vecinos lo notarán en cualquier caso.

La nube siempre tuvo un edificio. Hoy en día, el edificio tiene opiniones.

Ejemplo del mundo real: Una celda de entrenamiento de dos bastidores cuando las imágenes no pueden salir

Guión

Tomos es el responsable de infraestructura en Kestrel Precision, un fabricante de 400 empleados en West Midlands. Ya cuentan con una pequeña sala propia: ERP, recursos compartidos de archivos, máquinas virtuales, el entorno mixto con el que comenzó este artículo. Refrigeración por aire. Ethernet estándar. Una SAN perfectamente adecuada para discos de oficina.

El equipo de visión artificial necesita entrenar un modelo de inspección con imágenes fijas de la fábrica. Estas imágenes no pueden salir de las instalaciones. Muestran un proceso que la empresa no almacenará en la nube, ni siquiera en una privada. La solución del departamento de compras consiste en cuatro servidores de doble acelerador y una diapositiva titulada "Nuestro centro de datos de IA". Los servidores se instalan en dos racks ya existentes, ya que hay espacio disponible, y el espacio parecía ser el factor limitante.

No lo es. En dos semanas, las GPU suenan muy ocupadas y luego se ralentizan silenciosamente. Los trabajos avanzan muy lentamente cuando un punto de control llega a la SAN. Un nodo falla a las once y la ejecución simplemente... se pierde. Tomos no ha dejado de comprar chips. Ha comprado un montón de estaciones de trabajo caras que comparten código postal. El edificio seguía siendo un centro empresarial.

No necesitan un campus, una nueva subestación ni un río. Necesitan una celda pequeña que funcione como un centro de datos de IA en miniatura: alimentación eléctrica que los racks puedan soportar, disipación de calor sin dañar los chips, una red de interconexión compatible con el proceso de entrenamiento, almacenamiento con capacidad para guardar puntos de control y un manual de procedimientos para cuando un nodo falla. Dado que las imágenes no pueden salir, alquilar un espacio de colocación a cuarenta minutos de distancia no es la solución. Adaptar dos racks sí lo es.

Lo que la célula necesita

  • Un presupuesto de energía medido en esa fila, a partir de las PDU, no de la lista de deseos de GPU. Si la capacidad de reserva no puede alimentar los cuatro servidores con la carga de entrenamiento, la conversación termina ahí y consideran un centro de datos más denso, no un milagro

  • Nunca se pidió que enfriara el aire a esta densidad: intercambiadores de calor en la puerta trasera si la sala puede soportarlos, o un pequeño circuito de líquido si puede soportarlo en su lugar. Si no es ninguno de los dos, los servidores no entran

  • Se requiere una estructura de banda ancha dedicada entre los cuatro nodos, no la red Ethernet de la oficina. Si el proveedor solo ofrece un conmutador de 10 Gb en su catálogo, no se trata de un clúster

  • Almacenamiento rápido local para puntos de control y fragmentos de entrenamiento, no la SAN de la máquina virtual

  • Un planificador, un intervalo de punto de control y una ruta de reinicio escrita. El hardware es la estrella. Esta capa es el trabajo

  • Una caja de inferencia cercada para la línea de producción, separada de la charla de capacitación, porque el servicio requiere latencia de cola y aislamiento, no un colectivo

  • Permiso para registrar la potencia, las frecuencias de la GPU, los eventos de limitación de velocidad y el tiempo real de ejecución del trabajo. Si no pueden inspeccionar esos datos, fotografiarán las GPU y pasarán por alto los interruptores

Ejemplo de instrucciones

Tomos lo expresa así en el informe sobre las instalaciones, en lenguaje sencillo:

No lo llamen campus de IA. Construyan una celda de entrenamiento de dos racks en el pabellón existente para cuatro servidores de doble acelerador. Las imágenes de fábrica se quedan en el sitio. El éxito es: los cuatro nodos completan una receta de entrenamiento de inspección de 12 épocas sin limitación térmica, escriben un punto de control en minutos, no en decenas de minutos, y reanudan desde ese punto de control cuando eliminamos un rango a propósito. La refrigeración debe mantener las GPU a sus relojes de entrenamiento. La red debe ser un tejido que compartan esas cuatro cajas, no una ruta a través de la pila de oficinas. El almacenamiento debe alimentar los chips. Si los intercambiadores de calor de la puerta trasera no caben, díganlo y deténganse. No citen un PUE para dos racks en un pabellón mixto. Ese número sería una farsa.

Luego, lo incluye en el propio trabajo de capacitación:

Control cada 30 minutos en la piscina rápida local. Si un rango muere, reinicia desde el último control completado. No esperes en el SAN. No sigas entrenando mientras los relojes hayan bajado por calor. Registra la bajada y detente para que podamos ver el bloqueo.

Una buena hora se ve así: las ocho GPU funcionando a velocidad de entrenamiento, el archivo de punto de control guardado, el trabajo aún sincronizado. Una mala hora se ve así: los ventiladores funcionando a toda velocidad, los relojes apagados, el punto de control escrito al 2% después de diez minutos, y alguien en la oficina diciendo "el clúster está activo". Activo no significa entrenamiento.

Cómo probarlo

Realizan las pruebas antes de la modernización, que es precisamente la razón por la que no se debe confiar en una demostración.

  • La misma receta de 12 épocas, los mismos 120.000 alambiques de inspección, ocho ejecuciones

  • El tiempo se mide en tiempo real hasta la finalización de la receta, incluyendo cualquier reinicio, desde el envío del trabajo hasta el último punto de control de la época 12

  • Un pase para el calor: las frecuencias de la GPU se mantienen en el objetivo de entrenamiento durante la ejecución. Un evento de limitación de rendimiento se considera un fallo, incluso si la tarea finalmente termina

  • Un vistazo al almacenamiento: tiempo de escritura del punto de control, mediana y peor, del registro de trabajo

  • Un pase a la tela: el trabajo no se queda en espera colectiva mientras un rango esté sano. Si no pueden ver esa espera, la instrumentación no está hecha

  • Dos de las ocho carreras terminan con una clasificación eliminada en un paso fijo, a propósito, para probar la ruta de reinicio

  • La inferencia es una prueba separada de 200 imágenes desde la línea de producción hasta la caja de servicio cercada. El éxito en el entrenamiento no cuenta como éxito en el servicio

  • Registran la potencia del rack proveniente de las PDU en muestras de 15 minutos para que nadie tenga que inventar un megavatio

Aceptación para calificar la celda como "lista para IA": 8 de 8 recetas finalizan; 0 de 8 muestran limitación térmica; ambas ejecuciones interrumpidas se reanudan; los puntos de control se mantienen en minutos. Si no lo logran, aún tienen una sala de servidores con tarjetas gráficas de última generación.

Resultado

Resultado ilustrativo, obtenido de una prueba ficticia de ocho ensayos, no una cifra publicada por Kestrel.

Supuestos: cuatro servidores de doble acelerador en dos racks; un modelo de inspección; 120.000 imágenes fijas; ocho ejecuciones de una receta fija de 12 épocas; el reloj de ejecución incluye reinicios hasta que finaliza la receta; la limitación de velocidad significa una caída registrada del reloj de entrenamiento; el tiempo del punto de control es la escritura, no el deseo; la potencia del rack son muestras de PDU, no un PUE del campus.

Antes de la modernización, las GPU en racks refrigerados por aire convencionales en la Ethernet de la oficina y la SAN de la máquina virtual:

  • 5 de 8 carreras se terminaron en el primer intento. Tiempo medio transcurrido entre esas cinco: 14 horas

  • Tres de los ocho tuvieron que reiniciarse tras un bloqueo alrededor de la hora 11 (dos después de que un nodo fallara con un punto de control obsoleto, uno después de que un punto de control llenara la SAN). Reintento inmediato, sin espera nocturna: 11 horas perdidas más un segundo intento de 14 horas, o 25 horas para completar la receta en esos tres

  • Tiempo medio para completar una receta en las ocho, incluyendo los reinicios: 18 horas. (Cinco a las 14, tres a las 25. La mediana de las ocho sigue siendo 14, lo que ocultaría los reinicios. Por eso, la media se utiliza como referencia)

  • Se registró limitación térmica en 7 de 8 ejecuciones. Tiempo medio con el reloj reducido: 3 horas en un intento de 14 horas

  • Escritura del punto de control: mediana de 22 minutos

  • Rank-kill no era una prueba que pudieran superar. No tenían un manual de operaciones. Las dos muertes accidentales fueron el hallazgo

  • Carga máxima de TI en los dos racks durante el entrenamiento: aproximadamente 18 kW. La fila tenía los vatios. No tenía la refrigeración ni la tela

Después de los intercambiadores de calor de la puerta trasera en esos dos bastidores, un tejido dedicado entre los cuatro nodos, un pequeño grupo NVMe para puntos de control, puntos de control cada 30 minutos y un manual de reinicio:

  • 8 de 8 terminaron en el primer intento. Tiempo medio transcurrido: 9 horas

  • Limitación térmica: 0 de 8

  • Escritura del punto de control: mediana de 90 segundos. Peor tiempo del conjunto: 3 minutos

  • Los dos asesinatos deliberados de rango se reanudaron desde el último punto de control de 30 minutos. Tiempo extra en esas dos carreras: aproximadamente 40 minutos cada una, diagnóstico incluido, por lo que esas dos rondas sumaron cerca de 9 horas y 40 minutos. Promedio en ocho rondas estáticas de 9 horas

  • La carga máxima de TI sigue siendo de unos 18 kW. Los mismos chips. Comportamiento diferente del edificio

En esta muestra, el tiempo promedio para terminar una receta se redujo de 18 horas a 9 horas, o 9 horas por receta, 72 horas en ocho intentos. El porcentaje de recetas terminadas al primer intento pasó de 5 de 8 a 8 de 8. El porcentaje de fallos pasó de 7 de 8 a 0 de 8. Ese último número es el que indica si compraron aceleradores o pisapapeles. No lo considerarán un ahorro del 50% en la producción. Ocho intentos es un conjunto pequeño y sencillo.

Estas cifras son una estimación de ejemplo basada en la prueba indicada, una muestra pequeña, un modelo y una sala mixta. No representan un PUE, ni un megavatio del campus, ni prueba de que Kestrel deba construir un centro de entrenamiento en un campo. La revisión de los registros se realizó dentro de las 9 horas; no lo ocultaron. La cifra de 18 kW es una lectura redondeada de la PDU, no una factura de servicios públicos. No convirtieron las 72 horas en un costo, porque la tarifa eléctrica combinada de la fábrica habría creado un caso de negocio falso.

La verificación del servicio fue independiente y más pequeña: 200 imágenes de línea en el recuadro cercado, todo en el lugar. Eso es una inferencia, no una capacitación. Mezclar ambos habría sido el error de la sala híbrida en miniatura.

¿Qué puede salir mal?

  • El departamento de compras sigue llamando a cuatro servidores "el centro de datos de IA". La etiqueta oculta la infraestructura, y la siguiente compra serán más GPU para el mismo pasillo defectuoso

  • Se instalan los intercambiadores de calor de la puerta trasera y nadie pone en marcha el lado del agua. Los ventiladores siguen gritando. Los relojes siguen bajando

  • La estructura es un único conmutador sin ruta de reserva. Un enlace que falla y el "clúster" vuelve a tener cuatro estaciones de trabajo

  • Los puntos de control permanecen en la SAN porque el grupo NVMe era de "fase dos". La fase dos no llega antes del siguiente nodo muerto

  • Cotizan un PUE para dos racks en una sala mixta. El clima, el límite y el resto de la fila ERP hacen que esa proporción sea un disfraz

  • La formación y el servicio comparten la misma esencia. Una inundación en el punto de control hace esperar a la línea de producción. La latencia de cola es el producto, no la densidad

  • Un nodo falla y alguien lo trata como un ticket de tiempo de actividad en lugar de un reinicio de punto de control. Los equipos de operaciones empresariales y de IA hablan sin entenderse durante toda la tarde

  • Podrían haber alquilado una jaula, excepto que las imágenes no pueden salir. Olvidar esa restricción los lleva a una conversación en la nube que tendrán que desenredar

Información práctica para llevar

Un centro de datos de IA, con esta configuración, no es un almacén ni una factura de GPU. Es la celda que permite a los aceleradores completar su ejecución: energía que pueden almacenar, calor que se disipa, una estructura, un punto de control y alguien que responda cuando un rango falla. Kestrel no necesitaba un campus. Necesitaban dos racks para dejar de fingir. La mayoría de los equipos deberían adoptar ese comportamiento. Unos pocos, con un conjunto de datos secreto y una sala que pueda soportar el calor, deberían construir una celda y rechazar el deslizamiento.

Preguntas frecuentes

¿Qué es un centro de datos de IA?

Un centro de computación de alta densidad donde la energía, la refrigeración, las redes y el almacenamiento se centran en el entrenamiento paralelo y la ejecución de modelos, en lugar de filas ordenadas de servidores de propósito general. Está diseñado para que un gran número de aceleradores puedan entrenar y ejecutar modelos sin sobrecalentarse, bloquearse en la red o esperar en el disco. Un centro de datos empresarial convencional es un entorno mixto. Un centro de IA es un monocultivo cuya unidad de valor es el acelerador, como las GPU o los chips tipo TPU. Parece un almacén y funciona como una central eléctrica que realiza cálculos matemáticos.

¿En qué se diferencia un centro de datos de IA de un centro de datos normal?

Los centros de datos tradicionales se optimizan para cargas de trabajo mixtas y tiempo de actividad en multitud de servicios. Los centros de IA invierten las proporciones: aumenta la densidad, la red se convierte en un elemento indispensable para el entrenamiento y el almacenamiento debe mantener los puntos de control en movimiento o los aceleradores permanecen inactivos. Las operaciones empresariales piensan en tickets y ventanas de cambio. Las operaciones de IA piensan en colas de trabajo y en la frustración que produce la falla de un nodo en una ejecución prolongada. Ambos podrían denominarse centros de datos; la denominación simplemente oculta la infraestructura.

¿Por qué los centros de datos de IA consumen tanta energía?

El hardware más destacado no es una CPU sofisticada, sino la bandeja aceleradora: GPU u otros chips de IA, integrados en servidores, luego en racks y finalmente en filas que comparten una red de alto ancho de banda. La clave reside en la densidad por rack: menos racks, cada uno un pequeño horno. Una vez que se llena una sala, se generan megavatios de carga informática, aunque inventar una cifra típica resulta inútil. El factor limitante suele ser la subestación, no la lista de GPU deseadas.

¿Cómo se refrigeran los centros de datos de IA?

Los racks de alta densidad disipan el calor de una forma que el aire nunca estuvo realmente diseñado para manejar. Se puede impulsar el aire con mayor fuerza mediante intercambiadores de calor en la puerta trasera, pasillos más calientes y un confinamiento inteligente. Luego aparece el líquido: refrigeración directa al chip, circuitos de refrigeración e inmersión en algunos diseños. Un acelerador que limita el rendimiento es uno que ya se pagó y no se puede aprovechar por completo. El PUE sigue siendo importante porque cada vatio gastado en ventiladores y bombas es un vatio que no se destinó a una GPU. El agua también está presente: algunas plantas beben a sorbos, otras beben a grandes tragos.

¿Por qué la conectividad es tan importante como las GPU?

El entrenamiento es una conversación: miles de aceleradores intercambian gradientes, parámetros y fragmentos de un modelo en perfecta sincronía. Si la red falla, todo el proceso se detiene en el salto más lento. Por eso, en el ámbito de la IA se priorizan las redes de alto ancho de banda, la baja latencia, las redes tipo InfiniBand o Ethernet con la misma función, y las topologías que no se colapsan cuando falla un enlace. La inferencia se centra en la latencia de cola, las numerosas solicitudes pequeñas y el aislamiento. En este edificio, la infraestructura es fundamental.

¿Para qué se utiliza un centro de datos de IA: para entrenamiento o inferencia?

El entrenamiento es una campaña: se ensambla un clúster, se le proporcionan datos, se realizan puntos de control rigurosamente y se ejecuta durante horas o semanas. La inferencia es un escaparate: modelos ya entrenados, ahora en funcionamiento, con una latencia crucial. Los centros de entrenamiento buscan potencia, terreno y densidad. Los centros de inferencia buscan latencia y presencia. Existen salas híbridas porque el capital no es infinito; a veces, una sola sala cuenta con dos sistemas de refrigeración. Un acelerador ligeramente más antiguo cerca del cliente puede superar a uno deslumbrante situado en otro continente.

¿Por qué es importante el almacenamiento en un centro de datos de IA?

Los datos de entrenamiento deben llegar lo suficientemente rápido para que las GPU no se saturen. Los puntos de control deben guardarse para que un fallo no desperdicie una semana. Los pesos del modelo deben cargarse antes de que una réplica de servicio esté activa. El rendimiento del almacenamiento, no solo la capacidad, es el cuello de botella silencioso. Puedes gastar una fortuna en aceleradores y, aun así, sobrecargarlos con un sistema de almacenamiento diseñado para máquinas virtuales.

¿Qué ocurre cuando un nodo falla a mitad de la ejecución?

Un acelerador averiado en un proceso de entrenamiento estrechamente acoplado puede paralizar todo el conjunto. El entrenamiento requiere puntos de control, no optimismo. La inferencia consume el nodo averiado, mantiene una réplica en funcionamiento y permanece activa. Las ventanas de cambio siguen entrando en conflicto con las ejecuciones de entrenamiento que no tienen en cuenta el calendario. La redundancia sigue siendo importante para la alimentación, la refrigeración, las rutas y el almacenamiento, pero el modo de fallo es menos ordenado que el antiguo modelo de nueves de tiempo de actividad.

¿Qué impacto tiene un centro de datos de IA en la red eléctrica, el agua y los vecinos?

La conexión a la red eléctrica suele ser el factor determinante en la selección del emplazamiento. El terreno es relativamente sencillo en comparación con una subestación o una empresa de servicios públicos con otros clientes. El agua para refrigeración, si se utiliza, se convierte en un problema para los vecinos en cuanto empiezan las lluvias intensas, además del ruido, el impacto visual y el calor en la valla perimetral. La capacitación puede beneficiarse de mercados eléctricos más económicos y climas más fríos. La inferencia se beneficia de la proximidad a los usuarios. No existe un emplazamiento perfecto. Existe un compromiso que se puede establecer mediante un comunicado de prensa.

¿Necesito ser propietario de un centro de datos de IA o debería alquilarlo?

La mayoría de la gente no necesita ser propietaria de uno de estos centros de datos. Las grandes empresas de servicios en la nube construyen porque su producto es la infraestructura. Los laboratorios construyen cuando el tiempo de espera es el cuello de botella o los datos no pueden salir. Un banco, un hospital, un gobierno o un fabricante con un conjunto de datos confidencial puede justificar la instalación en sus propias instalaciones o en un centro de datos privado. El resto debería alquilar: un centro de datos preparado para IA, una reserva en la nube o un clúster gestionado. Obtienes los aceleradores sin convertirte en operador de una central eléctrica.

Referencias

  1. IEA - www.iea.org

  2. LBNL - datacenters.lbl.gov

  3. La Red Verde - www.thegreengrid.org

  4. LBNL - datacenters.lbl.gov

  5. LBNL - datacenters.lbl.gov

  6. Instituto de Tiempo de Actividad - journal.uptimeinstitute.com

  7. NVIDIA - developer.nvidia.com

  8. NVIDIA - docs.nvidia.com

  9. NVIDIA - docs.nvidia.com

  10. NVIDIA - docs.nvidia.com

  11. Google Cloud - docs.cloud.google.com

Encuentra la última IA en la tienda oficial de AI Assistant

Sobre nosotros

Prueba
1. Según el artículo, ¿qué es un centro de datos de IA?

2. En la versión "lugares, no palacios", ¿qué debería hacer un equipo como Kestrel cuando las imágenes de la fábrica no pueden salir del sitio?

3. ¿Por qué el artículo utiliza la media de 18 horas, y no la mediana de 14 horas, como línea de base antes de la modernización?

4. Después de la adaptación de dos bastidores en la prueba ilustrativa de ocho ejecuciones, ¿qué cambió?

5. ¿Qué dice el artículo sobre la cotización del PUE para esta celda de dos bastidores?


Volver al blog