NVIDIA logra 1.648 TFLOPS por GPU al entrenar DeepSeek-V3 con 256 aceleradores GB300
por Edgar Otero 1NVIDIA ha anunciado un nuevo récord de preentrenamiento para modelos de mezcla de expertos utilizando su plataforma GB300 NVL72. La compañía alcanzó 1.648 TFLOPS por GPU con 256 aceleradores al trabajar con DeepSeek-V3, un modelo de 671.000 millones de parámetros que activa alrededor de 37.000 millones para procesar cada token.
El resultado supone una mejora cercana a tres veces frente a los 606 TFLOPS por GPU registrados anteriormente con GB200 NVL72. NVIDIA atribuye el salto al conjunto formado por Blackwell Ultra, NVLink de quinta generación, las redes de 800 Gb/s y las optimizaciones de Megatron Core. La comparación, no obstante, enfrenta una implementación reciente con resultados anteriores y software menos maduro.
Los modelos MoE reducen la cantidad de cálculo necesaria porque solo activan una parte de sus parámetros en cada paso. A cambio, generan una gran cantidad de tráfico entre GPU, ya que los tokens deben enviarse a los expertos correspondientes y recuperar después los resultados. Por este motivo, la comunicación puede convertirse en el principal límite de escalado incluso cuando todavía queda potencia de cálculo disponible.
NVLink mantiene la comunicación dentro del rack
GB300 NVL72 conecta 72 GPU Blackwell Ultra mediante NVLink, con 1,8 TB/s de ancho de banda por acelerador y 130 TB/s de comunicación agregada dentro del rack. Cada GPU puede acceder a la memoria HBM de las demás a través de operaciones directas, sin recurrir al recorrido habitual por PCIe, tarjetas de red y switches externos. Esta estructura permite mantener dentro del rack el tráfico más frecuente de los modelos MoE.

Cuando el entrenamiento se extiende a varios racks, las conexiones ConnectX-8 proporcionan 800 Gb/s por GPU mediante Quantum-X800 InfiniBand o Spectrum-X Ethernet. NVIDIA asegura que, al escalar DeepSeek-V3 desde 256 hasta 1.024 GPU, Megatron Core conserva el 98,5 % del rendimiento por acelerador. TorchTitan y JAX mantienen alrededor del 97 %, de modo que casi toda la capacidad adicional se convierte en mayor rendimiento total.
El software también ha tenido un peso notable. Sobre el mismo hardware GB300 NVL72, NVIDIA afirma haber pasado de 1.088 a 1.648 TFLOPS por GPU en seis meses, una mejora del 50 % lograda mediante optimización. TorchTitan multiplicó aproximadamente por seis su rendimiento, mientras que JAX se acercó a una mejora de diez veces y alcanzó 1.025 TFLOPS por GPU con 256 aceleradores.
La compañía utiliza estos resultados para defender que el rendimiento de una plataforma sigue creciendo después de que el silicio llegue al mercado. Megatron Core es su entorno de entrenamiento propio, pero NVIDIA también contribuye a proyectos abiertos como TorchTitan y JAX. Esto permite que las optimizaciones lleguen a varios marcos de trabajo y no queden limitadas a una única pila de software.
Un récord de Blackwell Ultra antes de la llegada de Rubin
El anuncio funciona además como demostración de la generación actual antes del despliegue de Vera Rubin. GB300 pertenece a Blackwell Ultra y utiliza NVLink de quinta generación, mientras que Rubin avanzará hacia HBM4, NVLink 6 y una integración todavía más estrecha entre CPU, GPU y red. El resultado nos constata que NVIDIA sigue ampliando el rendimiento de Blackwell mediante software mientras prepara el siguiente salto de hardware.
La compañía también ha dado protagonismo a algo que cada vez se busca más en el campo de la IA. Nos referimos a la eficiencia, que cada vez es más necesaria en vista de los costes que generan el entrenamiento y la inferencia de los modelos. Sin duda, NVIDIA quiere mantener su liderazgo en el segmento de la supercomputación, aunque la competencia no se lo va a poner fácil.
Fin del Artículo. ¡Cuéntanos algo en los Comentarios!



