La GPU NVIDIA Rubin tendrá 336.000 millones de transistores, 288 GB de HBM4 y hasta 50 PFLOPS en NVFP4

La GPU NVIDIA Rubin tendrá 336.000 millones de transistores, 288 GB de HBM4 y hasta 50 PFLOPS en NVFP4

por Edgar Otero

La jornada está siendo movidita con NVIDIA. Además de todos los detalles proporcionados sobre la CPU Vera, la compañía ha desvelado nuevos detalles técnicos de Rubin, su próxima GPU para centros de datos y la pieza de mayor potencia dentro de la plataforma Vera Rubin. El chip estará compuesto por dos dies unidos mediante la interfaz NV-HBI y reunirá 336.000 millones de transistores, 224 SM y 896 Tensor Cores, unas cifras orientadas a cargas de inferencia y entrenamiento de gran escala.

La arquitectura podrá alcanzar hasta 50 PFLOPS en inferencia NVFP4 gracias a la tercera generación del Transformer Engine. Este bloque adapta la precisión numérica a distintas fases del modelo para aumentar el rendimiento sin perder la exactitud necesaria. NVIDIA sitúa a Rubin como una GPU diseñada para sistemas de inteligencia artificial agéntica, donde la ejecución se prolonga durante múltiples pasos y herramientas en lugar de limitarse a una sola consulta.

Uno de los cambios más importantes está en la memoria. Rubin integrará hasta 288 GB de HBM4 con un ancho de banda máximo de 22 TB/s, alrededor de 2,8 veces más que Blackwell y Blackwell Ultra. La capacidad permitirá alojar modelos mayores, ventanas de contexto más largas y cachés KV más amplias, mientras que el ancho de banda ayudará a acelerar la generación de tokens durante la fase de decodificación.

Mejoras específicas para modelos MoE y atención de contexto largo

Los modelos de mezcla de expertos plantean un problema especial porque los tokens deben enviarse de forma dinámica a distintas partes del modelo. Rubin mejora el Tensor Memory Accelerator para reducir la gestión de metadatos y facilitar que varios expertos compartan descriptores de memoria. De esta manera, se dedica menos tiempo a mover y organizar datos y más a ejecutar las operaciones útiles de inferencia.

Geeknetic La GPU NVIDIA Rubin tendrá 336.000 millones de transistores, 288 GB de HBM4 y hasta 50 PFLOPS en NVFP4 1

La GPU también duplica la cantidad de datos que sus Tensor Cores pueden procesar por ciclo en la dimensión K de las multiplicaciones matriciales. Esto reduce el número de iteraciones necesarias en operaciones distribuidas entre muchas GPU, especialmente cuando cada acelerador trabaja con una porción pequeña del resultado. Según NVIDIA, la mejora beneficia tanto a cargas limitadas por cómputo como por memoria.

Rubin incorpora además nuevas funciones para acelerar la atención en contextos largos. La arquitectura puede aplicar sparsity estructurada a representaciones intermedias, reducir el volumen de datos que atraviesa softmax y acelerar las operaciones exponenciales. Frente a Blackwell, NVIDIA habla de hasta el doble de rendimiento exponencial en FP32 y cuatro veces más en BF16 o FP16. El resultado esperado es un menor coste al procesar secuencias extensas.

Otro avance afecta al encadenamiento de kernels. Rubin permite que una operación consumidora empiece antes cuando los datos necesarios ya están disponibles, sin esperar a que concluya un bloque mayor de trabajo. Este mecanismo reduce huecos de inactividad y mejora la continuidad de la ejecución, algo relevante en inferencia agéntica, donde la latencia entre operaciones condiciona los tokens por segundo.

NVLink 6 y PCIe 6.0 para mover datos a escala de rack

La conectividad también recibe un salto importante. NVLink 6 proporcionará hasta 3,6 TB/s por GPU para comunicaciones dentro del dominio de escala, mientras que NVLink-C2C alcanzará 1,8 TB/s en el enlace coherente entre CPU y GPU. A esto se suma una interfaz PCIe 6.0 x16 con hasta 256 GB/s, formando una red de datos más rápida dentro y fuera del encapsulado.

NVIDIA ha introducido además escrituras contabilizadas para reducir la sobrecarga de sincronización entre GPU. El sistema permite que el receptor conozca con mayor precisión cuándo ha terminado una transferencia sin recurrir a tantos pasos adicionales. Esta mejora busca mantener ocupadas las unidades de cálculo cuando varias GPU intercambian activaciones, pesos o resultados parciales mediante comunicación directa iniciada desde el dispositivo.

Rubin forma parte de un sistema mayor en el que la CPU Vera, los switches NVLink, las redes Spectrum-X y la gestión energética trabajan de forma conjunta. Los siete chips de la plataforma ya se encuentran en producción, según anunció NVIDIA durante el GTC 2026. La nueva información permite conocer ahora qué aporta la GPU dentro de ese conjunto. La compañía promete hasta 10 veces más rendimiento agéntico por unidad de energía frente a Blackwell en una carga interna basada en un modelo MoE de dos billones de parámetros, además de una mayor eficiencia y control energético.

Fin del Artículo. ¡Cuéntanos algo en los Comentarios!

Redactor del Artículo: Edgar Otero

Edgar Otero

Soy técnico en sistemas informáticos, empecé a experimentar un Pentium II, aunque lo mío siempre ha sido el software. Desde que actualicé de Windows 95 a Windows 98 no he dejado de instalar sistemas. Tuve mi época Linuxera y fui de los que pidió el CD gratuito de Canonical. Actualmente uso macOS para trabajar y tengo un portátil con Windows 11 en el que también he instalado Chrome OS Flex. En definitiva, experimentar, probar y presionar botones.

Comentarios y opiniones sobre: La GPU NVIDIA Rubin tendrá 336.000 millones de transistores, 288 GB de HBM4 y hasta 50 PFLOPS en NVFP4 ¿Qué opinas? ¿Alguna pregunta?