Huawei presenta Peerium, una arquitectura para unir hasta un millón de procesadores como un solo ordenador
por Manuel NaranjoHuawei ha presentado Peerium Computing Architecture, una arquitectura diseñada para coordinar hasta un millón de procesadores como si formasen un único ordenador. El sistema combina paralelismo anidado, direccionamiento unificado de memoria y una interconexión entre pares para ampliar el tamaño de los clústeres dedicados al entrenamiento y la inferencia de inteligencia artificial.
La compañía estrenará esta arquitectura en los Atlas 950 SuperPoD y en los SuperClusters construidos con esos sistemas. Huawei asegura que ya está desplegando un Atlas 950 SuperCluster compuesto por 256.000 aceleradores, mientras que el Atlas 960, basado en óptica cercana al encapsulado, se encuentra en fase de pruebas.
Nested BSP sustituye la jerarquía tradicional del clúster
Peerium introduce un modelo denominado Nested Bulk Synchronous Parallel, abreviado como Nested BSP. La propuesta parte del procesamiento paralelo BSP, donde los procesadores ejecutan trabajo de forma local y se sincronizan en puntos determinados, pero añade varios niveles de paralelismo para organizar grupos cada vez mayores.
Huawei plantea esta estructura como una alternativa a la organización maestro-esclavo usada en numerosos sistemas distribuidos. En ese modelo existe un componente encargado de coordinar a otros nodos, una jerarquía que puede complicar el crecimiento cuando se manejan cantidades muy elevadas de procesadores.
Con Peerium, los recursos se comunican como pares dentro de una arquitectura común. El paralelismo anidado permite dividir el sistema en conjuntos coordinados sin depender de un único controlador central para todo el clúster. La compañía afirma que este diseño mantiene un escalado fuerte hasta llegar al millón de procesadores.
El escalado fuerte mide cuánto se reduce el tiempo necesario para completar una carga de tamaño fijo al añadir más recursos de cálculo. Mantener esa mejora resulta difícil en sistemas enormes porque la comunicación y la sincronización pueden consumir una parte creciente del tiempo disponible.
Huawei no ha publicado todavía resultados independientes que permitan medir la eficiencia de Peerium cuando se acerca a su escala máxima. La presentación define la arquitectura y muestra los primeros productos, pero no incluye comparaciones completas con plataformas de otros fabricantes.

UnifiedBus conecta cálculo, memoria, almacenamiento y red
La tecnología que hace posible la interconexión recibe el nombre de UnifiedBus. Se trata de un protocolo común utilizado para conectar CPU, NPU, memoria, unidades SSD, tarjetas de red y conmutadores.
El objetivo es evitar que cada clase de componente dependa de una interfaz aislada y permitir que los recursos de cálculo, almacenamiento y comunicaciones participen en el mismo espacio. UnifiedBus también hace posible el direccionamiento unificado de memoria, con el que distintos nodos pueden acceder a recursos situados fuera de su servidor físico. Este planteamiento sigue la evolución de la infraestructura de IA diseñada a escala de rack, donde los distintos componentes funcionan como una única unidad de computación.
Huawei comenzó a desarrollar esta interconexión en 2019 y presentó públicamente UnifiedBus 2.0 en 2025. Peerium amplía ahora esa base con una arquitectura completa para sistemas que pueden crecer desde un supernodo hasta un clúster formado por cientos de miles de aceleradores.
La empresa describe UnifiedBus como un bus de alta velocidad basado en un único protocolo abierto. Su anuncio habla de una capacidad de escalado sin límite teórico, aunque las implantaciones reales siguen condicionadas por el consumo, la refrigeración, la fiabilidad y la infraestructura necesaria para mantener tantos dispositivos comunicándose.
Atlas 950 y Atlas 960 serán las primeras implantaciones
El Atlas 950 SuperPoD será el primer producto construido alrededor de Peerium. Huawei ya había enseñado una configuración de 1.024 aceleradores con 256 TB de memoria direccionable, 1 EFLOPS de rendimiento FP8 y 2 EFLOPS en FP4. Varios SuperPoD pueden conectarse para formar un SuperCluster mayor.
El anuncio de Peerium confirma que uno de estos clústeres con 256.000 tarjetas se encuentra actualmente en despliegue. Huawei no identifica al cliente ni proporciona una fecha para completar la instalación.
La siguiente plataforma será Atlas 960. Este sistema incorpora NPO, siglas de Near-Packaged Optics, una tecnología que acerca las conexiones ópticas a los componentes encargados del procesamiento. Al reducir la distancia recorrida mediante conexiones eléctricas, se puede mejorar la densidad del enlace y controlar el consumo de las comunicaciones.
Huawei ha presentado también un supernodo Ascend 960 capaz de crecer hasta 4.096 aceleradores, con 8 EFLOPS en FP8 y 16 EFLOPS en FP4. La compañía utiliza 5.500 motores ópticos Hi-ONE de 7,2 Tbit/s para reemplazar 48.000 módulos ópticos de 800 Gbit/s y calcula una reducción de consumo superior a 550 kW.
Varios supernodos pueden conectarse mediante UnifiedBus o RoCE. La configuración presentada alcanza 512.000 tarjetas con una red CLOS de cuatro planos y puede ampliarse hasta el millón mediante una topología de varios raíles.
Peerium da un nombre común a la arquitectura que coordina estos sistemas, mientras que UnifiedBus actúa como su tecnología de interconexión. El Atlas 950 de 256.000 tarjetas será la primera prueba de su comportamiento a gran escala.
Fin del Artículo. ¡Cuéntanos algo en los Comentarios!



