Huawei annonce innover sous embargo. Sur le terrain : des slides et un cluster réduit.
La vidéo de From Inside (18 sept. 2026) récite presque mot pour mot le kit de presse de Huawei Connect. L'événement est réel, les chiffres sont officiels, mais le titre est une fiction pure : Huawei n'a fait imploser aucun marché mondial. La firme a simplement avancé une date de six mois et annoncé un cluster qui n'existe encore que sur PowerPoint.
Une keynote de feuille de route, pas une révolution livrée
Le 17 septembre 2026, lors de la conférence annuelle HUAWEI CONNECT à Shanghai, le président tournant David Wang a aligné les annonces d'infrastructure :
- [Ascend 960DT] Avancé de fin 2027 au T1 2027 (la variante d'inférence 960PR glissant au T3 2027).
- [Atlas 960E SuperPoD] Annonce d'une topologie grimpant jusqu'à 4 096 NPU, revendiquant 8 EFLOPS en FP8 (16 EFLOPS FP4) et environ 1 Po de mémoire HBM. Prévu pour le T3 2027.
- [Hi-ONE & UnifiedBus] Moteur optique proche du boîtier (NPO) à 7,2 Tbit/s et bus d'interconnexion pour tenter de piloter des fermes de calcul comme une seule machine logique.
Le bilan matériel immédiat ? Rien n'a été expédié. Le silicium est à au moins six mois de sortir d'usine, le cluster complet à un an, et aucun benchmark indépendant n'existe pour corroborer les prétentions des diapositives.
Démontage assertion par assertion
Cette annonce concerne exclusivement le marché domestique chinois. Huawei a d'ailleurs confirmé cette semaine que sa nouvelle génération Ascend sera réservée à la Chine, faute de pouvoir satisfaire la demande locale. Nvidia, TSMC et le marché mondial des GPU n'ont subi aucun séisme. La conclusion même de la vidéo contredit son titre racoleur : aucune puce n'a rendu Nvidia obsolète du jour au lendemain.
Huawei affirme avoir gagné trois trimestres sur sa feuille de route initiale (qui visait le T4 2027). D'autres sources industrielles évoquaient le T3 2027, soit un gain réel de six mois. Dans les deux cas, c'est un trait sur un calendrier de présentation. Aucun processeur physique n'a été inséré dans la baie d'un client.
4 096 puces multipliées par 2 PFLOPS en FP8 donnent 8 EFLOPS sur une calculatrice. C'est le pic théorique standard utilisé par tous les constructeurs. Dans le monde réel, l'entraînement de modèles est bridé par la bande passante mémoire, la latence réseau et les failles de compilation logicielle. Le benchmark affiché par Huawei provient du laboratoire Markov : c'est une simulation logicielle, pas une exécution en production. Personne n'a fait tourner un modèle à 10 000 milliards de paramètres sur cette machine, pour la simple raison que la machine n'existe pas.
La vidéo présente le chiffre de 4 096 puces comme une démonstration de force titanesque. En réalité, l'an dernier, Huawei promettait un SuperPoD Atlas 960 à 15 488 puces, 220 baies et 30 EFLOPS FP8. L'Atlas 960E annoncé cette semaine est quatre fois plus petit que la promesse précédente. Comme l'a immédiatement souligné l'analyste Rui Ma : la date de la puce a été avancée, mais l'ambition du cluster a été divisée par quatre.
Ce que cache la miniature : Huawei reste très loin derrière
La force brute au niveau d'un dé unitaire expose l'écart technologique réel. Les estimations des cabinets spécialisés (Heise, The Register, Epoch AI) dressent un constat implacable :
Le verdict arithmétique est cinglant : il faut aligner environ dix Ascend 960DT pour égaler la puissance d'un seul GPU Rubin. La meilleure puce actuelle de Huawei équivaut approximativement à une Nvidia H100 de 2022 : quatre ans de retard sur le calcul matriciel pur. L'Ascend 960 double les performances de son prédécesseur chinois, mais ne comble absolument pas l'écart avec l'Occident.
• Atlas 960E (Huawei) : 4 096 NPU pour atteindre théoriquement 8 EFLOPS FP8 (T3 2027). Consommation électrique totale : non divulguée (les 550 kW cités ne concernent que l'économie du module optique).
• NVL72 (Nvidia) : Seulement 72 puces dans une seule baie standard (~110 kW) pour sortir ~1,26 EFLOPS FP8 et ~3,6 EFLOPS en NVFP4 dès 2026.
Huawei n'a pas rattrapé le silicium de Nvidia : ils empilent simplement 50 à 60 fois plus de puces pour masquer le déficit thermique et géométrique de leur gravure.
Rendements SMIC, pénurie de HBM et guerre optique
Sous le régime des sanctions (interdiction d'accès aux machines EUV d'ASML et aux fonderies de TSMC), SMIC fabrique ces processeurs via du multi-patterning complexe en DUV. Goldman Sachs estimait en août 2026 que les rendements industriels sur ces nœuds avancés plafonnent autour de 20 à 23 %. Produire ces NPU coûte une fortune et gaspille un nombre astronomique de galettes de silicium.
Reuters et Bloomberg ont documenté une flambée de 20 à 50 % sur les puces Ascend 950DT, dépassant désormais les 250 000 yuans par unité. La mémoire à haute bande passante (HBM) est sous embargo strict ; le marché gris la facture au prix fort. On ne « pulvérise » pas l'industrie mondiale quand on rationne ses cartes et qu'on subit une pénurie critique de mémoire.
Le NPO (Near-Package Optics) est une approche utile. Cependant, Broadcom et Nvidia déploient déjà une intégration plus dense : le CPO (Co-Packaged Optics), déjà en production sur la gamme Spectrum-X. La revendication de Huawei (« premier SuperPoD en NPO avec source lumineuse intégrée ») est une nuance rhétorique millimétrée, pas une première mondiale dans l'interconnexion optique pour l'IA.
CANN face au rouleau compresseur CUDA
Le matériel n'est rien sans la couche logicielle. La vidéo vante les chiffres de CANN (la couche logicielle de Huawei) comme un point d'inflexion majeur. Comparons les échelles :
- CUDA (Nvidia) : Plus de 2 millions de développeurs enregistrés, vingt ans d'optimisation de bas niveau (cuDNN, TensorRT), et le statut de standard natif absolu pour PyTorch.
-
CANN (Huawei) : 5 200 développeurs actifs mensuels (dont 61 % externes). Une goutte d'eau. Les retours d'ingénieurs décrivent toujours une couche logicielle instable, nécessitant la béquille
torch_npucar le code PyTorch standard ne tourne pas de façon fluide.
Quarante modèles pré-entraînés nativement sur Ascend représentent un progrès louable pour une souveraineté fermée. Ce n'est en aucun cas un écosystème capable de détrôner CUDA sur l'échiquier mondial.
Huawei accomplit un tour de force d'ingénierie sous embargo. Mais une fuite en avant architecturale ne remplace pas des usines fonctionnelles.
Compenser des puces médiocres par des topologies massives et un bus propriétaire est une réponse industrielle rationnelle face aux sanctions américaines. C'est fascinant sur le plan géopolitique, mais ce n'est ni un tueur de Nvidia, ni un produit disponible à l'achat, ni un séisme mondial. Le titre YouTube est un attrape-clics. La réalité tient dans la phrase que la vidéo murmure à peine : la limite n'est pas ce qu'on raconte en conférence de presse, ce sont les plaquettes de silicium et la mémoire physique qui sortent des lignes.