Rupture empirique documentée

Recherche fondamentale — Boucle fermée & Auto-conception.
GAIR-NLP — 1 773 expérimentations autonomes sur clusters GPU.

L'IA conçoit ses propres cerveaux. Nous venons de perdre le monopole de l'intuition.

Pendant des décennies, la recherche en apprentissage profond reposait sur une division du travail immuable : l'humain concevait l'architecture à coups d'intuitions et d'heuristiques, la machine se contentait d'optimiser les poids.

Avec ASI-ARCH, le laboratoire GAIR-NLP vient de dynamiter cette frontière. Les algorithmes inventent désormais leurs propres mécanismes de calcul de A à Z, sans demander l'avis de personne.

Licence : Apache 2.0

 

Ce n'est plus du réglage d'hyperparamètres. C'est de l'invention pure.

La rupture de méthode

Le milieu académique s'est longtemps rassuré en qualifiant le « Neural Architecture Search » (NAS) de simple force brute : faire varier quelques dimensions de tenseurs, tester des taux d'apprentissage ou empiler des couches standard selon des grilles définies par des ingénieurs humains.

ASI-ARCH opère à un tout autre niveau d'abstraction. Le système ne bricole pas dans un bac à sable pré-balisé. Il formule des hypothèses mathématiques nouvelles, écrit le code d'implémentation bas niveau sous forme d'opérateurs PyTorch/CUDA, teste l'entraînement en conditions réelles, débugge ses propres erreurs de compilation et rédige ses propres comptes-rendus d'arbitrage.

C'est l'équivalent d'un département complet de recherche au MIT tournant sous stéroïdes algorithmiques, concentré sur l'un des verrous mathématiques les plus ardus de notre décennie : l'attention linéaire et le dépassement du coût quadratique des Transformers.

 

Trois agents en boucle fermée : l'usine à science

La machine sociale interne

L'architecture d'ASI-ARCH repose sur une division fonctionnelle stricte incarnée par trois agents LLM collaborant en boucle fermée, sans le moindre arbitrage humain intermédiaire :

[1. LE CHERCHEUR (THE RESEARCHER)]

Le générateur conceptuel. Nourri d'une base de connaissances vectorisée regroupant plus de cent articles séminaux sur les mécanismes d'attention sous-quadratique (Mamba, RWKV, RetNet, Linear Attention), il propose des variations structurelles inédites et les traduit directement en code exécutable.

[2. L'INGÉNIEUR (THE ENGINEER)]

Le praticien d'atelier. Il prend le script généré, configure l'entraînement sur le cluster et lance l'exécution. En cas de plantage (erreurs de dimensions, instabilités numériques, saturation VRAM), il analyse les stack traces, inspecte le code fautif, applique les correctifs et relance la session de manière totalement autonome.

[3. L'ANALYSTE (THE ANALYST)]

Le censeur impitoyable. Il dépouille les courbes de perte, la vitesse de convergence, la perplexité et l'empreinte mémoire. Il compare méthodiquement les résultats face aux modèles de référence et synthétise une note technique formalisant ce qui a fonctionné, ce qui a échoué, et pourquoi.

Ce rapport d'analyse est réinjecté instantanément dans le contexte du Chercheur. Le système s'instruit de ses propres échecs à chaque cycle : c'est le premier moteur empirique de découverte scientifique qui s'auto-accélère.

1 773 expériences, 20 000 heures de GPU, 106 SOTA

Données de production

Pendant que la communauté débattait de la fin supposée des gains d'échelle, ASI-ARCH a tourné en continu. Le bilan chiffré détruit l'illusion d'une recherche artisanale :

VOLUME D'EXPÉRIMENTATION 1 773 sessions complètes

Entraînements menés de bout en bout sur 20 000 heures de calcul GPU sans intervention humaine.

RÉCOLTE ARCHITECTURALE 106 architectures SOTA

Modèles surclassant systématiquement l'intégralité des baselines conçues par des équipes de chercheurs humains.

Ces 106 architectures ne sont pas de simples variantes cosmétiques. À l'image du célèbre Coup 37 d'AlphaGo contre Lee Sedol — un coup jugé absurde par les maîtres traditionnels avant de révéler une profondeur stratégique inaccessible au regard humain —, ASI-ARCH a fait émerger des agencements de portes de contrôle (gating) et de convolutions que les théoriciens de la discipline n'avaient tout simplement jamais formulés.

 

La première loi d'échelle appliquée à la découverte scientifique

La rupture épistémologique

Voici la véritable onde de choc du papier de GAIR-NLP : les chercheurs ont tracé le nombre cumulé d'architectures état de l'art (SOTA) découvertes en fonction du temps de calcul machine consommé.

 

Une relation linéaire stricte : Calcul = Percées

La corrélation est quasi parfaite. Cela signifie que la découverte scientifique obéit désormais à une loi d'échelle prévisible : doublez les ressources de calcul allouées à la boucle d'agents, vous doublez mathématiquement le nombre de ruptures architecturales obtenues.

Le goulet d'étranglement historique — le temps de cerveau disponible d'un chercheur devant rédiger un papier, relire du code et attendre une conférence — est purement et simplement effacé. La vitesse de l'innovation cesse d'être une fonction de la créativité biologique pour devenir une ligne de budget d'infrastructure.

 

L'expérience bat l'originalité : la leçon KISS de la machine

Leçon d'atelier

L'analyse des motifs au sein de la « galerie » des 106 architectures retenues livre une leçon magistrale d'ingénierie :

La dissection des choix de design :

• 45 % des décisions proviennent de l'analyse empirique et cumulative des erreurs du système lui-même.

• Seulement 7 % des décisions proviennent d'une recherche d'originalité conceptuelle pure.

Les modèles les plus véloces ne sont pas nés d'idées baroques ou de composants exotiques sortis de nulle part. La machine s'est comportée en artisan pragmatique : elle a convergé vers un ensemble resserré de briques éprouvées (mécanismes de fenêtrage, convolutions locales, projections linéaires contraintes) et a passé des milliers d'heures à raffiner minutieusement leur couplage.

Ce que l'humain prenait pour du génie créatif n'était qu'une exploration combinatoire trop lente. La machine n'essaie pas de réinventer la roue à chaque commit : elle capitalise sur les faits observables.

 

Publié en licence libre Apache 2.0 !

L'ouverture des vannes

Si cette technologie était restée enfermée dans les coffres-forts d'un géant privé, elle n'aurait été qu'une arme de monopole supplémentaire. Mais GAIR-NLP a pris le parti inverse : l'intégralité du framework, les protocoles des trois agents et le catalogue des 106 architectures ont été publiés sous licence libre Apache 2.0.

Nivellement immédiat du terrain de jeu

N'importe quel laboratoire universitaire indépendant, n'importe quelle équipe restreinte disposant de quelques cartes graphiques et d'une connexion réseau peut désormais cloner le dépôt et lancer sa propre usine de découverte autonome. Le savoir-faire des architectures d'attention n'est plus l'apanage des oligopoles de la baie de San Francisco.

 

« Buy the ticket, take the ride. » La formule d'Hunter S. Thompson s'applique désormais à l'histoire des sciences : le ticket est composté, et nous ne sommes plus les seuls aux commandes.

• Fin du monopole biologique : L'innovation neuronale s'affranchit du temps d'apprentissage de l'artisan humain.

• Industrialisation de la découverte : Le progrès technique bascule d'un modèle d'artisanat intellectuel vers une fonction de production matérielle directement indexée sur les watts et les GPU.

• Sources & Référentiels : Dépôt officiel github.com/GAIR-NLP/ASI-Arch et publication du projet sur gair-nlp.github.io/ASI-Arch.