Architecture logicielle — KISS, DRY, Go & Réalité matérielle

L'intelligence est devenue gratuite. Vos tuyaux sont toujours bouchés.

Depuis 2022, le microcosme tech rejoue la même illusion en accéléré : d'abord le culte du token magique, puis la chute verticale des coûts, et enfin le réflexe paresseux de tout noyer sous « encore un agent ». Dans leur papier de juillet 2026 (EPIC Data Lab, UC Berkeley), Parameswaran, Zaharia, Hellerstein et Stoica posent enfin les vrais chiffres. Le verdict est limpide : le gouffre n'est plus cognitif, il est infrastructurel.

La une Flux RSS Indice de preuve : A (Systèmes)

Autopsie d'architecture Réfutation du RAG naïf, déduplication stricte & primauté du déterminisme.

01 — L'état des lieux

Ce que Berkeley voit juste : l'avalanche spéculative

Le constat économique de départ est incontestable : la capacité de classe GPT-4 est passée de 30 $ le million de tokens début 2023 à moins d'un dollar aujourd'hui, touchant parfois le plancher des 0,10 $. La médiane de chute des coûts d'inférence avoisine un facteur 50 par an. Même sans convoquer une mythique « AGI de niveau Nobel », l'intelligence suffisante pour automatiser le travail de connaissance quotidien est devenue un bien marginalement gratuit.

Berkeley détourne la formule de Lincoln pour résumer l'avenir des bases de données : « for, of, and by agents ». Et sur la nature de la charge brute, leur diagnostic tape dans le mille :

Le profil de charge : la spéculation agentique

Un humain tape une requête ciblée. Un agent spécule. Face à une question métier floue, il sonde le schéma, inspecte les colonnes, tente des jointures bancales, reformule, échoue et recommence. Sur les benchmarks text-to-SQL multi-agents, 80 à 90 % des sous-plans d'exécution effectuent un travail déjà vu ; seuls 10 à 20 % sont distincts. Multiplier les tentatives augmente le taux de succès, mais fait exploser le travail redondant.

Le réveil de la littérature classique (MQO & AQP)

C'est le plus vieux problème du monde des bases de données réemballé sous une étiquette à la mode : l'optimisation multi-requêtes (Multi-Query Optimization) et les scans partagés. Traiter mille SELECT spéculatifs comme s'ils émanaient de mille analystes indépendants n'est pas un système pour agents : c'est un compteur d'euros déguisé en intelligence.

L'interface brisée : en finir avec le tuple SQL unique

L'agent consomme du texte libre. Rien ne justifie de le contraindre à l'austérité d'une réponse SQL tabulaire. Le moteur doit devenir proactif : renvoyer des estimations de latence, servir des approximations satisfaisantes (AQP / satisficing), streamer les premiers octets d'un opérateur intermédiaire pour lui permettre d'avorter une branche stérile, ou lui injecter des macros compilées plutôt que d'énumérer un espace de recherche exponentiel.

02 — La critique matérialiste

Ce que le puriste refuse d’avaler

1. L’armée caféinée n’est pas une architecture

Lâcher mille agents en roue libre sur une base pour trouver un churn prédictif n'est pas une prouesse technique ; c'est un aveu d'impuissance algorithmique. En Go, on n’appelle pas ça un « essaim autonome » : on appelle ça un fan-out sauvage sans sync/singleflight. Le travail d'un vrai système n'est pas d'encaisser 900 exécutions jumelles pour flatter les métriques de cloud providers, mais de dédupliquer en vol, de fusionner les scans de disques et d'étrangler la spéculation inutile.

2. Markdown n’est pas une base. Un graphe sans prédicats non plus.

Le folklore actuel du « tout dans des fichiers .md qu'on greppe à coup d'embeddings vectoriels » est l'exact opposé de la philosophie DRY. C’est recompiler tout le corpus à chaque tour d'inférence. Pire : empiler des traces brutes d'exécutions ratées dans la mémoire d'un modèle ne produit pas de l'apprentissage, mais du karaoké d'erreurs antérieures. La mémoire d'un agent de données n'est pas le journal intime de ses hésitations ; c'est une règle corrective typée : sur cette table, product_cleaned prévaut sur product ; pour les dates, l'année fiscale s'applique. Cela tient dans un index structuré avec des prédicats stricts — pas dans un second cerveau ésotérique.

3. La synthèse de code n’absout pas l'absence de spécification

Générer un moteur C++ taillé sur mesure pour une requête analytique en vingt minutes (Bespoke OLAP, GenDB) est une idée intellectuellement stimulante. Mais c’est le royaume absolu du reward hacking : si la spécification comporte le moindre angle mort, le modèle optimise la métrique cible en corrompant silencieusement les cas limites. Un binaire régénéré toutes les semaines sans sémantique formelle ni invariants vérifiables n'est pas un système libre : c'est un artefact jetable indébuggable. Un vieux PostgreSQL épuré dont le chemin critique est vérifié inspire mille fois plus confiance qu'un monolithe généré d'une nuit, fût-il 10× plus véloce sur un benchmark qu'il a lui-même intériorisé.

4. La coordination distribuée ne se résout pas avec un prompt

Quatre agents-développeurs qui négocient un schéma, le rollback de 999 transactions spéculatives avortées, la gestion des nœuds traînards (stragglers) et le risque de livelock où des compensations mutuelles tournent en boucle : rien de tout cela n'est un « problème LLM ». C'est de l'ingénierie des systèmes distribués pure et dure. Aucun modèle ne remplace la sémantique de validation, l'isolation MVCC, les CRDTs ou un bon vieil arbre de context.Context capable d'annihiler une sous-arborescence de goroutines d'un trait. Le substrat doit avoir l'autorité de trancher et de dire non ; sinon, vous payez un comité d'entreprise infini facturé au token.

03 — Le cahier des charges de l'artisan

Spécification d'un moteur sain pour l'ère post-token

Si l'on débarrasse le papier de Berkeley de son imagerie cartoon (le robot et la base de données qui se tiennent la main), voici ce qui reste pour un développeur de systèmes :

[INTERFACE]

Remplacer l'illusion du SQL unitaire par des requêtes par lots associées à des budgets explicites (seuil de latence, niveau d'approximation toléré, plafond de cardinalité). Renvoyer des métadonnées exploitables : estimation de coût, vue matérialisée concurrente, diagnostic de blocage précoce.

[EXÉCUTION]

Déduplication impérative des sous-plans en amont du stockage. Mutualisation des scans disque. Échantillonnage statistique streamé. La redondance est une dette d'ordonnanceur, même si elle améliore la probabilité statistique de l'agent.

[MÉMOIRE]

Structuration stricte par facettes applicatives et attributs de filtrage direct. Stockage exclusif de règles correctives validées. Écritures concurrentes protégées par horodatage ou versions immuables, et non un dossier de fichiers texte écrasé par dix workers aveugles.

[SYNTHÈSE]

Génération de moteurs spécifiques admise uniquement si la charge est figée, la surface de code ultra-réduite, les suites de tests adversariales générées en continu, et le chemin critique adossé à un solveur formel. DRY appliqué aux moteurs : on ne réécrit pas la couche d'I/O parce qu'une heuristique de tri a changé.

[SOUVERAINETÉ & LOGICIEL LIBRE]

Modèles ouverts tournant localement, traces d'audit intégrales, spécifications versionnées dans le dépôt Git. L'intelligence promise par les API propriétaires n'est « quasi gratuite » que jusqu'au prochain verrouillage commercial.

04 — Dépasser le vertige

La fusion annoncée : progrès réel ou cauchemar de maintenance ?

La conclusion de l'essai de Berkeley anticipe une hybridation totale : des agents concevant les bases sur lesquelles ils opèrent, réécrivant récursivement les couches de stockage, l'optimiseur et les structures de données dans une boucle d'auto-amélioration continue.

Traduction d'ingénieur : oui, les séparations traditionnelles entre analyseur syntaxique, planificateur et gestionnaire de pages étaient le reflet des organigrammes d'équipes humaines du siècle passé. Un compilateur assisté par modèle peut fusionner ces couches pour extraire des gains de localité mémoire inouïs.

Mais fusionner n'est pas un projet architectural en soi. C'est une optimisation d'infrastructure acceptable si et seulement si elle préserve l'auditabilité du système. Une base de données dont aucun humain ne peut expliquer l'état de cohérence interne à trois heures du matin n'est pas un bond en avant : c'est un générateur d'incidents critiques en sursis.

Verdict d'atelier

Le modèle est une commodité interchangeable. La tenue de l'état et l'intégrité des I/O restent l'unique champ de bataille.

• L'erreur 2022-2025 : Avoir pris le LLM pour le système, en accumulant des couches d'abstractions branlantes pour compenser l'amnésie du prompt.

• Le retour au réel : Empêcher 90 % de sous-requêtes parasites de réveiller les disques, structurer le savoir correctif dans des schémas stricts et refuser tout code généré sans démonstration d'invariants.

• Règle d'or : L'intelligence ne remplace ni le verrou, ni le cache, ni la rigueur d'une interface étroite. On cite l'équipe de Berkeley, mais on ne lui délègue pas la garde du dépôt.