Portrait

Elle a forcé les machines à regarder le monde. Et le monde lui a renvoyé ses monstres.

Dans les années 2000, l'élite de l'intelligence artificielle méprisait les données pour ne jurer que par l'élégance des équations. Fei-Fei Li a compris que l'algorithme n'était rien sans la boue du réel.

Indice de preuve : A (Historique)

Archives Stanford, mémoires ("The Worlds I See"), publications FAT* & enquêtes ouvertes.

La presse à vapeur le samedi, la physique quantique le lundi

Récit d'une trajectoire totale : du travail clandestin dans un pressing à la maternité involontaire de la surveillance biométrique de masse.

On ne comprend rien à l'obstination industrielle de Fei-Fei Li si l'on oublie d'où elle regarde. Débarquée de Chengdu à l'âge de seize ans dans une banlieue morne du New Jersey, parlant à peine anglais, elle passe son adolescence entre les manuels scolaires et les petits boulots de survie : ménage dans des restaurants chinois, caisse dans une station-service.

Même après avoir décroché une bourse pour étudier la physique à Princeton, le cordon ne se coupe pas. Pour financer les dettes médicales de sa mère et permettre à sa famille de subsister, elle emprunte de l'argent et achète une blanchisserie de quartier à Parsippany. Durant toutes ses années d'études de premier cycle, son emploi du temps est scindé en deux mondes étanches : du lundi au vendredi, les cours d'électrodynamique et de mécanique quantique ; le week-end, retour à Parsippany pour actionner les presses à vapeur industrielles et nettoyer les chemises des banquiers locaux.

Cette confrontation précoce avec la matière ingrate, le labeur répétitif et la résistance du réel lui épargnera l'arrogance théorique de ses pairs. Pour Fei-Fei Li, la science n'est pas un jeu d'esprit pur : c'est un chantier où l'on doit accepter de se salir les mains.

Quand l'aristocratie du code méprisait les pixels

Au milieu des années 2000, la vision par ordinateur est une sous-discipline académique corsetée dans des impasses mathématiques. La communauté est obsédée par la conception d'algorithmes « intelligents » : des modèles statistiques ultra-complexes (machines à vecteurs de support, descripteurs SIFT) testés sur des jeux de données minuscules et stérilisés, comme Caltech 101 (une poignée d'images par classe).

Le dogme dominant affirme : « Si l'algorithme est assez sophistiqué, il apprendra à généraliser à partir de quelques dizaines d'exemples. »

Fraîchement nommée professeure adjointe à l'université de l'Illinois puis à Princeton, Fei-Fei Li pose un diagnostic inverse, nourri par les sciences cognitives. Un enfant humain qui apprend à voir ne résout pas des équations d'optimisation dans le vide : ses yeux reçoivent des centaines de millions d'images du monde réel, en mouvement continu, dès ses premières années de vie. Le goulot d'étranglement de la vision artificielle n'est pas le manque d'ingéniosité algorithmique ; c'est la famine statistique.

L'excommunication par les pairs (2007)

Lorsqu'elle soumet ses premières demandes de financement à la National Science Foundation (NSF) pour cartographier l'ensemble du monde visuel, les comités de lecture rejettent le dossier avec dédain. Le projet est qualifié de « travail subalterne de bibliothécaire », indigne de la recherche fondamentale en informatique. On lui reproche de vouloir amasser des données plutôt que d'écrire des théorèmes. Seule contre le consensus, elle finance les débuts du projet sur ses fonds propres de démarrage de laboratoire.

50 000 tâcherons pour cartographier le web

Pour structurer cette encyclopédie visuelle, Fei-Fei Li et son étudiant en thèse Jia Deng s'appuient sur WordNet, l'ontologie lexicale hiérarchique conçue par George Miller à Princeton dans les années 1980. Le plan : associer des centaines d'images réelles à chaque concept (« synset ») du dictionnaire.

Le mur logistique est immédiat. En recrutant des étudiants de premier cycle à dix dollars de l'heure pour trier et étiqueter les images scrapées via Google Images et Flickr, l'équipe calcule qu'il faudra dix-neuf ans pour finaliser la base. Le projet est mort-né.

Le salut — et le péché originel — viendra d'un outil émergent lancé par Jeff Bezos : Amazon Mechanical Turk. Une bourse mondiale du micro-travail numérique où des internautes précaires vendent leur attention pour quelques fractions de centimes par clic.

[L'ÉCHELLE DU DISPOSITIF (2007-2009)]

ImageNet devient instantanément le premier employeur mondial sur Mechanical Turk. Plus de 50 000 annotateurs répartis dans 167 pays trient, filtrent et valident 160 millions d'images candidates.

[LE RÉSULTAT BRUT]

En 2009, le papier séminal est présenté à la conférence CVPR à Miami : 14 197 122 images organisées en 21 841 catégories. La communauté scientifique accueille la présentation dans l'indifférence générale. Personne ne sait quoi faire d'un monstre de données pareil.

Florence 2012 : la collision AlexNet et le basculement du monde

Comprenant que la communauté n'utilisera pas spontanément sa base, Fei-Fei Li crée en 2010 un concours annuel ouvert : l'ImageNet Large Scale Visual Recognition Challenge (ILSVRC). Le défi porte sur un échantillon réduit à 1 000 classes et 1,2 million d'images. Deux ans durant, les techniques d'ingénierie statistique traditionnelles grappillent péniblement des dixièmes de pourcent de précision, plafonnant à plus de 25 % de taux d'erreur.

Le séisme a lieu en octobre 2012, lors de la session de remise des prix à Florence.

Une équipe de l'université de Toronto — composée d'Alex Krizhevsky, Ilya Sutskever et de leur mentor Geoffrey Hinton — présente AlexNet. Un réseau de neurones convolutif profond (CNN), vestige théorique des années 1980 réhabilité et entraîné brutalement sur deux cartes graphiques grand public Nvidia GeForce.

L'effondrement du mur : 15,3 % d'erreur

AlexNet pulvérise l'état de l'art mondial en réduisant le taux d'erreur de près de dix points de pourcentage d'un coup. Un gouffre statistique inédit dans l'histoire des sciences informatiques.

Ce jour-là, l'intelligence artificielle moderne prend vie par la conjonction triangulaire de trois facteurs : les algorithmes d'apprentissage profond de Hinton, la puissance de calcul parallèle des GPU de Jensen Huang, et le carburant sans lequel les deux premiers tournaient à vide : le dataset titanesque de Fei-Fei Li. Sans ImageNet, le deep learning serait resté une curiosité théorique de laboratoire.

Du Pentagone à ImageNet Roulette : le prix de la naïveté

Propulsée icône mondiale de la tech, Fei-Fei Li prend une année sabbatique de Stanford en 2017 pour devenir Chief Scientist chez Google Cloud. Elle y découvre la violence de la realpolitik industrielle.

Elle se retrouve prise dans la tempête du Project Maven — le contrat secret liant Google au Département de la Défense américain pour analyser automatiquement les vidéos de drones militaires par vision artificielle. Ses courriels internes fuitent dans la presse : soucieuse de protéger l'image de marque de Google, elle tente d'édulcorer l'implication de l'IA militaire, tout en saluant en interne une « victoire stratégique » pour le cloud. La révolte de milliers d'ingénieurs de Google la traumatise. Elle quitte l'entreprise à l'automne 2018 pour se réfugier à Stanford.

Le miroir toxique d'ImageNet (2019)

La même année, le projet artistique ImageNet Roulette de Trevor Paglen et Kate Crawford fait exploser l'infrastructure sur la scène publique. En collant l'arbre person d'ImageNet sur des visages réels, le public découvre que la base étiquette les gens comme loser, slattern (souillon), rape suspect ou via des insultes raciales. La carte du monde visuel n'était pas un sanctuaire scientifique neutre : c'était une matrice d'essentialisme visuel où le profilage biométrique, le vol de photographies privées et le mépris de classe des travailleurs turkeurs étaient gravés dans les poids des modèles.

De l'éthique de Stanford à l'Intelligence Spatiale (2026)

Pour conjurer les dérives qu'elle a elle-même contribué à armer, Fei-Fei Li fonde en 2019 le Stanford Institute for Human-Centered AI (HAI). Une forteresse académique financée par les géants de la Silicon Valley, destinée à réconcilier la technologie avec l'éthique, la démocratie et la philosophie. Ses détracteurs y voient une manœuvre d'auto-absolution institutionnelle ; ses partisans, une prise de conscience salutaire.

Mais la chercheuse ne s'arrête pas au rôle de vigie morale. Constatant que les modèles de langage génératifs (LLM) restent aveugles et désincarnés, elle ouvre un nouveau front en lançant sa startup World Labs :

Le nouveau saut : l'intelligence spatiale

Après avoir appris aux machines à reconnaître des étiquettes statiques en 2D sur des photos plates, le défi de la seconde moitié de la décennie 2020 est de leur donner la compréhension physique du monde en 3D — estimer les volumes, la gravité, l'espace et l'action. Générer des World Models capables d'interagir avec la réalité plutôt que de simplement prédire des pixels d'écran.

• Le courage méthodologique : Avoir osé affronter l'orthodoxie académique pour imposer la centralité des données empiriques massives.

• L'aveuglement extractionniste : Avoir délégué la classification de l'humanité à un sous-prolétariat du clic sans mesurer les biais de l'époque ni exiger le consentement des corps photographiés.

• L'ironie historique : L'intelligence artificielle n'a pas commencé avec des lignes de code magiques écrites par des prophètes, mais avec une immigrée chinoise faisant tourner une usine de tri d'images à la chaîne pour nourrir un moteur dont personne ne voulait.








Archéologie de l'IA — Ontologie, scraping & pouvoir

ImageNet a donné des yeux aux machines. Il leur a aussi appris à préjuger.

Pour un portrait de Fei-Fei Li, l’épisode ImageNet Roulette de 2019 n'est pas une simple péripétie technique.

Il révèle le péché originel de la vision par ordinateur moderne : croire qu'on peut classifier des corps humains avec la même insouciance taxonomique que des races de chiens ou des chaises de bureau.

Indice de preuve : A (Documenté)

Sources : Excavating AI (Crawford & Paglen), FAT* 2020 (Yang et al.), Princeton WordNet.

Un lexique du XXe siècle plaqué sur des visages du XXIe

ImageNet n’a pas inventé ses catégories. Le projet s'est adossé à WordNet, une base de données lexicale hiérarchique conçue à Princeton dans les années 1980. L’ambition semblait élégante : organiser la réalité visuelle comme la linguistique structure le sens des mots. Le piège était fatal : WordNet charriait des synsets datés, misogynes, moralisateurs et ouvertement péjoratifs.

En 2019, l'artiste Trevor Paglen et la chercheuse Kate Crawford braquent le projecteur sur cette faille avec le projet ImageNet Roulette. Le grand public découvre avec stupeur qu'un selfie soumis au modèle peut renvoyer des étiquettes telles que loser, slattern (souillon), alcoholic, rape suspect, ou des insultes raciales directes, nichées aux côtés de bridegroom ou scuba diver.

Le constat d'échec chiffré par le labo

Face au scandale, l'équipe d'ImageNet audite enfin sa propre création : sur les 2 832 synsets composant la branche « personne », 1 593 sont formellement jugés unsafe (injures, orientation sexuelle, religion, stéréotypes). Sur les 1 239 restants, seuls 158 sont reconnus à la fois acceptables et visuellement repérables. Bilan : plus de 94 % des catégories humaines d'ImageNet n'auraient conceptuellement jamais dû exister.

L'illusion de l'imageabilité

Même un label réputé neutre (Bahamian, debtor, scientist) pose une dérive épistémologique : prétendre inférer une nationalité, une solvabilité financière ou une profession à partir des traits d'un visage réactive une forme moderne de physiognomonie numérique. Comme l'admettra l'équipe elle-même : un mot peut être « sûr » dans un dictionnaire sans qu'il soit éthique ou scientifiquement possible de le lire sur un corps.

Scraping sauvage et prolétariat du clic

Les millions de photos d'ImageNet ne proviennent pas de banques d'images sous licence ou de volontaires posant en studio. Elles ont été aspirées en masse sur le web public — moteurs de recherche, galeries Flickr privées, blogs — sans l'accord, ni même l'information, des personnes immortalisées.

L'intimité pillée :

Le corpus complet contenait sans discernement des scènes familiales, des soirées privées, du contenu pour adultes et des photos d'enfants dénudés. Des millions d'individus sont devenus, à leur insu, les rouages d'entraînement de technologies biométriques de surveillance et de profilage commercial. Flouter les visages dix ans après le lancement n'efface pas les poids déjà fixés dans les réseaux neuronaux.

Le sous-traitant invisible :

Pour trier 160 millions d'images candidates, Fei-Fei Li a mobilisé la plateforme Amazon Mechanical Turk, transformant ImageNet en l'un des plus gros donneurs d'ordres de micro-travail au monde. Plus de 50 000 travailleurs sous-payés ont cliqué à la chaîne, pour quelques fractions de centimes, projetant dans la machine leurs propres stéréotypes culturels et validant les biais algorithmiques des moteurs de recherche de l'époque (surreprésentation des hommes blancs de 18 à 40 ans).

L'essentialisme visuel encodé dans le deep learning

L'argument de défense classique de la communauté technique consiste à rappeler que le célèbre benchmark annuel (ILSVRC) ne comportait que 1 000 classes, dont seulement trois catégories humaines (scuba diver, bridegroom, baseball player). La réalité historiographique est bien plus sombre :

  • [CIRCULATION DU CORPUS BRUT]

    Le jeu complet (ImageNet-21K) a circulé librement dans tous les laboratoires universitaires et industriels de la planète pendant une décennie entière, servant de base fondamentale aux architectures de vision par ordinateur.

  • [IMPRÉGNATION LATENTE]

    Même sur les jeux d'images réduits, les représentations vectorielles apprises reproduisent fidèlement les biais sociologiques de leur distribution d'origine. Les modèles associent plus facilement les peaux claires aux contextes scientifiques et les peaux foncées aux contextes criminels ou subalternes.

En concevant une base de données pensée pour cartographier le monde physique des objets, ImageNet a appliqué par inadvertance une théorie politique naïve : l'essentialisme visuel, postulant que l'identité, la valeur et la moralité d'un être humain se déduisent de sa surface picturale.

L'amputation tardive : vers un dataset plus équitable ?

Dès 2019, les téléchargements publics sont restreints en urgence. En 2020, l'équipe publie l'article académique Towards Fairer Datasets (FAT* 2020) :

Le grand nettoyage (ImageNet-21K Hiver 2021)

Suppression nette d'environ 600 000 images problématiques. L'arbre « personne » est tronçonné, passant de milliers de nœuds délétères à 158 catégories observables (essentiellement des fonctions matérielles ou des métiers identifiables par des accessoires, comme pompier ou plongeur).

L'illusion du patch technique

Comme l'ont souligné Crawford et Paglen, équilibrer artificiellement des pourcentages de couleur de peau ou de genre dans un dataset n'efface pas la question politique fondamentale : a-t-on le droit de réduire des millions d'individus à des pixels d'entraînement sans leur consentement explicite ?

Le legs Fei-Fei Li

ImageNet a prouvé qu'un jeu de données n'est pas un miroir neutre de la nature, mais un acte de pouvoir.

• Le paradoxe scientifique : C'est précisément l'ampleur industrielle et le scraping sans filtre qui ont permis l'explosion du deep learning en 2012.

• La rupture éthique : On ne peut plus évaluer la performance d'un modèle sans auditer l'infrastructure invisible : qui nomme, qui extrait, et qui paie le coût social de la classification.

• L'ironie finale : Si Fei-Fei Li a fondé à Stanford le prestigieux institut HAI (Human-Centered AI), c'est parce que son chef-d'œuvre passé avait tragiquement oublié de placer le consentement humain au centre de son architecture.