Du Perceptron au Transformer : la folle épopée des réseaux de neurones
En 1958, un chercheur du nom de Frank Rosenblatt imaginait une machine capable « d’apprendre » par l’expérience. Il appelait cela le Perceptron. Soixante ans plus tard, le même principe — empiler des couches de calculs mathématiques et laisser un algorithme ajuster leurs paramètres — alimente les assistants vocaux, les voitures autonomes et les modèles de langage qui rédigent des articles. L’histoire des réseaux de neurones artificiels ressemble à une série à rebondissements : des promesses folles, des désillusions cuisantes, puis un triomphe qui a rebattu les cartes de l’informatique tout entière. Ce récit, c’est celui d’une idée qui a mis près d’un demi-siècle à trouver son terrain de jeu.
Le Perceptron, l’étincelle de 1958
Tout commence au Cornell Aeronautical Laboratory. Le Perceptron est un modèle d’une simplicité trompeuse : il prend des entrées (par exemple les pixels d’une image), les pondère, additionne le tout et décide d’une sortie à l’aide d’un seuil. Rosenblatt s’inspirait des premiers travaux de Warren McCulloch et Walter Pitts, qui avaient formalisé le neurone comme un circuit binaire. Le Perceptron pouvait, en théorie, classer des formes après entraînement. La presse s’emballe : on y voit déjà une machine pensante, capable d’imiter le cerveau humain.
Mais en 1969, le mathématicien Marvin Minsky et Seymour Papert publient Perceptrons, une démonstration au vitriol : un perceptron seul ne peut pas résoudre des problèmes aussi simples que le XOR, le « ou exclusif ». Le coup est rude. Les financements se tarissent, et l’intelligence artificielle entre dans ce que l’on nommera les « hivers » — de longues périodes de pessimisme où presque plus personne ne croit au neurone artificiel. Pendant deux décennies, l’idée reste reléguée aux marges de la recherche.
La rétropropagation redonne vie au neurone
Le salut vient d’une idée ancienne remise au goût du jour : la rétropropagation (backpropagation). Développée puis popularisée dans les années 1980, cette méthode permet enfin d’entraîner des réseaux à plusieurs couches. Le principe est élégant : on compare la sortie du réseau à la réponse attendue, on calcule l’erreur, puis on propage cette erreur vers l’arrière pour ajuster chaque poids, couche après couche. Soudain, le réseau peut apprendre des fonctions complexes que le perceptron unique était incapable de capturer.
Geoffrey Hinton, souvent surnommé le « parrain du deep learning », ne cessera de défendre l’approche neuronale pendant les années creuses. Le terme même d’apprentissage profond désigne ces architectures empilant de nombreuses couches cachées. La puissance de calcul reste toutefois le goulot d’étranglement : les ordinateurs de l’époque peinent à entraîner de grands modèles, et les jeux de données sont encore trop restreints pour révéler tout le potentiel de ces méthodes.
Les réseaux convolutifs apprennent à voir
Dans les années 1990, Yann LeCun applique une architecture nouvelle aux images : le réseau de neurones convolutif. Inspirée du cortex visuel, la convolution fait glisser de petits filtres sur l’image pour détecter contours, textures et formes, avant de les combiner dans les couches supérieures. LeCun l’utilise pour lire les chèques bancaires — un succès industriel discret mais réel, qui prouve que les neurones peuvent être utiles hors du laboratoire.
Le vrai séisme arrive en 2012. Lors du défi ImageNet, le réseau AlexNet écrase la concurrence, divisant par deux le taux d’erreur de reconnaissance d’images. Deux ingrédients font la différence : des GPU puissants pour l’entraînement et une masse de données colossale. La communauté comprend alors que la recette magique est simple — données massives, calcul abondant et réseaux profonds — et l’ère du deep learning s’ouvre vraiment, portée par des victoires éclatantes dans la vision par ordinateur.
Mémoire et séquences avec le LSTM
Traiter des séquences — du texte, de l’audio, du signal temporel — pose un autre défi. Les réseaux récurrents relient chaque étape à la précédente, mais souffrent du problème du gradient qui disparaît : ils « oublient » vite les informations lointaines. La mémoire longue à court terme (LSTM), inventée par Sepp Hochreiter et Jürgen Schmidhuber en 1997, résout partiellement cela grâce à des portes qui décident quoi mémoriser ou oublier à chaque instant.
Le LSTM alimentera la traduction automatique, la reconnaissance vocale et tant d’applications pendant une bonne décennie. Mais il reste lent à entraîner et peine avec les très longues dépendances, car il traite les mots un par un, dans l’ordre. Le monde attendait une architecture plus élégante et parallélisable — elle allait surgir d’un article de 2017, signé par des chercheurs bien décidés à tout changer.
Le Transformer et la révolution de l’attention
En juin 2017, huit chercheurs de Google publient Attention Is All You Need. Ils y présentent le Transformer, un modèle qui abandonne la récurrence au profit d’un mécanisme d’attention : chaque mot « regarde » tous les autres pour comprendre le contexte, au lieu d’avancer pas à pas. Fini le traitement séquentiel ; le Transformer traite une phrase en parallèle, ce qui le rend explosif sur les GPU modernes et lui permet de s’entraîner sur des corpus gigantesques.
Le succès est foudroyant. Le Transformer devient le socle des grands modèles de langage : BERT, GPT, et plus tard les assistants conversationnels. Des bibliothèques comme PyTorch et des plateformes comme Hugging Face démocratisent l’accès à ces architectures, permettant à des milliers de développeurs de les réutiliser, de les fine-tuner et de les déployer sans repartir de zéro. L’open-source transforme une avancée de laboratoire en infrastructure mondiale.
Conclusion : une idée qui a mis soixante ans à mûrir
D’un perceptron capable à peine de distinguer deux formes à des modèles qui conversent, traduisent et écrivent du code, le voyage a duré soixante ans, ponctué d’hivers et de résurrections spectaculaires. Ce qui a vraiment changé n’est pas tant l’idée — un neurone mathématique date des années 1950 — que l’écosystème qui l’entoure : données abondantes, puissance de calcul accessible et outils ouverts à tous. La prochaine page de cette histoire s’écrit déjà, et elle ne tiendra plus seulement dans les laboratoires fermés, mais dans les dépôts publics et les communautés qui construisent, jour après jour, l’intelligence artificielle de demain.

