Réseau de neurones : regarde une droite apprendre à se courber
Un neurone ne trace qu’une droite, il bloque donc sur XOR et le cercle. Ajoute une couche cachée, appuie sur Entraîner et regarde la descente de gradient courber la frontière. Voilà pourquoi l’apprentissage profond a besoin de profondeur.
Tout au début, dans la première édition, un seul perceptron a appris à séparer deux groupes avec une droite. Puis nous avons regardé la descente de gradient dévaler la pente pour régler les poids. Cette semaine, on assemble les deux et on heurte le mur qui a failli tuer l’IA : certaines choses ne se séparent tout simplement pas avec une droite.
Le gadget ci-dessous est un minuscule réseau de neurones. Deux couleurs de points, une règle cachée qui les distingue. Tu choisis les données et le modèle, puis tu appuies sur Entraîner. Le fond coloré est la décision actuelle du réseau, et il se remodèle en direct pendant que la descente de gradient pousse les poids.
Essaie ceci :
- Laisse sur Cercle avec Couche cachée et appuie sur Entraîner. Regarde la frontière s’enrouler en une boucle qui enveloppe les points intérieurs. Un réseau avec couche cachée peut se courber.
- Bascule maintenant le modèle sur Un neurone et entraîne à nouveau. Un neurone est un perceptron : il ne trace qu’une seule droite, il bloque donc autour de 50 à 75 pour cent et ne referme jamais le cercle.
- Passe les données à XOR (les coins opposés partagent une couleur). Un neurone échoue aussi ici, l’exemple des manuels. Reviens à Couche cachée et regarde-le découper le plan en quatre bonnes régions.
Pourquoi c’est important
En 1969, un livre célèbre a montré qu’un seul perceptron ne peut pas apprendre XOR. Cette limite, et la hype qu’elle a crevée, a contribué à faire basculer le domaine dans le premier hiver de l’IA. La solution n’était pas un neurone plus malin, mais la profondeur : en empilant une couche cachée de neurones, le réseau peut combiner de simples coupes droites en frontières courbes et non linéaires. C’est toute l’idée d’un réseau de neurones, et de l’apprentissage profond dès qu’on empile de nombreuses couches. Cette profondeur est devenue entraînable en 1986 avec la rétropropagation.
La courbure que tu viens de voir est le même tour, passé à l’échelle avec du matériel rapide et d’énormes jeux de données, qui a permis à AlexNet de reconnaître des photos des décennies plus tard. Derrière la magie, il y a une droite qui a appris à se courber.
Tu as manqué les éditions précédentes ? Entraîne un perceptron, regarde une chaîne de Markov babiller, perds contre le morpion invincible, apprends à un filtre à voir les contours, regarde un agent apprendre par la récompense, découvre comment un modèle lit le texte en tokens, regarde-en un descendre la pente pour apprendre, ou laisse une machine trouver des groupes seule.