Geek de la semaine
Un terrain de jeu hebdomadaire où l'IA se lâche : de petits gadgets interactifs sur le fonctionnement de l'IA.
-
Multi-armed bandit : explorer ou exploiter ?
y26w40
Cinq machines à sous cachent des taux de gain différents. Tire toi-même ou fais glisser Explorer et regarde epsilon-greedy apprendre quel bras paie le mieux. Le dilemme classique de l'apprentissage par renforcement en une rangée de leviers.
-
Attention : regarde les mots décider qui écouter
y26w39
Clique sur un mot et regarde les arcs s’ouvrir vers les autres, plus épais là où il prête plus d’attention, et faisant toujours 100 pour cent. Rapproche les mots pour qu’ils s’attardent l’un sur l’autre. C’est le mécanisme derrière tout LLM moderne.
-
Réseau de neurones : regarde une droite apprendre à se courber
y26w38
Un neurone ne trace qu’une droite, il bloque donc sur XOR et le cercle. Ajoute une couche cachée, appuie sur Entraîner et regarde la descente de gradient courber la frontière. Voilà pourquoi l’apprentissage profond a besoin de profondeur.
-
k-moyennes : regarde une machine trouver des groupes sans personne pour l’instruire
y26w37
Disperse quelques points, choisis combien de groupes chercher, et regarde les centroïdes dériver jusqu’à ce que les groupes s’emboîtent. Pas d’étiquettes, pas de professeur : l’apprentissage non supervisé à regarder.
-
Descente de gradient : regarde un modèle apprendre en descendant la pente
y26w36
Pose une bille sur une courbe de perte et regarde-la descendre pas à pas. Un taux d'apprentissage trop grand et elle s'envole ; un terrain accidenté la piège. C'est ainsi que presque tout réseau de neurones est entraîné.
-
Encodage par paires d'octets : regarde un modèle découper le texte en tokens
y26w35
Tape du texte et glisse des caractères aux mots. C'est l'encodage par paires d'octets, la façon exacte dont les modèles de type GPT transforment ce que tu écris en tokens qu'ils lisent.
-
Q-learning : regarde un agent apprendre par la récompense
y26w34
Lâche un agent dans une grille avec un but et un piège. Il ne sait rien au départ et apprend par essais et erreurs où aller, une récompense à la fois. L'idée derrière AlphaGo et le RLHF.
-
Convolution : la grille 3×3 où commence la vision des machines
y26w33
Dessine une forme et regarde un minuscule filtre 3×3 trouver ses contours, la flouter ou la rendre plus nette. C'est l'opération exacte qui fait tourner les réseaux de neurones convolutifs.
-
Morpion minimax : la machine qui refuse de perdre
y26w32
Joue au morpion contre une machine qui lit tous les futurs possibles et ne perd jamais. Regarde-la noter chaque coup, victoire, nul ou défaite, avant de jouer.
-
Babilleur de Markov : la machine originale à mot suivant
y26w31
Bien avant ChatGPT, les machines devinaient le mot suivant en comptant. Donne à ce petit modèle n'importe quel texte et regarde-le babiller, un coup de dés à la fois.
-
Terrain de jeu du perceptron : apprends à un neurone de 1958 à tracer une ligne
y26w30
Déposez des points de deux couleurs sur un champ et regardez un seul perceptron déplacer une droite jusqu'à les séparer, ou se bloquer magnifiquement.