k-moyennes : regarde une machine trouver des groupes sans personne pour l’instruire

Disperse quelques points, choisis combien de groupes chercher, et regarde les centroïdes dériver jusqu’à ce que les groupes s’emboîtent. Pas d’étiquettes, pas de professeur : l’apprentissage non supervisé à regarder.

y26w37

La semaine dernière, la machine descendait la pente vers une réponse connue. Cette semaine, personne ne lui donne la réponse. Tu lui remets un tas de points et un seul nombre, k, le nombre de groupes à chercher. Les groupes, elle doit les découvrir seule. C’est l’apprentissage non supervisé : pas d’étiquettes, pas de professeur, juste de la structure que la machine extrait de données brutes.

Le gadget ci-dessous est un terrain de jeu de k-moyennes. Les petits points sont tes données. Les grands losanges sont des centroïdes, l’estimation actuelle du centre de chaque groupe. Tout l’algorithme tient en deux gestes répétés :

  1. Affecter : chaque point prend la couleur de son centroïde le plus proche.
  2. Mettre à jour : chaque centroïde glisse vers la position moyenne des points qui viennent de le choisir.

C’est tout. Refais ces deux gestes encore et encore (on appelle cela l’algorithme de Lloyd) et les centroïdes dérivent jusqu’à ce que plus personne ne veuille changer de groupe.

Essaie ceci :

  1. Appuie plusieurs fois sur Pas. Regarde les deux phases alterner : les points se recolorent, puis les losanges sautent au centre de leur couleur. Appuie sur Lancer pour répéter jusqu’à stabilisation.
  2. Clique dans un espace vide pour ajouter tes propres points, ou appuie sur Nouveaux points pour une dispersion fraîche. Relance ensuite et regarde de nouvelles frontières se former.
  3. Change k. Demande 2 groupes là où il y en a clairement 3, et elle est forcée de fusionner deux nuages. Demande 5 là où il y en a 3, et elle coupe un vrai groupe en deux. k-moyennes trouve exactement autant de groupes que tu en demandes, qu’ils existent vraiment ou non.

Pourquoi c’est important

La plupart des données du monde arrivent sans étiquettes : pages web, images, comportement des clients, expression des gènes. On ne peut pas toujours dire à une machine la bonne réponse, parce que personne ne la connaît. Le clustering, c’est la façon dont un système taille ce tas brut en structure tout seul, et les k-moyennes, publiées dans les années 1950, restent le premier outil vers lequel se tourne la plupart des gens.

C’est le pendant de l’apprentissage supervisé, où le modèle s’entraîne sur des exemples étiquetés. Les deux sont des branches de l’apprentissage automatique, mais l’apprentissage non supervisé se passe de corrigé. Le même instinct, « regrouper ce qui se ressemble », bat sous les immenses jeux de données qui ont entraîné les modèles modernes de vision et de langage : avant qu’un réseau puisse apprendre à étiqueter les photos d’ImageNet derrière AlexNet, il a fallu que quelqu’un ordonne une montagne d’images non étiquetées. Derrière la magie, il y a une boucle simple : colorer les points, déplacer les centres, recommencer.

Tu as manqué les éditions précédentes ? Entraîne un perceptron, regarde une chaîne de Markov babiller, perds contre le morpion invincible, apprends à un filtre à voir les contours, regarde un agent apprendre par la récompense, découvre comment un modèle lit le texte en tokens ou regarde-en un descendre la pente pour apprendre.

Groupes (k)

Clique dans le cadre pour ajouter des points, choisis combien de groupes k chercher, puis appuie sur Pas. Chaque pas recolore d’abord chaque point selon son centroïde le plus proche (les gros repères), puis déplace chaque centroïde au centre de son groupe. Appuie sur Lancer pour répéter jusqu’à stabilisation. Pas d’étiquettes, pas de professeur : c’est l’apprentissage non supervisé.