k-medias: mira cómo una máquina encuentra grupos sin que nadie le enseñe

Dispersa unos puntos, elige cuántos grupos buscar y mira cómo los centroides se desplazan hasta que los grupos encajan. Sin etiquetas, sin maestro: aprendizaje no supervisado para ver.

y26w37

La semana pasada la máquina bajó rodando hacia una respuesta conocida. Esta semana nadie le dice la respuesta. Le das un montón de puntos y un solo número, k, la cantidad de grupos que buscar. Los grupos los tiene que descubrir sola. Esto es aprendizaje no supervisado: sin etiquetas, sin maestro, solo estructura que la máquina extrae de datos crudos.

El gadget de abajo es una zona de juego de k-medias. Los puntos pequeños son tus datos. Los rombos grandes son centroides, la conjetura actual del centro de cada grupo. Todo el algoritmo son dos movimientos repetidos:

  1. Asignar: cada punto toma el color de su centroide más cercano.
  2. Actualizar: cada centroide se desliza a la posición promedio de los puntos que acaban de elegirlo.

Eso es todo. Haz esos dos movimientos una y otra vez (esto se llama algoritmo de Lloyd) y los centroides se desplazan hasta que ya nadie quiere cambiar de grupo.

Prueba esto:

  1. Pulsa Paso varias veces. Mira alternarse las dos fases: los puntos se recolorean y luego los rombos saltan al centro de su color. Pulsa Iniciar para repetir hasta que se estabilice.
  2. Haz clic en un espacio vacío para añadir tus propios puntos, o pulsa Puntos nuevos para una dispersión fresca. Luego ejecútalo otra vez y mira formarse nuevas fronteras.
  3. Cambia k. Pide 2 grupos donde claramente hay 3 y se ve obligada a fusionar dos nubes. Pide 5 donde hay 3 y parte un grupo real por la mitad. k-medias encuentra exactamente tantos grupos como le pidas, existan de verdad o no.

Por qué importa

La mayoría de los datos del mundo llegan sin etiquetas: páginas web, imágenes, comportamiento de clientes, expresión génica. No siempre puedes decirle a una máquina la respuesta correcta, porque nadie la conoce. El clustering es cómo un sistema talla ese montón crudo en estructura por sí mismo, y k-medias, publicado en los años 1950, sigue siendo la primera herramienta a la que casi todos recurren.

Es la contraparte del aprendizaje supervisado, donde el modelo se entrena con ejemplos etiquetados. Ambos son ramas del aprendizaje automático, pero el aprendizaje no supervisado funciona sin clave de respuestas. El mismo instinto, “agrupar cosas parecidas”, late bajo los enormes conjuntos de datos que entrenaron los modelos modernos de visión y lenguaje: antes de que una red pudiera aprender a etiquetar las fotos de ImageNet que impulsaron AlexNet, alguien tuvo que ordenar una montaña de imágenes sin etiquetar. Detrás de la magia hay un bucle simple: colorea los puntos, mueve los centros, repite.

¿Te perdiste las ediciones anteriores? Entrena un perceptrón, mira balbucear a una cadena de Markov, pierde contra el tres en raya invencible, enseña a un filtro a ver bordes, mira a un agente aprender de la recompensa, descubre cómo un modelo lee el texto en tokens o mira uno bajar rodando para aprender.

Grupos (k)

Haz clic en el recuadro para añadir puntos, elige cuántos grupos k buscar y pulsa Paso. Cada paso primero recolorea cada punto con su centroide más cercano (los marcadores grandes) y luego mueve cada centroide al centro de su grupo. Pulsa Iniciar para repetir hasta que se estabilice. Sin etiquetas, sin maestro: esto es aprendizaje no supervisado.