Máquinas de vectores de soporte: clasificadores de margen máximo con kernels (1995)

En 1995 Corinna Cortes y Vladimir Vapnik publicaron support-vector networks en Machine Learning, combinando separación lineal de margen máximo con el truco del kernel para fronteras no lineales.

Fecha del evento: Publicado:
HistoriaInvestigación

En 1995, Corinna Cortes y Vladimir Vapnik publicaron Support-Vector Networks en Machine Learning (volumen 20, número 3). El artículo presentó las máquinas de vectores de soporte (SVM): clasificadores que encuentran una frontera de margen máximo entre categorías y representan los datos solo mediante los puntos de entrenamiento que yacen en ese margen, los vectores de soporte. El método se apoyó en trabajos anteriores de Bernhard Boser, Isabelle Guyon y Vapnik sobre clasificadores de margen óptimo (1992), que introdujeron el truco del kernel para manejar superficies de decisión no lineales con eficiencia.

Margen, kernels y soluciones dispersas

Los clasificadores lineales pueden fallar cuando las clases no son separables por una recta en el espacio de entrada. Las SVM mapean las entradas a un espacio de características de mayor dimensión mediante una función kernel, de modo que un separador lineal en ese espacio corresponde a una frontera curva en el espacio original. El truco del kernel calcula productos internos en el espacio expandido sin construir el mapeo completo de forma explícita. El modelo resultante depende de un subconjunto de ejemplos de entrenamiento, lo que hizo atractivas a las SVM cuando los datos eran escasos y las redes neuronales estaban fuera de moda durante el segundo invierno de la IA (artículo).

Un rival estadístico de las redes neuronales

A finales de los noventa y en los 2000, las SVM se convirtieron en una herramienta estándar del aprendizaje automático para clasificación de texto, bioinformática y benchmarks de visión, a menudo en competencia con bosques aleatorios (artículo) y, más tarde, con el aprendizaje profundo. Ejemplificaron el cambio de sistemas expertos codificados a mano hacia el aprendizaje supervisado sobre datos etiquetados.

Por qué importa

Las máquinas de vectores de soporte llevaron la teoría del aprendizaje estadístico a la práctica generalizada. El trabajo anterior de Vapnik sobre minimización del riesgo estructural ayudó a justificar por qué maximizar el margen podía generalizar bien. Incluso después de que AlexNet reviviera las redes neuronales, las ideas de las SVM influyeron en cómo los investigadores pensaban sobre márgenes, kernels y clasificación en alta dimensión.