Machines à vecteurs de support : classifieurs à marge maximale avec noyaux (1995)
En 1995 Corinna Cortes et Vladimir Vapnik ont publié les réseaux à vecteurs de support dans Machine Learning, combinant une séparation linéaire à marge maximale avec l'astuce du noyau pour des frontières non linéaires.
En 1995, Corinna Cortes et Vladimir Vapnik ont publié Support-Vector Networks dans Machine Learning (volume 20, numéro 3). L’article présentait les machines à vecteurs de support (SVM) : des classifieurs qui trouvent une frontière à marge maximale entre catégories et représentent les données uniquement par les points d’entraînement qui se trouvent sur cette marge, les vecteurs de support. La méthode s’appuyait sur les travaux antérieurs de Bernhard Boser, Isabelle Guyon et Vapnik sur les classifieurs à marge optimale (1992), qui avaient introduit l’astuce du noyau pour traiter efficacement des surfaces de décision non linéaires.
Marge, noyaux et solutions parcimonieuses
Les classifieurs linéaires échouent quand les classes ne sont pas séparables par une droite dans l’espace d’entrée. Les SVM projettent les entrées dans un espace de caractéristiques de plus grande dimension via une fonction noyau, de sorte qu’un séparateur linéaire dans cet espace correspond à une frontière courbe dans l’espace d’origine. L’astuce du noyau calcule les produits scalaires dans l’espace étendu sans construire explicitement toute la projection. Le modèle obtenu dépend d’un sous-ensemble d’exemples d’entraînement, ce qui rendait les SVM attractives quand les données étaient rares et que les réseaux de neurones étaient démodés pendant le second hiver de l’IA (article).
Un rival statistique des réseaux de neurones
À la fin des années 1990 et dans les années 2000, les SVM sont devenues un outil standard de l’apprentissage automatique pour la classification de texte, la bioinformatique et les benchmarks de vision, souvent en concurrence avec les forêts aléatoires (article) et plus tard avec l’apprentissage profond. Elles incarnaient le passage des systèmes experts codés à la main vers l’apprentissage supervisé sur des données étiquetées.
Pourquoi c’est important
Les machines à vecteurs de support ont fait entrer la théorie rigoureuse de l’apprentissage statistique dans la pratique courante. Les travaux antérieurs de Vapnik sur la minimisation du risque structurel ont aidé à justifier pourquoi maximiser la marge pouvait bien généraliser. Même après qu’AlexNet ait relancé les réseaux de neurones, les idées des SVM ont influencé la façon dont les chercheurs pensaient aux marges, aux noyaux et à la classification en haute dimension.