Chaîne de Markov (Markov chain)
Un processus aléatoire où l'état suivant dépend seulement de l'état actuel ; en ML, base de l'échantillonnage MCMC, des modèles n-grammes précoces et de générateurs itératifs lents que les GAN évitent.
Une chaîne de Markov est un processus aléatoire avec la propriété de Markov : l’état suivant dépend seulement de l’état présent, pas de tout l’historique. Andrei Markov a décrit de telles chaînes dès 1906 ; son étude de 2013 des suites de voyelles et consonnes dans Eugène Onéguine de Pouchkine en est un exemple classique.
En apprentissage automatique, les chaînes de Markov sous-tendent la procédure MCMC et des modèles génératifs comme les machines de Boltzmann et les deep belief networks, qui exigent souvent de nombreux pas d’échantillonnage et restent lents à la génération. Ce coût est l’une des raisons pour lesquelles l’article GAN de 2014 insiste sur un entraînement sans chaînes de Markov. La même idée anime de simples modèles de langage n-grammes (modèles de langage) et la génération de texte mot à mot, comme dans les expériences de Claude Shannon en 1948. Yoshua Bengio et ses collègues ont montré plus tard que les réseaux de neurones pouvaient apprendre des plongements lexicaux en prédisant le mot suivant (article). Voir l’article sur les GAN pour l’approche antagoniste qui évite les chaînes de Markov.