Chapitre 6. Comprendre Wikipédiaavec LDA et Spark NLP
Avec la quantité croissante de données textuelles non structurées ces dernières années, il est devenu difficile d'obtenir les informations pertinentes et souhaitées. Les technologies du langage fournissent des méthodes puissantes qui peuvent être utilisées pour explorer les données textuelles et récupérer les informations que nous recherchons. Dans ce chapitre, nous utiliserons PySpark et la bibliothèque NLP (traitement du langage naturel) de Spark pour utiliser l'une de ces techniques : la modélisation des sujets. Plus précisément, nous utiliserons l'algorithme de Dirichlet latent (LDA) pour comprendre un ensemble de données de documents Wikipédia.
Lamodélisation thématique, l'une des tâches les plus courantes dans le traitement du langage naturel, est une approche statistique de la modélisation des données qui aide à découvrir les thèmes sous-jacents présents dans une collection de documents. L'extraction de la distribution des sujets à partir de millions de documents peut s'avérer utile à bien des égards, par exemple pour identifier les raisons des plaintes concernant un produit particulier ou tous les produits, ou pour identifier les sujets dans les articles d'actualité. L'algorithme le plus populaire pour la modélisation des sujets est LDA. Il s'agit d'un modèle génératif qui suppose que ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access