Chapitre 9. Gratte-papier Web
Cet ouvrage a été traduit à l'aide de l'IA. Tes réactions et tes commentaires sont les bienvenus : translation-feedback@oreilly.com
Ce chapitre couvre les points suivants :
-
Récupérer le contenu d'un site Web HTML
-
Exécuter un navigateur sans tête
-
Collecter des données scrappées et les proposer en tant qu'API
Dans ce chapitre, tu vas construire un grattoir Web pour collecter le contenu de sites Web HTML et le traiter dans ton serveur Node. Le web scraping est le processus d'extraction des données d'un site web et existe depuis presque aussi longtemps que l'Internet lui-même.
Avant que les API ne soient rendues publiques et accessibles aux entreprises, la seule façon d'obtenir les prix actualisés des produits, les titres de l'actualité immédiate et le contenu statique d'un site Web était de visiter manuellement une URL et de regarder directement la page Web qui en résultait ; un peu comme nous utilisons encore la plupart du temps Internet aujourd'hui.
Il y a maintenant plus de façons de traiter et d'utiliser les données que jamais auparavant, mais il n'y a toujours pas assez d'API pour alimenter ces systèmes de traitement. Même lorsqu'il existe des API, les restrictions concernant le type de données auxquelles un utilisateur final a accès peuvent être limitées. Par exemple, un service de livraison de nourriture peut fournir une API pour les meilleurs restaurants d'un quartier, mais ne pas permettre le filtrage par restrictions alimentaires. Pour ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access