... obtendo a página com curl, canalizando-a através de uma sequência inteligente de comandos para isolar os URLs das imagens, um por linha, e depois aplicar uma das técnicas que acabei de te mostrar:
curl URL | ...clever pipeline here... | xargs -n1 wget
Processamento de HTML com HTML-XML-utils
Se souberes um pouco de HTML e CSS, podes analisar a fonte HTML de páginas Web a partir da linha de comandos. Por vezes é mais eficiente do que copiar e colar à mão partes de uma página web a partir de uma janela do browser. Um conjunto útil de ferramentas para este fim é o HTML-XML-utils, que está disponível em muitas distribuições Linux e noWorld Wide Web Consortium. Uma receita geral é:
-
Utiliza
curl(ouwget) para capturar a fonte HTML. -
Utiliza
hxnormalizepara ajudar a garantir que o HTML está bem formado. -
Identifica os selectores CSS para os valores que pretendes capturar.
-
Usa
hxselectpara isolar os valores e canaliza a saída para outros comandos para processamento.
Vamos estender o exemplo de "Construindo uma base de dados de códigos de área" para obter dados de códigos de áreada Web e produzir o arquivo areacodes.txt usado nesse exemplo. Para tua conveniência, criei uma tabela HTML de códigos de área para que possas descarregar e processar, mostrada na Figura 10-1.
Figura 10-1. Uma tabela de códigos de área em https://efficientlinux.com/areacodes.html
Primeiro, pega na fonte ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access