Teil III. Daten bereinigen und erforschen mit Pandas
In diesem Teil des Buches, in der zweiten Phase unserer Toolchain (siehe Abbildung III-1), nehmen wir den Nobelpreis-Datensatz, den wir in Kapitel 6 mit Scrapy gescraped haben, und bereinigen ihn zunächst, um ihn dann auf interessante Nuggets zu untersuchen. Die wichtigsten Werkzeuge, die wir dabei verwenden, sind die großen Python-Bibliotheken Matplotlib und pandas.
Hinweis
Die zweite Auflage dieses Buches verwendet denselben Nobel-Datensatz, der in der ersten Auflage verwendet wurde. Wir waren der Meinung, dass die verfügbare Zeit besser genutzt werden kann, um neues Material zu schreiben und alle Bibliotheken zu aktualisieren, als die Erkundung und Analyse zu ändern. Bei Dataviz wird in der Regel mit älteren Datensätzen gearbeitet, und die wenigen zusätzlichen Nobelpreisträger ändern den Inhalt des Materials überhaupt nicht.
pandas wird in den nächsten Kapiteln zusammen mit seinem Baustein NumPy vorgestellt. In Kapitel 9 werden wir Pandas verwenden, um den Nobel-Datensatz zu bereinigen. In Kapitel 11 werden wir Pandas in Verbindung mit der Python-Bibliothek Matplotlib verwenden, um den Datensatz zu untersuchen.
In Teil IV sehen wir uns an, wie wir den frisch bereinigten Nobelpreis-Datensatz mithilfe des Python-Webservers Flask an den Browser übermitteln.
Abbildung III-1. Unsere Dataviz-Toolchain: Bereinigung und Erkundung ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access