Capitolo 15. Rimodellare
Questo lavoro è stato tradotto utilizzando l'AI. Siamo lieti di ricevere il tuo feedback e i tuoi commenti: translation-feedback@oreilly.com
Nell'ultimo capitolo ci siamo concentrati sull'aggregazione dei dati per creare riepiloghi informativi, ma cosa fare se i dati non hanno la forma giusta per eseguire queste aggregazioni? Rimodellare i dati è un passo fondamentale nel processo di analisi dei dati.
In questo capitolo imparerai a..:
-
Rimodellare i dati per renderli più adatti all'analisi
-
Modificare le dimensioni dei dati per renderli più adatti all'analisi, migliorare le prestazioni di calcolo o prepararli per la visualizzazione.
-
Utilizza i vari metodi offerti da Polars, come
df.pivot(),df.unpivot(),df.transpose(),df.explode(), edf.partition_by()
Le istruzioni per ottenere i file di cui potresti aver bisogno sono riportate nel Capitolo 2. Partiamo dal presupposto che i file si trovino nella sottodirectory dei dati.
DataFrames ampi o lunghi
I DataFrames ampi hanno molte colonne e poche righe. L'idea è che ogni riga contenga una colonna con un identificatore e che i dati siano distribuiti su molte colonne. Questo formato è spesso utilizzato quando ci sono più misurazioni per ogni osservazione. Un esempio di dati ampi è il seguente:
grades_wide=pl.DataFrame({"student":["Jeroen","Thijs","Ritchie"],"math":[85,78,92],"science":[90,82,85],"history":[88,80,87],})grades_wide
shape: (3, 4) ┌─────────┬──────┬─────────┬─────────┐ ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access