Capitolo 7. Usare DuckDB con JupySQL
Questo lavoro è stato tradotto utilizzando l'AI. Siamo lieti di ricevere il tuo feedback e i tuoi commenti: translation-feedback@oreilly.com
Tradizionalmente, i data scientist utilizzano Jupyter Notebook per prelevare i dati dai server di database o da dataset esterni (come file CSV, JSON, ecc.) e memorizzarli nei DataFrames di pandas (vedi Figura 7-1).
Figura 7-1. Metodo tradizionale di query dei dati come pandas DataFrames e successivo utilizzo per la visualizzazione dei dati
Poi utilizzano i DataFrames per la visualizzazione di . Questo approccio presenta un paio di inconvenienti:
La query su un server di database può degradare le prestazioni del server stesso, che potrebbe non essere ottimizzato per i carichi di lavoro analitici.
Il caricamento dei dati nei DataFrames richiede risorse preziose, tra cui memoria e calcolo. Ad esempio, se l'intenzione è quella di visualizzare alcuni aspetti del dataset, è necessario caricare l'intero dataset in memoria prima di poterlo visualizzare.
Anche le visualizzazioni con Matplotlib utilizzano una quantità significativa di memoria. Dietro le quinte, Matplotlib mantiene in memoria vari oggetti come figure, assi, linee, testo e altri elementi grafici. Ognuno di questi elementi consuma risorse quando viene creato e renderizzato. Inoltre, Matplotlib gestisce gli array di dati utilizzati per i grafici e ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access