Capítulo 4. Dask DataFrame
Este trabajo se ha traducido utilizando IA. Agradecemos tus opiniones y comentarios: translation-feedback@oreilly.com
Los Pandas DataFrames, aunque populares, se encuentran rápidamente con limitaciones de memoria a medida que crece el tamaño de los datos, ya que almacenan la totalidad de los datos en memoria. Los Pandas DataFrames tienen una sólida API para todo tipo de manipulación de datos y suelen ser el punto de partida de muchos proyectos de análisis y aprendizaje automático. Aunque pandas en sí no tiene incorporado el aprendizaje automático, los científicos de datos suelen utilizarlo como parte de la preparación de datos y características durante la fase exploratoria de nuevos proyectos. Por ello, escalar los DataFrames de pandas para que puedan manejar grandes conjuntos de datos es de vital importancia para muchos científicos de datos. La mayoría de los científicos de datos ya están familiarizados con las bibliotecas pandas, y el DataFrame de Dask implementa gran parte de la API pandas añadiendo la capacidad de escalado.
Dask es uno de los primeros en implementar un subconjunto utilizable de las APIs de pandas, pero otros proyectos como Spark han añadido sus enfoques. Este capítulo asume que tienes un buen conocimiento de las APIs pandas DataFrame; si no es así, deberías consultar Python para el Análisis de Datos.
A menudo puedes utilizar Dask DataFrames como sustituto de pandas DataFrames con pequeños cambios, gracias a duck-typing. Sin embargo, ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access