February 2022
Intermediate to advanced
360 pages
11h 47m
Polish
W poprzednich rozdziałach wyjaśniliśmy, jak można łatwo i efektywnie używać frameworka Apache Spark do tworzenia skalowanych i wydajnych potoków przetwarzania danych. Jednak w praktyce wyrażenie logiki przetwarzania powoduje rozwiązanie tylko połowy problemu związanego z tworzeniem potoku. Dla inżyniera danych, naukowca lub analityka danych ostatecznym celem tworzenia potoków jest wykonywanie zapytań do przetwarzanych danych i otrzymywanie na ich podstawie pewnych informacji. Wybór rozwiązania w zakresie pamięci masowej decyduje o kompleksowej (np. od niezmodyfikowanych danych do wniosków na ich podstawie) niezawodności i wydajności działania potoku danych.
W tym rozdziale ...
Read now
Unlock full access