Lernen mit Spark Von Jules Damji, Brooke Wenig und Tathagata Das ist ein englischsprachiges gedrucktes Studienbuch, das sich an Data Engineers und Wissenschaftler richtet. Es behandelt, wie man effiziente Data Workloads mit Apache Spark verarbeitet, einschließlich Machine Learning und Open-Source-Tools.
Diese Ausgabe betont neue Funktionen in Spark 2.4 und bietet konkrete Einblicke in die Nutzung von Python, SQL, Scala und Java über DataFrames und Datasets. Sie lernen unter anderem:
- Wie die Spark-SQL-Engine funktioniert und Optimierungen
- Wie Sie Spark-Leistung aufeinander abstimmen und debuggen – mit Konfigurationen und UI
- Die Verbindung mit verschiedenen Datenformaten und Quellen wie JSON, Parquet, Hive und Kafka
- Batch- und Streaming-Analytics mit Structured Streaming
- Das Erstellen von Data Pipelines mit Delta Lake
- Machine-Learning-Pipelines mit MLlib und Einsatz mit MLflow
- Datenumwandlung und Feature Engineering mit dem Open-Source-Framework Pandas Koalas
Dieses Buch knüpft an Themen wie Datenbanken, Data Management, Algorithmen, Datenstrukturen und Data Science an.

