Apprendre Spark van Jules Damji, Brooke Wenig et Tathagata Das est un manuel d’étude imprimé en anglais destiné aux ingénieurs en données et aux scientifiques. Il traite de la manière de traiter efficacement des charges de travail de données avec Apache Spark, y compris le machine learning et des outils open source.
Cette édition met en avant de nouvelles fonctionnalités dans Spark 2.4 et propose des informations concrètes sur l’utilisation de Python, SQL, Scala et Java via les DataFrames et les Datasets. Vous apprendrez notamment :
- Le fonctionnement du moteur Spark SQL et les optimisations
- Ajuster et déboguer les performances de Spark avec des configurations et l’interface utilisateur
- Se connecter à divers formats de données et sources tels que JSON, Parquet, Hive et Kafka
- L’analyse batch et streaming avec Structured Streaming
- Construire des pipelines de données avec Delta Lake
- Des pipelines de machine learning avec MLlib et l’utilisation de MLflow
- La transformation des données et l’ingénierie des features avec le framework open source Pandas Koalas
Ce livre s’inscrit dans des sujets tels que les bases de données, la gestion des données, les algorithmes, les structures de données et la data science.

