Course Code: pysprkub
Duration: 21 hours

Prerequisites:

Deltagarna bör ha:

  • Praktisk erfarenhet av Python-programmering, inklusive funktioner, moduler och grundläggande objektorienterade koncept.
  • Grundläggande till medelstads erfarenhet av arbete med Pandas och tabellbaserade datahanteringsflöden.
  • Grundläggande kännedom om PySpark och Spark DataFrames, inklusive dataläsning, transformationer, åtgärder, joinar och aggregationer.
  • En generell förståelse av SQL och datahanteringskoncept, inklusive filtrering, gruppering och sammanslagning av datauppsättningar.
  • Grundläggande kännedom om Docker- och Kubernetes-koncept, såsom behållare, bilder och pods. Det krävs inte att deltagarna har erfarenhet av Kubernetes-administration.
  • Grundläggande förståelse av vanliga dataformat, såsom CSV, JSON och Parquet.

Deltagarna behöver inte vara Kubernetes-administratorer eller infrastrukturspecialister. Kursen fokuserar på hur dataingenjörer, utvecklare och datavetare kan förstå och optimera sina Spark-processer på Kubernetes ur ett applikations- och konfigurationsperspektiv.

Målgrupp

Denna kurs är designad för yrkesverksamma som utvecklar, underhåller eller optimerar datahanterings- och maskinlärningsprocesser med hjälp av Python och Spark i moln- eller behållarbaserade miljöer.

Den passar särskilt väl för:

  • Dataingenjörer som arbetar med PySpark, distribuerad datahantering och ETL-pipelines.
  • Datavetare som behandlar stora datauppsättningar eller kör maskinlärningsprocesser med Spark, Pandas eller Polars.
  • Python-utvecklare som arbetar med datatunga appar och vill förbättra minneseffektivitet och bearbetningsprestanda.
  • Maskinlärningsingenjörer som hanterar dataförberedelse- och modellutbildningsprocesser i delade Kubernetes- eller molnmiljöer.
  • Analysingenjörer som arbetar med stora datauppsättningar och vill förbättra datahanteringseffektiviteten.
  • DevOps-, plattform- och molningenjörer som stöder Spark-processer på Kubernetes och behöver förstå hur konfiguration på applikationsnivå påverkar resursanvändning och prestanda.
  • Tekniska ledare och arkitekter som är inblandade i design eller optimering av moderna datahanteringsplattformar.

Overview:

Den här praktiska kursen på tre dagar fokuserar på att bygga och optimera effektiva datahanteringsprocesser med PySpark, Pandas och Polars i Kubernetes-baserade miljöer.

Deltagarna får en praktisk förståelse för hur Spark-applikationer exekveras på Kubernetes och hur beslutsfattande på applikationsnivå påverkar prestanda, skalbarhet, resursanvändning och kostnader. Kursen täcker centrala optimeringsområden, såsom executor-storlek, minnesallokering, dynamisk allokering, partitioneringsstrategier, shuffle-beteende, småfilproblem och effektiv Parquet-hantering.

Kursen tar också upp vanliga utmaningar vid arbete med Pandas, inklusive minnesbegränsningar och minnesbristfel, och presenterar Polars som ett högeffektivt alternativ för specifika datahanteringsprocesser. Genom praktiska övningar kommer deltagarna att diagnostisera prestanda- och minnesproblem, jämföra olika konfigurationsstrategier och tillämpa optimeringstekniker på realistiska ETL- och maskinlärnings_scenarioer.

Tonen i kursen är inriktad på praktiskt beslutsfattande: att förstå hur man identifierar flaskhalsar, väljer rätt verktyg, konfigurerar Spark effektivt och balanserar prestanda med infrastrukturresursanvändning och kostnad.

Course Outline:

Modul 1: Grundläggande Big Data & Spark

  • Översikt över Big Data-ekosystemet och Spark:s roll i moderna dataplattformar
  • Förståelse av Spark-arkitektur: driver, executorer, klusterhanterare, lat evaluering, DAG och exekveringsplanering
  • Skillnader mellan RDD- och DataFrame-API:er och när man ska använda respektive metod
  • Skapa och konfigurera SparkSession samt förstå grundläggande applikationskonfiguration

Modul 2: PySpark DataFrames

  • Läsa och skriva data från källor och format för företag: CSV, JSON, Parquet och Delta
  • Arbeta med PySpark DataFrames: transformationer, åtgärder, kolumnextrack, filtrering, joinar och aggregationer
  • Implementera avancerade operationer som funksionsfönster, hantera tidsstämplar och arbeta med nästlad data
  • Tillämpa datakvalitetskontroller och skriva återanvändbar, underhållbar PySpark-kod

Modul 3: Kubernetes & Docker-grunder för Spark-användare

  • Förstå hur Docker-bilder och Kubernetes-pods relaterar till Spark driver- och executor-processer – ett konceptuellt perspektiv för klusteranvändare, inte administratorer
  • Förstå vad som händer när ett Spark-jobb körs på Kubernetes: pod-schemaläggning, resursbegär och gränser, och hur sessioninställningar kartläggs på dem
  • Förstå vad du styr via Spark session-parametrar jämfört med vad plattformsteamet styr via klusterprovisionering – och varför denna gräns är viktig för städningsarbete
  • Praktisk övning: Inspektera ett körande Spark-on-Kubernetes-jobb i sandbox-klustret och identifiera driver- och executor-pods

Modul 4: Spark Session-konfiguration på Kubernetes – Djupdykning

  • Förstå antalet executorer jämfört med executor-storlek: avvägningar mellan minne och kärnor och hur man resonemang kring dem
  • Minnesallokering för driver och executorer, minnesreserver, och hur detta översätts till pod-resurser
  • Dynamisk allokering: hur den beter sig på Kubernetes, när den sparar resurser och när den inte gör det
  • Praktisk övning: Kör samma jobb med olika executor- och kärnkongfigurationer och jämför körningstid och resursanvändning

Modul 5: Skalningsbeteende & Kostnadsoptimering

  • Förstå hur tillägg eller borttag av noder påverkar jobbets beteende, sluttid och resursanvändning
  • Jämföra många små executorer mot färre stora: avvägningar mellan prestanda och kostnad
  • Shuffle-beteende och stäning av shuffle-partitioner, inklusive uppskattning av kostnadsverkan av konfigurationsval
  • Praktisk övning: Skala upp sandbox-klustret från fem till tio noder och observera effekten på jobbets sluttid och resursanvändning

Modul 6: Effektiv datainkontering & partitionering

  • Förstå småfilproblemet: varför källor uppdelade i många små Parquet-filer (1–5 MB) försämrar prestanda och förvränger partitionering
  • Strategier för ompartitionering och sammanfogning
  • Kontrollera storlek på partitioner vid läsning och skrivning
  • Skriva Parquet effektivt för att undvika att skapa småfilproblem nedströms
  • Praktisk övning: Ladda en dataset bestående av många små Parquet-partitioner, tillämpa olika ompartitioneringsstrategier och jämför prestanda före och efter optimering

Modul 7: Minneshantering & felbehandling i Pandas

  • Förstå grundorsakerna till minnesbristfel i Pandas och känna igen symtomen
  • Tillämpa minneseffektiva omvandlingsmönster mellan Spark och Pandas
  • Undvika minnesbrist vid skrivning av stora datasets till CSV
  • Använda styckvis bearbetning och dtype-optimering för begränsade miljöer
  • Praktisk övning: Återuppta ett typiskt Pandas minnesbristscenario och lösa det med styckvis bearbetning och dtype-optimering

Modul 8: Polars som ett kompletterande verktyg

  • Positionera Polars i förhållande till Pandas: prestandakarakteristika, lat evaluering och minnesbeteende
  • Förstå var Polars passar in bredvid PySpark och Pandas i moderna molndatastacks och migrationsvägar, inklusive AWS-miljöer
  • Praktisk övning: Skriv om en Pandas-tung transformation i Polars och jämför minnesanvändning och bearbetningshastighet

Modul 9: Tillämpa optimering på ETL & ML-processer

  • Tillämpa principer för konfiguration, partitionering och minneshantering i en realistisk ETL-pipeline
  • Förstå optimeringsöverväganden specifika för maskinlärningsprocesser som körs i samma kluster
  • Tillämpa en praktisk justeringsarbetsflöde för att systematiskt diagnostisera kostnads- och prestandaproblem
  • Praktisk övning: Slutför ett end-to-end mini-projekt som kombinerar datainläsning, transformation och ett enkelt modellutbildningssteg, där deltagarna själva justerar Spark-konfigurationen

Sites Published:

United Arab Emirates - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Qatar - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Egypt - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Saudi Arabia - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

South Africa - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Brasil - Processamento Eficiente de Dados no Kubernetes com PySpark, Pandas e Polars

Canada - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

中国 - 基于Kubernetes使用PySpark、Pandas和Polars实现高效数据处理

香港 - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

澳門 - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

台灣 - 使用PySpark、Pandas和Polars在Kubernetes上進行高效資料處理

USA - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Österreich - Effiziente Datenverarbeitung mit PySpark, Pandas und Polars auf Kubernetes

Schweiz - Effiziente Datenverarbeitung mit PySpark, Pandas und Polars auf Kubernetes

Deutschland - Effiziente Datenverarbeitung mit PySpark, Pandas und Polars auf Kubernetes

Czech Republic - Efektivní zpracování dat v Kubernetes pomocí PySpark, Pandas a Polars

Denmark - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Estonia - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Finland - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Greece - Αποτελεσματική Επεξεργασία Δεδομένων σε Kubernetes με PySpark, Pandas & Polars

Magyarország - Hatékony adatfeldolgozás Kubernetesben PySpark, Pandas és Polars segítségével

Ireland - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Luxembourg - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Latvia - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

España - Procesamiento de datos eficiente en Kubernetes con PySpark, Pandas y Polars

Italia - Elaborazione dati efficiente su Kubernetes con PySpark, Pandas e Polars

Lithuania - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Nederland - Efficiënte verwerking van data op Kubernetes met PySpark, Pandas & Polars

Norway - Effektiv databehandling på Kubernetes med PySpark, Pandas og Polars

Portugal - Processamento Eficiente de Dados no Kubernetes com PySpark, Pandas e Polars

România - Procesare eficientă a datelor pe Kubernetes cu PySpark, Pandas & Polars

Sverige - Effektiv datahantering med PySpark, Pandas och Polars på Kubernetes

Türkiye - Kubernetes Ortamında PySpark, Pandas ve Polars ile Verimli Veri İşleme

Malta - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Belgique - Traitement efficace des données sur Kubernetes avec PySpark, Pandas et Polars

France - Traitement efficace des données sur Kubernetes avec PySpark, Pandas et Polars

日本 - KubernetesにおけるPySpark、Pandas、Polarsによる効率的なデータ処理

Australia - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Malaysia - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

New Zealand - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Philippines - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Singapore - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Thailand - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Vietnam - Xử lý dữ liệu hiệu quả trên Kubernetes bằng PySpark, Pandas & Polars

India - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Argentina - Procesamiento de datos eficiente en Kubernetes con PySpark, Pandas y Polars

Chile - Procesamiento de datos eficiente en Kubernetes con PySpark, Pandas y Polars

Costa Rica - Procesamiento de datos eficiente en Kubernetes con PySpark, Pandas y Polars

Ecuador - Procesamiento de datos eficiente en Kubernetes con PySpark, Pandas y Polars

Guatemala - Procesamiento de datos eficiente en Kubernetes con PySpark, Pandas y Polars

Colombia - Procesamiento de datos eficiente en Kubernetes con PySpark, Pandas y Polars

México - Procesamiento de datos eficiente en Kubernetes con PySpark, Pandas y Polars

Panama - Procesamiento de datos eficiente en Kubernetes con PySpark, Pandas y Polars

Peru - Procesamiento de datos eficiente en Kubernetes con PySpark, Pandas y Polars

Uruguay - Procesamiento de datos eficiente en Kubernetes con PySpark, Pandas y Polars

Venezuela - Procesamiento de datos eficiente en Kubernetes con PySpark, Pandas y Polars

Polska - Skuteczne przetwarzanie danych w Kubernetesie z wykorzystaniem PySpark, Pandas i Polars

United Kingdom - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

South Korea - PySpark, Pandas 및 Polars를 활용한 Kubernetes에서 효율적인 데이터 처리

Pakistan - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Sri Lanka - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Bulgaria - Ефективна обработка на данни в Kubernetes с PySpark, Pandas и Polars

Bolivia - Procesamiento de datos eficiente en Kubernetes con PySpark, Pandas y Polars

Indonesia - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Kazakhstan - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Moldova - Procesare eficientă a datelor pe Kubernetes cu PySpark, Pandas & Polars

Morocco - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Tunisia - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Kuwait - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Oman - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Slovakia - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Kenya - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Nigeria - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Botswana - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Slovenia - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Croatia - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Serbia - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Bhutan - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Nepal - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

Uzbekistan - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars

US Government - Efficient Data Processing on Kubernetes with PySpark, Pandas & Polars