Costruirò e ottimizzerò pipeline di dati Apache Spark su larga scala

Alcune informazioni sono state tradotte automaticamente.

India

Parlo Telugu, Inglese, Hindi

Ingegnere dati senior

Senior Data Engineer con oltre 8 anni di esperienza nella creazione e ottimizzazione di pipeline di dati distribuite su larga scala. Esperto in Apache Spark, Scala, PySpark, Hive, Hadoop, SQL e AWS, ...
Informazioni su questo servizio

Esperto in ottimizzazione Apache Spark e architettura di pipeline di dati

Le tue job Spark falliscono con errori Out-of-Memory (OOM), si interrompono durante le broadcast o costano troppo in cloud?

Sono un Senior Data Engineer con oltre 8 anni di esperienza nel settore, specializzato nella creazione, risoluzione di problemi e ottimizzazione di pipeline di dati distribuite su larga scala. Mi occupo di elaborare workload multi-terabyte e risolvere colli di bottiglia complessi di Big Data usando Apache Spark, Scala, PySpark, Hadoop e Hive.

Cosa posso fare per te:

  • Ottimizzazione delle prestazioni Spark: Risolvi problemi di data skew, ottimizza join costosi e regola l'allocazione della memoria per fermare i fallimenti dei job e ridurre drasticamente i tempi di esecuzione.
  • Sviluppo di pipeline ETL: Progetta e costruisci pipeline di ingestione dati robuste, scalabili e fault-tolerant partendo da zero, seguendo le migliori pratiche di partizionamento e storage.
  • Debug in produzione: Analizza lineage, shuffle e utilizzo delle risorse del cluster per risolvere problemi di performance silenziosi nel codice esistente.
  • Piattaforma tecnologica principale: Apache Spark, Scala, Python/PySpark, Hadoop, Hive, SQL e piattaforme cloud (AWS).

Che tu abbia bisogno di una diagnosi rapida per una query che fallisce o di un'architettura di dati enterprise completa, sono qui per aiutarti.