Costruirò pipeline di dati e ETL con pyspark e databricks

Alcune informazioni sono state tradotte automaticamente.

India

Parlo Inglese

Data Engineer per PySpark, Databricks, SQL e Python

Ciao, sono Abhishek, un Data Engineer a tempo pieno presso GHD che lavora con PySpark, Databricks, SQL, Python e Azure. Aiuto aziende e ingegneri con: - Costruzione e riparazione di pipeline di dati ...
Informazioni su questo servizio

Hai bisogno di una pipeline di dati affidabile, o di un job Spark troppo lento o che continua a fallire? Sono un Data Engineer a tempo pieno che lavora con PySpark, Databricks, SQL e Azure ogni giorno.


COSA POSSO FARE PER TE:

  1. Costruire pipeline ETL/ELT in PySpark e Databricks (CSV, JSON, Parquet, API, database)
  2. Caricare dati in Delta Lake, Databricks, Azure Synapse, PostgreSQL o SQL Server
  3. Caricamenti incrementali, Delta MERGE / upsert, tabelle di storico SCD Tipo 2
  4. Risolvere problemi di job Spark lenti o che falliscono: squilibrio dei dati, shuffle, join, file piccoli, errori out-of-memory
  5. <li Controlli sulla qualità dei dati, deduplicazione e tabelle di report pulite
  6. Pianificazione con Azure Data Factory o Databricks Workflows

COSA ottieni:

  1. Codice pulito, commentato, in stile produzione
  2. Un breve documento che spiega come eseguirlo e mantenerlo
  3. Tempi di esecuzione prima/dopo per ottimizzazione

Contattami prima di ordinare con le tue fonti di dati, volumi e obiettivo, così posso confermare il pacchetto giusto e i tempi. Non servono credenziali di produzione; dati di esempio o un sandbox sono sufficienti per iniziare.

Destination Platform:

Azure Synapse Analytics

Strumenti e piattaforme:

Azure data factory

•

Altro