Costruirò pipeline di dati in produzione con pyspark, python e sql

Alcune informazioni sono state tradotte automaticamente.

India

Parlo Inglese, Hindi

Ingegnere di dati e backend

Oltre 13 anni a costruire piattaforme di dati e sistemi backend — Goldman Sachs, Walmart Global Tech, Ola e due startup finanziate dove ho guidato team di 6-12 ingegneri. Quello che faccio realmente:...
Informazioni su questo servizio

Ho trascorso più di 13 anni a costruire data pipeline presso Goldman Sachs, Walmart Global Tech, Ola e due startup finanziate da venture capital. Le pipeline che ho gestito spostano terabyte al giorno. Ora costruirò la tua.


COSA OTTIENI

- Una pipeline PySpark / Python / SQL funzionante, non un semplice dump di notebook

- Idempotente e ri-eseguibile, quindi sicura da ripetere dopo un fallimento

- Gestisce null, duplicati, dati tardivi e drift dello schema invece di crashare

- Codice commentato e leggibile, più un breve video che ti guida passo passo


CON CHI LAVORO

PySpark, Pandas, Polars, SQL (Postgres, MySQL, Redshift, BigQuery), Airflow, dbt, Kafka, Iceberg, AWS (S3, EMR, Glue, Lambda)


TIPICI LAVORI

- CSV/JSON/Parquet disordinati trasformati in una tabella modellata e pulita

- Un job o query Spark che deve effettivamente finire

- Estrazione programmata da API o database

- Funzioni di finestra, logica di deduplica, caricamenti incrementali, CDC


PRIMA DI ORDINARE

Scrivimi con un esempio di dati e cosa dovrebbe risultare. Ti dirò quale package usare, o se non sono la persona giusta. La definizione del scope è gratuita.


Sono in IST e lavoro in orari che si sovrappongono con US ed EU.

Destination Platform:

Google BigQuery

Amazon Redshift

ClickHouse

Strumenti e piattaforme:

Hevo Data

Kafka Connect

Debezium