Costruirò pipeline di dati in produzione con pyspark, python e sql
Ingegnere di dati e backend
Informazioni su questo servizio
Ho trascorso più di 13 anni a costruire data pipeline presso Goldman Sachs, Walmart Global Tech, Ola e due startup finanziate da venture capital. Le pipeline che ho gestito spostano terabyte al giorno. Ora costruirò la tua.
COSA OTTIENI
- Una pipeline PySpark / Python / SQL funzionante, non un semplice dump di notebook
- Idempotente e ri-eseguibile, quindi sicura da ripetere dopo un fallimento
- Gestisce null, duplicati, dati tardivi e drift dello schema invece di crashare
- Codice commentato e leggibile, più un breve video che ti guida passo passo
CON CHI LAVORO
PySpark, Pandas, Polars, SQL (Postgres, MySQL, Redshift, BigQuery), Airflow, dbt, Kafka, Iceberg, AWS (S3, EMR, Glue, Lambda)
TIPICI LAVORI
- CSV/JSON/Parquet disordinati trasformati in una tabella modellata e pulita
- Un job o query Spark che deve effettivamente finire
- Estrazione programmata da API o database
- Funzioni di finestra, logica di deduplica, caricamenti incrementali, CDC
PRIMA DI ORDINARE
Scrivimi con un esempio di dati e cosa dovrebbe risultare. Ti dirò quale package usare, o se non sono la persona giusta. La definizione del scope è gratuita.
Sono in IST e lavoro in orari che si sovrappongono con US ed EU.
FAQ
Traduzione automatica.
Puoi lavorare con i miei dati se sono riservati?
Sì. Lavorerò con un esempio di schema o dati sintetici che corrispondono alla tua struttura, e non conservo nulla dopo la consegna. Sono disponibile a firmare un NDA prima che tu invii qualsiasi cosa.
Quanto può essere grande il dato?
A mio agio con i terabyte — ho gestito pipeline che elaborano circa 3TB/giorno. Per lavori grandi uso Spark o DuckDB invece di Pandas, così finiscono davvero.
Ho bisogno di Spark o basta SQL?
Scrivimi. La maggior parte delle volte la risposta è "non serve Spark" e ti dirò che anche se la versione Spark sarebbe un ordine più grande.
Posso mantenere questa pipeline dopo la consegna?
È proprio lo scopo. Codice commentato, un README e un video walkthrough. Se il tuo team sa leggere Python, può gestirla.

