Costruirò pipeline ETL su AWS con airflow, spark e python
Ingegnere dati senior
Informazioni su questo servizio
Senior Data Engineer con oltre 10 anni di esperienza nella creazione di ETL di produzione per clienti Fortune 500 (Expedia, Ford, HP).
Costruisco pipeline di dati affidabili e pronte per la produzione su AWS usando Python, PySpark, Airflow e Spark, non script usa e getta. Ingegneria reale: partizionamento, broadcast joins, orchestrazione e testing.
Risultati ottenuti:
Ridotto un job HiveQL di 64 ore a meno di 3 ore (95,6% più veloce)
Migration di 500 TB da Hadoop ad AWS, completamente validata
Ho creato e gestito la mia piattaforma SaaS multi-tenant end-to-end
Ciò che ottieni: pipeline di codice pulito, documentato e deployabile che il tuo team può mantenere, non una scatola nera.
Basato in Messico (con sovrapposizione di fuso orario con gli Stati Uniti), collaborazione in tempo reale durante le tue ore lavorative. Inglese fluente.
Non sei sicuro di quale pacchetto fa per te? Scrivimi prima e lo valuterò insieme a te.
Strumenti e piattaforme:
AWS Glue DataBrew
•
Altro
Il mio portfolio
FAQ
Traduzione automatica.
Q: Lavori con sorgenti di dati fuori da AWS?
A: Sì — Ingestisco da database (PostgreSQL, MySQL), API, file e sorgenti streaming come Kafka, caricando i dati su S3, Redshift o il tuo data warehouse preferito.
Q: Otterrò il codice sorgente e la documentazione?
A: Sempre. Ricevi codice pulito, sotto controllo di versione, più documentazione, così il tuo team può gestire e mantenere tutto in modo indipendente.
Q: Non sono sicuro di quale pacchetto mi serve. Puoi aiutarmi?
A: Certamente. Scrivimi con le tue sorgenti, destinazione e volume, e ti consiglierò il pacchetto giusto o creerò un'offerta personalizzata.
Q: Puoi riparare o ottimizzare una pipeline esistente invece di crearne una nuova?
A: Sì. Audito pipeline rotte o lente e le ottimizzo — il mio lavoro con HiveQL ha ridotto un job da 64 ore a meno di 3.

