Costruirò il tuo pipeline ETL usando Python, SQL, Airflow e AWS
Ingegnere dei dati
Informazioni su questo servizio
Hai problemi con dati disordinati e sparsi, difficili da affidare? Costruisco pipeline ETL affidabili che trasformano i dati grezzi in informazioni pulite e pronte per le query, come fanno i team di produzione dei dati.
Utilizzo Python, SQL, Apache Airflow, PySpark e AWS per spostare i tuoi dati dalla sorgente a un magazzino strutturato, con validazioni lungo il percorso per catturare i dati cattivi in anticipo.
Ecco come posso aiutarti:
Progettazione e sviluppo di pipeline ETL/ELT
Orchestrazione con Apache Airflow (DAG pianificati)
Ingestione dati da API, CSV e database
Trasformazione dati con Python/PySpark
Modellazione del magazzino dati (tabelle fact/dimensioni, PostgreSQL)
Validazione della qualità dei dati e controlli automatici
Ho realizzato pipeline end-to-end che gestiscono oltre 100.000 record provenienti da più fonti, strutturate in magazzini puliti e pronti per l'analisi.
Mi interessa scrivere codice pulito e comunicare chiaramente, così saprai sempre cosa succede in ogni fase, non solo alla fine riceverai una scatola nera.
Hai una fonte di dati diversa o bisogno di altro? Scrivimi prima, sono felice di verificare se è adatto prima di ordinare.
Destination Platform:
Amazon Redshift
•
PostgreSQL
•
MySQL
•
Amazon S3
Strumenti e piattaforme:
AWS Glue DataBrew
•
Altro
