Costruirò pipeline ETL, ELT di dati con python, spark, airflow e dbt
Ingegnere di dati e AI, Python, PySpark, Airflow e Cloud ETL
Informazioni su questo servizio
Su questo servizio:
Hai bisogno che i tuoi dati vengano puliti, trasformati e fatti fluire in modo affidabile dal sorgente alla destinazione? Costruisco pipeline ETL/ELT usando strumenti moderni di data engineering come Python, PySpark, SQL, Apache Airflow, dbt e Databricks, seguendo l'architettura Medallion (Bronze/Silver/Gold) per livelli di dati puliti e pronti per la produzione.
Recentemente ho realizzato una pipeline che raccoglie dati in tempo reale tramite API, li gestisce con Airflow con avvisi automatici in caso di fallimento, li trasforma attraverso più di 10 modelli dbt con oltre 60 test di qualità dei dati, e li visualizza in una dashboard Power BI più una pipeline Databricks separata che processa dati di e-commerce end-to-end con PySpark.
Cosa offro:
- Progettazione e sviluppo di pipeline ETL/ELT (batch)
- Pulizia, convalida e test di qualità dei dati
- Implementazione dell'architettura Medallion (Bronze/Silver/Gold)
- Orchestrazione con Apache Airflow
- Trasformazione dei dati con dbt, SQL, PySpark
- Sviluppo di pipeline Databricks
- Ingestione dati tramite API
- Integrazione con dashboard (Power BI)
Perché lavorare con me:
- Progetti reali e verificabili, ogni consegna è supportata da un repository pubblico su GitHub
- Comunicazione chiara, tempi realistici
- Codice pulito, documentato e in stile produzione, non script usa e getta
Destination Platform:
PostgreSQL
•
Amazon S3
•
Altro
Strumenti e piattaforme:
Azure data factory
•
Altro
Il mio portfolio
FAQ
Traduzione automatica.
Che tipo di pipeline di dati puoi creare?
Costruisco pipeline ETL/ELT che estraggono dati da API, database, file flat (CSV/Excel) o siti web. Li pulisco, trasformo e testo usando Python, PySpark e dbt, e poi consegno i dati in un formato strutturato nel tuo database o data warehouse (come PostgreSQL o Databricks).
Non sono tecnico, puoi comunque aiutarmi?
Assolutamente. La maggior parte dei miei clienti non sono ingegneri. Dimmi il tuo obiettivo finale in italiano semplice (ad esempio, "Ho bisogno di raccogliere i dati di vendita giornalieri e l'inventario in un unico posto"), e io mi occuperò dell'architettura tecnica e te la spiegherò in modo semplice.
Puoi automatizzare una pipeline per farla funzionare ogni giorno o ogni settimana?
Sì. Sono specializzato nell'uso di Apache Airflow per orchestrare e automatizzare i workflow. A seconda del pacchetto, posso impostare esecuzioni programmate, dipendenze tra task e avvisi email automatici in caso di fallimento di qualche parte della pipeline.
Puoi aiutarmi con il web scraping?
Sì. Posso creare web scraper usando Python per estrarre dati da siti pubblici, assicurando che il progetto rispetti le normative legali e le regole del sito. Posso anche integrare direttamente con API, che consiglio sempre come prima scelta per maggiore stabilità.
Cos'è l'"architettura Medallion"?
È un pattern di progettazione dei dati che organizza i dati in tre livelli: Bronzo (dati grezzi), Argento (dati puliti e filtrati) e Oro (dati pronti per l'uso aziendale). Uso questo metodo per garantire che i tuoi report finali siano costruiti su dati altamente affidabili e testati.
Può integrarsi con strumenti BI?
Sì. Progetto l'ultimo livello della tua pipeline di dati in modo che strumenti come Power BI, Tableau o altre piattaforme di analisi possano connettersi direttamente e interrogare i dati in modo efficiente.
Cos’è l’arricchimento dei dati con AI?
L'enrichment dei dati con AI significa usare strumenti di AI o LLM per aggiungere più significato e struttura a dati grezzi e disordinati. Per esempio, feedback dei clienti non strutturati possono essere automaticamente categorizzati per sentiment, o entità specifiche (come nomi o località) possono essere estratte da grandi blocchi di testo.
Puoi aggiungere arricchimento AI o LLM ai miei dati?
Sì. Posso integrare workflow di AI/LLM nella tua pipeline per gestire attività come riassunti, classificazioni, tagging e conversione di testo non strutturato in campi di database puliti e interrogabili prima che arrivino al dashboard.
Usi test di qualità dei dati?
Sì. Credo fermamente che la qualità dei dati debba essere integrata nel processo, non aggiunta come optional. Uso dbt per implementare test automatici (controllo di null, duplicati o valori accettati) così la tua pipeline ti avvisa prima che i dati cattivi rompano i report.

