Costruirò la tua pipeline di dati con airflow e spark
Ingegnere del software
Informazioni su questo servizio
Crea pipeline di dati affidabili, scalabili e pronte per il cloud.
Hai difficoltà a spostare o trasformare i tuoi dati in modo efficiente? Mi specializzo nella creazione di pipeline di dati end-to-end che automatizzano l'ingestione, la trasformazione, la validazione e il caricamento in ambienti cloud e on-premise.
Con oltre 2,5 anni di esperienza e strumenti come Spark, SQL, Python, Databricks, Snowflake, AWS e GCP, ti aiuto a trasformare dati grezzi e disordinati in insight pronti per la produzione.
Ciò che offro:
- Pipeline ETL & ELT (batch & streaming)
- Integrazione con API, storage cloud e database
- Deployment nativo per il cloud: AWS Glue, Lambda, Azure ADF, Databricks, GCP Dataflow
- Architettura in tempo reale usando Kafka, Pub/Sub o Event Hubs
- Pulizia dei dati, controlli di qualità, audit logging
Nota: Scrivimi prima di ordinare per assicurarti che definisca perfettamente il tuo progetto!
FAQ
Traduzione automatica.
Quanto tempo ci vuole per un progetto di data pipeline?
Pipeline singola: 5 giorni. Data warehouse multi-sorgente con orchestrazione: 14 giorni. Stack di dati aziendali con streaming, CDC e dbt: 25 giorni. La complessità (numero di sorgenti, volume di dati, requisiti di qualità) influisce molto sui tempi.
Costruisci data pipeline in tempo reale?
Sì. Implemento pipeline quasi in tempo reale (latenza di 5-15 minuti) usando Kafka e caricamento micro-batch, e streaming in tempo reale vero e proprio usando Kafka + Spark Structured Streaming o KSQL. Ti aiuterò a capire se il tempo reale è davvero necessario.
Puoi documentare le mie pipeline di dati esistenti?
Sì. Rivedo, documenti e miglioro il codice delle pipeline esistenti.

