Costruirò data pipeline che
Ingegnere AI e ML per il fine tuning di LLM RAG e Data Science
Informazioni su questo servizio
Costruisco pipeline ETL in stile produzione usando PySpark per la trasformazione, Airflow per l'orchestrazione e Delta Lake per lo storage, lo stesso stack che utilizzo nel mio lavoro quotidiano di data engineering.
Ciò che è incluso:
- Logica di trasformazione da Bronze a Silver (dati grezzi a puliti) in PySpark
- Progettazione di DAG in Airflow con pianificazione corretta e gestione delle dipendenze
- Configurazione di tabelle Delta Lake con versioning
- Opzionale: dashboard Trino/Metabase sopra i dati puliti
- Architettura di pipeline completamente in-house, auto-ospitata, senza dipendenza da piattaforme ETL di terze parti gestite (Fivetran, Airbyte Cloud, ecc.) se preferisci possedere l'intero stack
Prima di iniziare le modifiche alla progettazione della pipeline, chiederò informazioni sul volume dei tuoi dati e sul formato della fonte, perché molto cambia tra un CSV da 10k righe e una sorgente streaming, e valuterò onestamente invece di riutilizzare un modello generico.
FAQ
Traduzione automatica.
Lavori con fonti di dati cloud (S3, GCS, Azure Blob)?
Sì — specifica la tua fonte nelle richieste.
Puoi riparare una pipeline esistente rotta invece di crearne una nuova?
Sì, contattami prima con i dettagli — i prezzi differiscono dai servizi di nuova creazione.
Devo avere la mia istanza di Airflow?
No, posso configurarne una (locale/Docker) come parte della consegna, o lavorare sulla tua se mi fornisci accesso.
Puoi costruire questo senza affidarti a strumenti ETL di terze parti gestiti?
Sì — costruisco pipeline completamente in-house/self-hosted (PySpark + Airflow + Delta Lake) invece di collegare strumenti come Fivetran o Airbyte Cloud. Disponibile nel tier Premium.
