Hai bisogno di un'elaborazione dati scalabile e ad alte prestazioni per la tua attività?
Sono un ingegnere dei dati professionista specializzato in PySpark, Python, SQL e architetture di dati cloud. Aiuto le aziende a trasformare dataset grezzi e non strutturati in pipeline di dati pulite, affidabili e utili.
Ciò che posso fare per te:
- Costruire pipeline ETL/ELT robuste in batch e in tempo reale usando PySpark.
- Elaborare grandi dataset CSV, Parquet, JSON o SQL con alte prestazioni.
- Integrare PySpark con Databricks, AWS (S3, Glue, Redshift), GCP e Azure.
- Ottimizzare codice PySpark lento (repartitioning, caching, broadcast joins, correzione di errori out-of-memory).
- Pulire, validare e strutturare dataset sporchi per analisi o Machine Learning.
Perché scegliermi?
- Codice di livello produzione, completamente commentato.
- Istruzioni di configurazione complete.
- 100% sicurezza e riservatezza dei dati.