Costruirò pipeline di dati ETL automatizzati usando pyspark e python

Alcune informazioni sono state tradotte automaticamente.

India

Parlo Inglese
Ingegnere dei dati che ha progettato e costruito una piattaforma di dati sanitari da zero, ora processando oltre 5 milioni di record di pazienti e più di 10 TB di dati clinici provenienti da sistemi E...
Informazioni su questo servizio

Hai bisogno di un'elaborazione dati scalabile e ad alte prestazioni per la tua attività?

Sono un ingegnere dei dati professionista specializzato in PySpark, Python, SQL e architetture di dati cloud. Aiuto le aziende a trasformare dataset grezzi e non strutturati in pipeline di dati pulite, affidabili e utili.

Ciò che posso fare per te:

  • Costruire pipeline ETL/ELT robuste in batch e in tempo reale usando PySpark.
  • Elaborare grandi dataset CSV, Parquet, JSON o SQL con alte prestazioni.
  • Integrare PySpark con Databricks, AWS (S3, Glue, Redshift), GCP e Azure.
  • Ottimizzare codice PySpark lento (repartitioning, caching, broadcast joins, correzione di errori out-of-memory).
  • Pulire, validare e strutturare dataset sporchi per analisi o Machine Learning.

Perché scegliermi?

  • Codice di livello produzione, completamente commentato.
  • Istruzioni di configurazione complete.
  • 100% sicurezza e riservatezza dei dati.

Destination Platform:

PostgreSQL

•

MySQL

•

Server Microsoft SQL

Strumenti e piattaforme:

AWS Glue DataBrew

•

Azure data factory