Costruirò pipeline ETL con pyspark e databricks
Ingegnere dei dati
Informazioni su questo servizio
Ciao, sono Arbind Sah e posso aiutarti a costruire pipeline ETL scalabili, elaborare Big Data o ottimizzare sistemi basati su cloud.
Sono specializzato in Python, SQL e strumenti nativi del cloud per semplificare l'integrazione dei dati, l'automazione e l'analisi per aziende di tutte le dimensioni.
In cosa posso aiutarti:
-Progettazione e ottimizzazione di pipeline ETL & Data Workflow utilizzando PySpark e Databricks per trasformazioni di dati affidabili e pronte per la produzione.Soluzioni Utilizzano Redshift, BigQuery, Spark e Databricks per gestire grandi dataset in modo efficiente.
-Infrastruttura Cloud: Costruisci e gestisci infrastrutture su AWS (EC2, RDS, S3, Lambda) e GCP, inclusi deployment containerizzati con Docker.
-Ottimizzazione e sicurezza del database Migliora le prestazioni delle query, implementa robuste misure di sicurezza e garantisci la conformità agli standard del settore.
-Migrazione dei dati e riconciliazione dello schema Migra e consolidare dati tra PostgreSQL, MySQL e piattaforme cloud, gestendo mismatch di tipo, valori null e mapping complessi dello schema.
Con un forte focus su cloud computing, automazione dei dati e analisi, garantisco soluzioni di dati scalabili, sicure e ad alte prestazioni.
Contattami per ottimizzare i tuoi workflow di dati e massimizzare l'efficienza!
Il mio portfolio
FAQ
Traduzione automatica.
Di quali informazioni hai bisogno per iniziare?
Idealmente, i tuoi dati di origine (o un campione), il sistema/format target e cosa significa "successo" per la migrazione o la pipeline. Se non sei sicuro, scrivimi e ti aiuterò a capire l'ambito.
Puoi lavorare con dati disordinati o incoerenti?
Sì — gestire null, mismatch di tipi e formati incoerenti è una parte fondamentale del mio lavoro, non un caso limite che evito.
Fornisci documentazione con la pipeline consegnata?
Sì, tutte le pipeline vengono fornite con documentazione chiara in modo che il tuo team possa mantenere e ampliare il lavoro dopo la consegna.
Cosa succede se la mia fonte o destinazione dati non sono elencate tra le tue specializzazioni?
Scrivimi prima con i dettagli — lavoro principalmente con PostgreSQL, MySQL, PySpark/Databricks e AWS/GCP, ma sono felice di discutere altri stack prima di procedere con l'ordine.
Puoi riparare o ottimizzare una pipeline esistente invece di crearne una nuova?
Sì — debug e ottimizzazione di pipeline ETL esistenti sono cose che faccio regolarmente, non solo creare da zero.
Come gestisci set di dati di grandi dimensioni?
Utilizzo PySpark e Databricks per l'elaborazione distribuita, quindi i dati su larga scala vengono gestiti in modo efficiente invece di bloccare uno script singolo.
Quanto dura un progetto tipico?
Dipende dal volume e dalla complessità dei dati — per una timeline chiara, scrivimi con i dettagli del progetto prima di ordinare.
Firmi NDA?
Sì, sono felice di firmare un NDA se il tuo progetto ne richiede uno — basta inviarmelo prima di iniziare.

