Costruirò o ottimizzerò pipeline di dati pyspark databricks
Progettazione di sistemi AI agentic full-stack e automazione, MLOps
Informazioni su questo servizio
Hai bisogno di una pipeline PySpark o Databricks affidabile, scalabile e comprensibile?
Revisionerò, costruirò, fixerò o ottimizzerò una pipeline di dati limitata usando PySpark, Spark SQL, Delta Lake e Azure Databricks quando necessario.
Posso affrontare job lenti, shuffle eccessivi, skew nelle join, partizionamento, pruning, funzioni di finestra, caratteristiche temporali, elaborazione incrementale, Delta Lake, controlli sulla qualità dei dati e refactoring di Python UDF.
La tua consegna può includere codice corretto, risultati delle performance, implementazione della pipeline, controlli di validazione, linee guida per benchmark, documentazione e consegna tecnica.
Il mio lavoro recente include elaborazione distribuita su miliardi di record di package-network in Azure Databricks senza UDF Python. Mi concentro su miglioramenti spiegabili, manutenibili.
Le package coprono job definiti, sorgenti e trasformazioni. Costi cloud, credenziali di produzione, amministrazione della piattaforma e dashboard non correlate sono esclusi a meno che non siano inclusi in un'offerta personalizzata.
Contattami prima di ordinare con il codice, gli schemi, la scala dei dati, il runtime attuale e il risultato desiderato.
Il mio portfolio
FAQ
Traduzione automatica.
Puoi ottimizzare un job PySpark esistente?
Sì. Revisiono la logica di esecuzione, le join, gli shuffle, lo skew, il partizionamento, la cache, le funzioni di finestra, l'uso di UDF, le letture/scritture e la struttura del job. I miglioramenti effettivi dipendono dai dati, dalla configurazione del cluster e dall'implementazione esistente.
Puoi garantire un miglioramento delle prestazioni specifico?
No. Identificherò i colli di bottiglia e convaliderò i miglioramenti quando sarà possibile accedere in modo rappresentativo all'esecuzione, ma il runtime dipende dalla distribuzione dei dati, risorse del cluster, concorrenza, storage e configurazione della piattaforma.
Lavori solo con Azure Databricks?
La mia esperienza più recente riguarda Azure Databricks e PySpark, ma i concetti di Spark si applicano anche ad altri ambienti gestiti di Spark. Conferma la tua piattaforma prima di ordinare.
Hai bisogno di accesso ai dati di produzione?
Non necessariamente. Campioni sanificati, schemi, piani di esecuzione, screenshot di Spark UI, log e dati di test riproducibili sono spesso sufficienti. Mai inviare credenziali di produzione senza restrizioni tramite requisiti Fiverr.
Sono incluse le spese cloud e del cluster?
No. L'acquirente paga i costi di Databricks, cloud, storage, database e altre infrastrutture. Usa un ambiente non di produzione con controllo dei costi quando possibile.
Fornirai il codice sorgente e la documentazione?
Sì. I deliverable seguono il pacchetto scelto e possono includere notebook, moduli Python, SQL, esempi di configurazione, test, risultati, istruzioni README e un manuale operativo.
Puoi costruire una piattaforma end-to-end?
Questo Gig copre pipeline limitate e job collegati. Una piattaforma dati completa, migrazione a livello di organizzazione, programma di governance o operazioni di produzione continue richiedono scoperta e un'offerta personalizzata di milestone.
Cosa conta come revisione?
Una revisione corregge il lavoro consegnato rispetto ai requisiti concordati. Nuove sorgenti, trasformazioni, notebook, piattaforme, schemi o logica aziendale modificata sono scope aggiuntivi.

