Costruirò una pipeline di dati ETL che pulisce e arricchisce lungo il percorso

Alcune informazioni sono state tradotte automaticamente.

Pakistan

Parlo Urdu, Inglese

259 ordini completati

Data engineer Python: web scraping, pipeline ETL e arricchimento dei dati

Prendo dati da siti che sono stati creati per proteggerli: rendering JavaScript, login, limiti di velocità, protezione anti-bot. Poi la pipeline che fa arrivare i dati. Sei anni e più di 250 progetti...

Livello 2

Ha soddisfatto criteri di prestazioni elevate e ha una comprovata esperienza nel soddisfare le aspettative dei clienti.

Informazioni su questo servizio

I dati arrivano da sei fonti diverse e nessuna di esse concorda. Un'API REST, due fogli di calcolo gestiti manualmente da qualcuno, un output di uno scraper e un export da CRM con nomi di colonne diversi tra loro. Qualcuno passa una mattina a settimana a metterli insieme.


Ciò che fa la pipeline

  • Estrae dati da siti web, API REST, database e file
  • Li pulisce, elimina duplicati e li riformatta secondo uno schema che definisci
  • Arricchisce i record con altre fonti: dati aziendali, contatti, geodata
  • Li carica in BigQuery, PostgreSQL, MySQL, Sheets o nel tuo CRM
  • Funziona secondo un programma, orchestrato in Airflow o n8n


Progettato per non fallire silenziosamente

  • Riprova e limita il rate on ogni fonte
  • Validazione all’interno della pipeline, così le righe sbagliate vengono catturate prima di arrivare
  • Allerta quando una run fallisce o un campo inizia a arrivare vuoto


Ho costruito questa pipeline dietro oltre 1 milione di profili di avvocati negli Stati Uniti, funzionando senza supervisione.


Ti consegno la pipeline funzionante, il codice sorgente e la documentazione di setup scritta per chi la erediterà. Dimmi le tue fonti e la destinazione, e ti farò un preventivo e una stima prima che tu ordini.

Destination Platform:

Google BigQuery

PostgreSQL

MySQL

Amazon S3

Strumenti e piattaforme:

AWS Glue DataBrew

Il mio portfolio