Costruirò una pipeline di dati open source full stack per la produzione con automazione cicd

Alcune informazioni sono state tradotte automaticamente.

Pakistan

Parlo Urdu, Inglese

Ingegnere dei dati

Data Engineer specializzato nella costruzione di data lakehouse end-to-end, self-hosted su Kubernetes utilizzando tecnologie open-source. Ho progettato e gestito una piattaforma dati di livello produz...
Informazioni su questo servizio

Stai cercando supporto flessibile per l'ingegneria dei dati, che si tratti di un 

riparazione rapida o di una costruzione completa di pipeline? Offro tre livelli di coinvolgimento:


Supporto orario: debug rapido, piccoli compiti Spark/ETL o consulenza

Coinvolgimento part-time: sviluppo di pipeline o modelli dbt focalizzati su 20 ore

Costruzione completa del progetto: configurazione end-to-end di lakehouse (oltre 50 ore)


Sono un Data Engineer con esperienza pratica nella creazione di un lakehouse completo e self-hosted su Kubernetes, elaborando circa 5 milioni di righe usando Apache Spark, Apache Iceberg, Trino, dbt-Trino e Google BigQuery.


Ciò che consegno:

Pipeline ETL con Apache Spark: ingestion, pulizia, trasformazione

Controlli sulla qualità dei dati usando PyDeequ

Modelli layer Gold di dbt-Trino: Star Schema, Data Vault, OBT, Marts

Orchestrazione con Dagster e automazione CI/CD

Documentazione completa (livelli Standard & Premium)


Contattami prima di ordinare così possiamo discutere le tue esigenze specifiche.

Warehouse Platform:

Snowflake

BigQuery

Databricks

Tipo di progetto:

New Build

Il mio portfolio