Costruirò pipeline di dati in tempo reale con apache kafka, spark e aws

Alcune informazioni sono state tradotte automaticamente.

India

Parlo Inglese

Ingegnere dei dati

Sono un Data Engineer orientato ai risultati con oltre 5 anni di esperienza in Big Data, AWS e leadership tecnica. Mi specializzo nella progettazione di pipeline cloud-native su larga scala e architet...
Informazioni su questo servizio

PIPELINE CHE SOPRAVVIVONO IN PRODUZIONE, NON SOLO NELLA DEMO.


Costruisco pipeline di dati batch e streaming che funzionano ogni giorno senza che qualcuno debba badarci.


COSA CONSEGNO

- Ingestione streaming: Kafka, Kinesis, RabbitMQ, NiFi, CDC dal tuo database

- Trasformazioni PySpark / Spark SQL, ottimizzate - non la configurazione di default

- Data lake su S3 con Apache Iceberg: evoluzione dello schema, viaggio nel tempo, MERGE upsert

- Caricamenti nel data warehouse su Redshift, Snowflake, Athena o BigQuery

- Storico SCD Tipo 2, deduplicazione, ri-esecuzioni idempotenti, gestione di dati in arrivo tardi

- DAG di Airflow, retry, alert e dashboard CloudWatch/Grafana

- CI/CD, test e documentazione per rendere tutto manutenibile


RECORD

3,5+ anni su una piattaforma di streaming di un operatore europeo: oltre 100 pipeline in produzione, 0,6 TB/giorno (18 TB/mese), milioni di utenti in 8 paesi. Riduzione del 50%+ del tempo di calcolo su oltre 100 lavori PySpark. Fewer job failures del 60%. Uptime superiore al 99,9%.


Ho anche migrato un workload Redshift a Apache Iceberg: query più veloci del 40%+ a costi inferiori.


Inviami la tua sorgente, la destinazione e il volume. Otterrai un scope fisso e una timeline reale prima di ordinare.


Lingua:

Inglese

•

Tedesco

•

Hindi

•

Sloveno

Esperienza tecnica:

Apache NiFi

•

Apache Airflow

•

Apache Spark

Expertise:

Pipeline dati

•

Sviluppo ETL

Settore:

Audio e video

•

Analisi dei dati

•

Servizi finanziari

Il mio portfolio