Costruirò data pipeline che

Alcune informazioni sono state tradotte automaticamente.

India

Parlo Inglese

Ingegnere AI e ML per il fine tuning di LLM RAG e Data Science

Sviluppatore AI/ML con esperienza pratica in produzione nel fine-tuning di LLM (QLoRA/PEFT), sistemi RAG (ChromaDB, MongoDB Atlas vettoriale, memoria agentica) e data engineering (PySpark, Airflow, De...
Informazioni su questo servizio

Costruisco pipeline ETL in stile produzione usando PySpark per la trasformazione, Airflow per l'orchestrazione e Delta Lake per lo storage, lo stesso stack che utilizzo nel mio lavoro quotidiano di data engineering.

Ciò che è incluso:

  • Logica di trasformazione da Bronze a Silver (dati grezzi a puliti) in PySpark
  • Progettazione di DAG in Airflow con pianificazione corretta e gestione delle dipendenze
  • Configurazione di tabelle Delta Lake con versioning
  • Opzionale: dashboard Trino/Metabase sopra i dati puliti
  • Architettura di pipeline completamente in-house, auto-ospitata, senza dipendenza da piattaforme ETL di terze parti gestite (Fivetran, Airbyte Cloud, ecc.) se preferisci possedere l'intero stack

Prima di iniziare le modifiche alla progettazione della pipeline, chiederò informazioni sul volume dei tuoi dati e sul formato della fonte, perché molto cambia tra un CSV da 10k righe e una sorgente streaming, e valuterò onestamente invece di riutilizzare un modello generico.

Destination Platform:

Amazon Redshift

Databricks Lakehouse

Strumenti e piattaforme:

AWS Glue DataBrew