Costruirò un framework di valutazione per llm

S
sushii_98
S
sushii_98
Sushma Sharma
Alcune informazioni sono state tradotte automaticamente.

Informazioni su questo servizio

Traduzione automatica.

Il tuo sistema AI sembra a posto nelle demo. Ma funziona ancora correttamente in produzione la prossima settimana?


La maggior parte dei team scopre che la loro AI si è rotta quando un utente si lamenta.

Costruisco infrastrutture di valutazione che catturano i fallimenti prima che gli utenti lo facciano automaticamente.


Quello che costruisco:

- Valutazione retrieval (stai recuperando i contenuti giusti?)

- Punteggio di fedeltà (la risposta è fondata o hallucinated?)

- Rilevamento di regressioni (il tuo ultimo prompt ha rotto qualcosa?)

- pipeline LLM-as-judge senza bisogno di ground truth

- Dashboard Streamlit che mostra le tendenze di qualità nel tempo


Se stai usando AI in produzione senza evals, stai volando alla cieca. Scrivimi e ti dirò dove il tuo sistema ha più probabilità di fallire.

Scopri di più su Sushma Sharma

Sushma Sharma

AI Engineer

  • DaIndia
  • Membro dagiu 2026
  • Tempo di risposta medio3 ore
  • Lingue

    Inglese
AI Engineer with 5+ years of experience designing and building AI systems: 🔹 Multi-agent & agentic AI: Built ReAct-based LLM workflows for automated proposal generation. A Multi-RAG framework I designed identified $0.8M in margin leakage in customer proposals. 🔹 RAG & retrieval optimization: Improved retrieval accuracy by 20% using semantic query enhancement. Built GenAI risk assessment workflows for safety documentation. 🔹 LLMOps: Evaluation pipelines, prompt testing, and model performance monitoring for enterprise AI. Communicate well with cross-functional teams.

Traduzione automatica.

Il mio portfolio

Altri servizi della categoria Sviluppo AI offerti da me