Come ingegnere di Machine Learning specializzato in NLP e AI simbolica, offro valutazioni complete, benchmarking e red-teaming per i tuoi Large Language Models (LLMs) e pipeline RAG. Aiuto i team di ingegneria a identificare fallimenti in casi limite, eliminare allucinazioni e applicare rigidi standard di sicurezza.
Cosa Offro:
- Benchmarking LLM & Audit delle prestazioni: Valutazione dell'accuratezza del modello, latenza, uso del contesto e capacità di ragionamento secondo rubriche di test personalizzate.
- Rilevamento di allucinazioni e casi limite: Test di stress sui prompt, accuratezza del recupero RAG e coerenza fattuale sotto condizioni avversarie.
- Red Teaming & Test di sicurezza: Identificazione di vulnerabilità come attacchi di prompt injection, jailbreak e perdite di prompt di sistema.
- Validazione di schema e output: Verifica della conformità rigorosa alla struttura JSON/Pydantic, esecuzione di chiamate di funzione e affidabilità dell'integrazione API.
- Rapporto di audit dettagliato & piano d'azione: Analisi completa dei fallimenti con soluzioni pratiche di prompt engineering e raccomandazioni di guardrail.