Revisionerò i tuoi numeri di benchmark AI o valutazione LLM per validità statistica

Alcune informazioni sono state tradotte automaticamente.

Finlandia

Parlo Finlandese, Inglese

Esperto di bot di trading

Sono un Quantitative Engineer che costruisce bot di trading personalizzati e pipeline API. Non vendo script "per arricchirsi rapidamente". Costruisco un'architettura di trading solida e affidabile. I...
Informazioni su questo servizio

 Otterrai un verdetto chiaro se il tuo numero di benchmark o valutazione supera i controlli che ha saltato prima di pubblicarlo.

 Prendo un risultato principale (una posizione in classifica, un tasso di vittoria come giudice di un LLM, un "batte la baseline di X%", un

 esponente della legge di scaling) e lo testo in modo adversariale: correzione per confronti multipli, potenza statistica, bias del giudice e

 riproduzione dai tuoi dati grezzi.


 Ricevi una delle due risposte oneste: se supera, ecco la statistica corretta che puoi citare o è nel rumore,

 ecco perché e la correzione in una riga.


 Ciò che distingue questo è la prova, non le promesse. Ho scritto il libro su questa modalità di fallimento (Measured, Not Believed), ho creato lo

 strumento open-source che esegue i controlli (evalgate), e ho riprodotto pubblicamente tre veri overclaims MT-Bench,

 RewardBench, e una legge di scaling pubblicata. Ogni verdetto che do è riproducibile dai tuoi dati; mostro il lavoro. E se

 il tuo numero è reale, lo certifico come un revisore che trova difetti solo se è un cinico, non un revisore.