Ottimizzerò la tua app LLM per latenza e costi più bassi

C
chlee9
C
chlee9
Cheolhee Lee
Alcune informazioni sono state tradotte automaticamente.

Informazioni su questo servizio

Traduzione automatica.

Ottimizzo le applicazioni LLM che sono troppo lente o troppo costose.


Cosa ho fatto in produzione:

- Ridotto la latenza p95 del 70 percento e i costi di servizio del 38 percento con caching del contesto, output strutturato e routing del modello

- Ridotto i token di output del 49 percento senza perdere qualità

- Accelerato gli endpoint di lista di 125 volte e una query Threads da 411ms a 1,6ms

- Ricollocato tre modelli LLM e embedding su un DGX on-premise senza downtime


Come funziona:

1. Condividi i tuoi prompt, tracce, configurazione del modello e i tuoi numeri di latenza o costo

2. Profilo la pipeline e invio un report prioritario

3. Implemento le correzioni e mostro i benchmark prima e dopo


Pila: OpenAI, Anthropic, vLLM, LangChain, RAG, pgvector, Python, TypeScript, Rust, Go, AWS.


Dimmi la tua attuale p95 e la spesa mensile e ti dirò cosa è realistico.

Scopri di più su Cheolhee Lee

Cheolhee Lee

AI Full Stack Developer specializing in LLM and RAG optimization

  • DaCorea del Sud
  • Membro daapr 2021
  • Tempo di risposta medio1 ora
  • Lingue

    Coreano, Inglese
I keep my employer and my clients unnamed here. I ship production AI systems end to end at an undisclosed B2B AI SaaS company - a sales-automation SaaS and a public-sector AI evaluation platform. Measured: LLM p95 latency -70%, serving cost -38%, output tokens -49% via context caching and structured output. 125x list speedup, threads query 411ms to 1.6ms, bundle 21.7MB to 2.3MB. Re-homed three LLM models to an on-prem DGX with zero downtime; passed TTA review for Korea's AI Verification program. TypeScript, Python, Rust, Go, React, PostgreSQL, AWS, RAG, vLLM, MCP.

Traduzione automatica.

Il mio portfolio

Altri servizi della categoria Sviluppo AI offerti da me