Implementerò il tuo llm in produzione con vllm sul tuo GPU cloud

I
ike_kolawole
I
ike_kolawole
Joshua
Alcune informazioni sono state tradotte automaticamente.

Informazioni su questo servizio

Traduzione automatica.

Un modello che funziona in un notebook e uno che sopravvive a 1.000 utenti contemporanei sono due progetti diversi. Io faccio il secondo.


Sono un ingegnere senior di ML-infrastructure, con 7 anni di affidabilità in produzione alle spalle. Recentemente: infrastruttura di servizio che gestisce oltre 50.000 task contemporanei a meno di 100 ms per più di 1.000 utenti, costruita su vLLM e SGLang con pool di nodi GPU Kubernetes, con un costo inferiore del 35% rispetto a quando ho iniziato.


Cosa ottieni:

  • Il tuo modello open-weight (Llama, Mistral, Qwen, DeepSeek) servito con vLLM
  • Implementato nel TUO account cloud: tu mantieni le chiavi, i dati e l'endpoint
  • Auto-scaling GPU e batching ottimizzati per inferenza, non per traffico web
  • Risultati dei test di carico, così sai la capacità reale prima che i tuoi utenti la trovino
  • Pannelli di monitoraggio; runbook su Standard/Premium

Se il budget GPU e il target di latenza non combaciano, te lo dirò prima che spendi un centesimo in compute.


Basic: un modello, un nodo GPU, testato sotto carico.

Standard: aggiunge auto-scaling, tuning, dashboard.

Premium: multi-modello, pass di ottimizzazione dei costi, handover.


Inviami i dettagli del modello e del traffico; il modulo di requisiti copre il resto.

Scopri di più su Joshua

Joshua

Senior Platform Engineer

  • DaNigeria
  • Membro dalug 2026
  • Lingue

    Inglese
Deployments on my platforms are boring, and that's the point. Seven years of production infrastructure: multi-cloud Kubernetes (EKS/AKS), Terraform at 20+ module scale, CI/CD with automatic rollback at 99.9% deploy success. One team went from 40% failed deploys to 5% after I rebuilt their pipelines; a fintech's PCI-DSS audits returned zero critical findings. I also build ML serving infrastructure: 50,000+ concurrent tasks at sub-100ms using vLLM on GPU node pools. Hand me a breaking pipeline, an untrusted cluster, or a cloud bill that grew quietly, and get it fixed properly.

Traduzione automatica.

Il mio portfolio