Deployo e gestisco infrastrutture mlops, llm e gpu su aws e kubernetes
Senior AI DevOps Engineer: AWS, Kubernetes, API ComfyUI, DevSecOps
Informazioni su questo servizio
Metto i modelli AI in produzione e li mantengo attivi. Uno script di training non è un prodotto. Un servizio monitorato, versionato e con autoscaling sì.
Strumenti:
Kubernetes
•
Docker
•
Amazon EKS
Framework:
Terraform
•
Ansible
Linguaggio di programmazione:
Bash
•
Go
•
Python
Expertise:
Installazione
•
Migrazione
•
Debug
Altri servizi della categoria Ingegneria DevOps offerti da me
FAQ
Traduzione automatica.
Quali modelli puoi deployare?
Qualsiasi modello aperto su Hugging Face più Llama, Mistral, Qwen, DeepSeek e i tuoi fine-tune. Per immagini e video gestisco anche Flux, SDXL e Wan. Dimmi il modello e ti confermerò il GPU necessario.
Ho bisogno di un mio account cloud?
Sì, ed è voluto. Tutto gira nel tuo account AWS, GCP o RunPod così possiedi l'infrastruttura e controlli la fatturazione. Lo configuro e te lo consegno.
Quanto costerà al mese?
Dipende dalla dimensione del modello e dal traffico. Prima di ordinare ti do una stima: tipo di GPU, utilizzo previsto e range mensile. Spot instances e scale to zero di solito riducono molto i costi.
Ottengo il codice Terraform e Helm?
Sempre. Ricevi l'intero repository, Dockerfile, chart Terraform o Helm e documentazione API, così tu o un altro ingegnere potete mantenerlo in futuro.
Puoi sistemare un setup esistente invece di crearne uno nuovo?
Sì. Deploy falliti, crash OOM, nodi GPU che non schedulano, bollette cloud esorbitanti e infrastruttura non documentata sono molte delle cose che faccio.
Fai LLM self-hosted on premise?
Sì. Ollama o vLLM con Open WebUI sul tuo server o workstation GPU, completamente offline, senza dati che lasciano la rete.
Quale monitoraggio ottengo?
Prometheus e Grafana con dashboard per latenza, throughput, utilizzo GPU, tasso di errore e costi per richiesta, più alert che ti avvisano prima che i tuoi utenti se ne accorgano.
Quali sono i tuoi orari di lavoro?
Sono disponibile 24/7 e lavoro secondo orari USA, quindi possiamo parlare nel tuo fuso orario. Rispondo di solito entro un'ora.
