Risolverò i problemi e ottimizzerò la tua infrastruttura Kubernetes
Tech Lead Ingegnere di Infrastrutture AI
Informazioni su questo servizio
Il tuo workload AI/ML fallisce, funziona lentamente o non utilizza efficacemente le tue GPU?
Risolverò, configurerò e ottimizzerò la tua infrastruttura GPU basata su Kubernetes per workload AI/ML.
Posso aiutarti con:
Workload e deployment GPU su Kubernetes
Configurazione e troubleshooting GPU NVIDIA
Docker e workload AI containerizzati
Pianificazione GPU e allocazione risorse
Workload distribuiti multi-nodo
Problemi di comunicazione NCCL e GPU
InfiniBand e reti ad alte prestazioni
Troubleshooting di pod, nodi e deployment
Ottimizzazione delle prestazioni e dell'utilizzo GPU
Log, monitoraggio e debugging dell'infrastruttura
Deployment e affidabilità dei workload AI/ML
Ho esperienza professionale nella costruzione e gestione di infrastrutture AI su larga scala, inclusi cluster GPU, piattaforme Kubernetes, ambienti di training distribuito e workload AI in produzione.
Il mio approccio è pratico e focalizzato sull'identificazione della causa principale, sull'implementazione della soluzione e sul miglioramento dell'affidabilità e delle prestazioni.
Contattami prima di ordinare se il tuo ambiente coinvolge infrastrutture GPU multi-nodo complesse, training distribuito o workload in produzione.
Strumenti:
Kubernetes
•
Docker
Framework:
Npm
•
Terraform
•
Ansible
Linguaggio di programmazione:
Bash
•
Go
•
Java
•
JavaScript
•
Python
•
Golang
Expertise:
Debug
•
Sviluppo
•
Configurazione
