Configurerò, validerò e risolverò i problemi del tuo cluster gpu e infrastruttura ai
Ingegnere senior di infrastrutture HPC e AI, GPU SLURM Linux
Informazioni su questo servizio
Hai GPU. Hai bisogno che si comportino come una piattaforma di calcolo affidabile.
Costruisco e gestisco infrastrutture GPU e HPC in produzione: provisioning, validazione driver e stack CUDA, scheduling, networking ad alta velocità e monitoraggio. Lavoro a livello di infrastruttura. Non sono un ingegnere ML e non pretendo di esserlo.
COSA FACCIO
Avvio del nodo GPU: allineamento driver NVIDIA, toolkit CUDA e runtime, modalità persistence, MIG
Validazione dello stato di salute: diagnostica DCGM, triage errori Xid ed ECC, controlli termici e di alimentazione
Comunicazione multi-nodo GPU: benchmarking nccl-tests all-reduce, tuning NCCL, validazione percorso di rete
Scheduling: partizioni GPU SLURM e GRES, cgroups e binding, o Kubernetes con il plugin dispositivo NVIDIA e GPU Operator
Monitoraggio: Prometheus, DCGM exporter, dashboard Grafana
Automazione: ruoli Ansible per rendere il processo ripetibile
PRIMA DI ORDINARE
Contattami con il numero di nodi, modello GPU, interconnessione e cosa stai osservando. Se non è qualcosa che posso risolvere realmente, te lo dirò.
Riceverai configurazione funzionante, output del benchmark che mostra cosa è cambiato e documentazione scritta.
Server:
Database server
Sistema operativo:
Linux
Altri servizi della categoria Assistenza e IT offerti da me
FAQ
Traduzione automatica.
Scrivi kernel CUDA o addestri modelli?
No. Lavoro sull'infrastruttura sottostante: provisioning, driver, scheduling, networking e monitoraggio. Il codice dei modelli e gli script di training sono fuori dal mio scope, e preferisco dirlo piuttosto che assumermi lavori che non posso fare bene.
Di quale accesso hai bisogno per iniziare?
Accesso SSH con sudo sui nodi e accesso a BMC o IPMI se sono necessari controlli a livello hardware. Per la diagnostica di base, di solito basta l'accesso in sola lettura per iniziare.
Lavori con GPU cloud o solo on-premise?
Entrambi. Cluster bare-metal on-premise e istanze GPU AWS.
Le nostre GPU sono appena utilizzate. Puoi scoprire perché?
Di solito sì. La bassa utilizzo è normalmente legata a scheduling, caricamento dati, NUMA e affinità, o all'interconnessione. La diagnostica di base è pensata proprio per questa domanda, e ricevi le misure che stanno dietro alla risposta.
Supporti reti InfiniBand?
La mia esperienza con networking ad alta velocità riguarda Ethernet e RoCE, non InfiniBand. Se la tua rete è InfiniBand, te lo dirò prima di ordinare piuttosto che imparare sul tuo cluster.
2 recensioni per questo servizio
| (2) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Valutazione dettagliata
- Livello di comunicazione del venditore
- Qualità della consegna
- Valore della consegna
Ordina per
A apreda1

Stati Uniti
I hired him again he assisted me with my project very effectively. I definitely recommend him
50 USD-100 USD
Prezzo
1 giorno
Tempo
Utile?A aimen39

Algeria
Best seller + communication + skills + knowledge
50 USD-100 USD
Prezzo
1 giorno
Tempo
H 
Risposta del venditore
Utile?
2 recensioni per questo servizio
| (2) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Valutazione dettagliata
- Livello di comunicazione del venditore
- Qualità della consegna
- Valore della consegna
Ordina per
A apreda1

Stati Uniti
I hired him again he assisted me with my project very effectively. I definitely recommend him
50 USD-100 USD
Prezzo
1 giorno
Tempo
Utile?A aimen39

Algeria
Best seller + communication + skills + knowledge
50 USD-100 USD
Prezzo
1 giorno
Tempo
H 
Risposta del venditore
Utile?
