Implementerò una pipeline di trascrizione e analisi chiamate whisper sul tuo server


Informazioni su questo servizio
Traduzione automatica.
Esegui la trascrizione Whisper e l'analisi AI completamente sul tuo hardware. L'audio non lascia mai il tuo computer.
Per team che non possono inviare audio sensibile a OpenAI o Deepgram: healthcare HIPAA, aziende UE soggette al GDPR, legale, finanziario, enti pubblici o call center dove i costi API aumentano troppo.
Implemento una pipeline completa sul tuo server Linux:
- Whisper large-v3 tramite faster-whisper per trascrizioni precise
- preprocessing con ffmpeg e pulizia delle allucinazioni per silenzio, ripetizioni e artefatti senza parlato
- analisi locale con LLM tramite Ollama, API compatibile con OpenAI
- output JSON strutturato: sentiment, punti chiave, azioni, flag di escalation, più i tuoi campi personalizzati
- servizio FastAPI che accetta wav, mp3, mp4, m4a, webm
- avvio automatico systemd, bilanciamento del carico opzionale con nginx su più GPU
Multilingue, incluso switch tra Hindi e inglese per audio di call center.
Ricevi codice funzionante con commenti, documentazione di setup e una verifica sui tuoi campioni audio reali prima della consegna.
Contattami prima di ordinare se il tuo stack è particolare (air-gapped, multi-VM Proxmox, conformità specifica) così possiamo definirlo insieme.
Scopri di più su Mikaela C.
Quickbooks Online Bookkeeper, Administrative Assistant
- DaFilippine
- Membro daset 2025
Lingue
Inglese
Traduzione automatica.
FAQ
Traduzione automatica.
Perché preferire l'auto-ospitato invece di usare solo OpenAI o Deepgram?
Motivi regolamentari (HIPAA, GDPR, privilegio avvocato-cliente, dati KYC finanziari), costi su larga scala (oltre circa 1500 ore al mese è più economico auto-ospitato), e sensibilità IP. Se nessuno di questi si applica a te, le API cloud potrebbero essere davvero la scelta migliore e te lo dirò prima di ordinare.
Di quale hardware ho bisogno?
Minimo: qualsiasi server Linux con GPU NVIDIA e almeno 12GB di VRAM. Raccomandato: VRAM superiore a 16GB. Per alta concorrenza (oltre 30 chiamate simultanee), più GPU aiutano. Contattami con le specifiche hardware prima di ordinare e ti confermerò se il modello target è compatibile.
Può gestire audio non in inglese o con accenti?
Whisper large-v3 è davvero multilingue e gestisce lo switch tra Hindi e inglese comune negli audio di call center. La precisione reale varia con l'accento, il rumore di fondo e la densità di switch. Valido sempre sui tuoi campioni audio reali prima di dare una stima di accuratezza.
Come appare l'output dell'analisi e posso personalizzarlo?
L'output è in JSON strutturato. Campi predefiniti: sentiment generale, punti chiave, azioni, rischio di escalation, flag di conformità. Personalizzabile completamente per gig: dimmi quali campi vuoi estrarre e scriverò il prompt e lo schema per farlo. Esempio di output disponibile su richiesta.
Ho requisiti particolari (air-gapped, Proxmox VFIO, conformità specifica). Puoi gestirli?
Sì. Contattami prima di ordinare e descrivi la configurazione. Ho esperienza con passthrough GPU VFIO/IOMMU, deploy completamente offline e multi-VM. Definiremo insieme i dettagli e sceglieremo il livello giusto (di solito Premium per questi).

