Costruirò un'API di trascrizione whisper per il tuo prodotto


Informazioni su questo servizio
Traduzione automatica.
Ho creato una pipeline di voce in streaming end-to-end: speech to text con Whisper, text to speech con ElevenLabs, funzionante su AWS Bedrock con memoria delle conversazioni.
La maggior parte dei servizi di trascrizione si limitano a incapsulare l'API e basta. Le parti difficili arrivano dopo: file lunghi che scadono, latenza che si sente in una chiamata in diretta, separazione dei parlanti e una fattura che cresce più velocemente del tuo utilizzo.
Ciò che ottieni:
- Trascrizione Whisper con timestamp e rilevamento della lingua
- Streaming, così il testo arriva mentre l'audio è ancora in riproduzione
- Coda e riprove per file lunghi o falliti
- Registrazione dei costi per minuto di audio
Il mio background è nelle telecomunicazioni. Ho un Master in Reti di Informazione dall'Odessa National Academy of Telecommunications e una certificazione CCNA, e ho lavorato su una piattaforma industriale VoIP 5G presso Siemens con crittografia end-to-end in un team di 45-50 persone.
Lavoro dall'Ucraina in CET.
Dimmi il volume del tuo audio e il target di latenza e ti dirò cosa è realistico prima di ordinare.
Scopri di più su Michael S.
CTO and AI Developer, 18 Years: LangChain, RAG, Voice AI, Python Backends
- DaUcraina
- Membro dafeb 2023
- Tempo di risposta medio1 ora
Lingue
Russo, Ucraino, Inglese, Tedesco
Traduzione automatica.
Il mio portfolio
FAQ
Traduzione automatica.
Quale motore di speech-to-text usi?
Di default Whisper, perché gestisce bene accenti e rumore di fondo. Lavoro anche con alternative come Deepgram o AssemblyAI se il tuo progetto già utilizza uno di loro, o se hanno una funzione che coprono meglio.
Supporti trascrizione in tempo reale o in streaming?
Sì, dal pacchetto Standard. Il testo arriva mentre l'audio è ancora in riproduzione, invece di dover aspettare che il file finisca per vedere qualcosa.
Quali lingue sono supportate?
Whisper supporta decine di lingue già pronta, incluso il rilevamento automatico della lingua. Mandami le lingue di destinazione e ti confermerò la copertura e segnalerò eventuali compromessi sulla precisione prima di ordinare.
Puoi aggiungere text-to-speech, così la mia app può parlare indietro?
Sì, nel pacchetto Premium. Abbino la trascrizione con ElevenLabs per un output vocale naturale, così ottieni un pipeline completa di speech-in e speech-out, non solo trascrizione.
Come gestisci file audio lunghi o falliti?
I file lunghi entrano in una coda con riprove dal pacchetto Standard in su, così un job lento o fallito non blocca gli altri caricamenti o fa scadere la richiesta.
Può funzionare sul mio server o account cloud?
Sì. Nel pacchetto Premium deployo la pipeline nel tuo ambiente AWS o Azure, così audio e infrastruttura restano sotto il tuo controllo.
Come si calcolano i costi e posso tenerli sotto controllo?
Registrò il costo per minuto di audio processato in ogni pacchetto, così puoi vedere esattamente quanto costa ogni richiesta invece di essere sorpreso dalla bolletta mensile.
