Costruirò un agente Voice AI usando elevenlabs, stt e llm in python


Informazioni su questo servizio
Traduzione automatica.
Implementa un agente Voice AI intelligente che può ascoltare, ragionare e parlare in tempo reale.
Costruisco architetture personalizzate di Voice AI conversazionale in Python, combinando streaming audio a bassa latenza con LLM e sintesi vocale.
Ciò che consegno:
- Pipeline vocali end-to-end: Rilevamento attività vocale (VAD) + Whisper (STT) + ragionamento con LLM + ElevenLabs (TTS)
- Routing audio a latenza ultra-bassa tramite pipe Linux asincrone
- Integrazione chiamate vocali Telegram tramite Pyrogram
- Deployment su GPU cloud (worker container RunPod, elaborazione in coda parallela, scalabilità dinamica)
- Backend modulare in Python con cattura e sintesi audio isolate
Stack: Python, asyncio, ElevenLabs, Whisper, GPU di RunPod, Pyrogram.
Contattami prima di ordinare per verificare le credenziali API e i requisiti di latenza vocale.
Scopri di più su Moddie
Fullstack web developer
- DaUcraina
- Membro daott 2024
- Tempo di risposta medio1 ora
Lingue
Ucraino, Russo, Inglese
Traduzione automatica.
Il mio portfolio
FAQ
Traduzione automatica.
Come ottieni una bassa latenza nella sintesi vocale?
Trasmetto i chunk audio tramite pipe Linux asincrone direttamente al lettore senza salvare file audio temporanei su disco, riducendo la latenza sotto i 600ms
Questo agente vocale può effettuare chiamate telefoniche o Telegram?
Sì, posso integrare l'agente con chiamate vocali Telegram tramite Pyrogram o API di telefonia esterne (Twilio/LiveKit)

