Streaming lato server
Guida pratica · Presuppone che tu abbia completato la guida rapida a Speech to Text.
Panoramica
L’API Trascrizione vocale in tempo reale di ElevenLabs ti consente di trascrivere stream audio in tempo reale con latenza ultra-ridotta usando il modello Scribe Realtime v2. Che tu stia creando assistenti vocali, servizi di trascrizione o qualsiasi applicazione che richieda il riconoscimento vocale in diretta, questa API basata su WebSocket fornisce trascrizioni parziali mentre parli e trascrizioni confermate quando i segmenti vocali sono completi.
Scribe v2 Realtime può essere implementato lato server per trascrivere l’audio in tempo reale, tramite URL, file o il tuo stream audio.
L’implementazione lato server differisce da quella lato client per alcuni aspetti:
- Usa una chiave API ElevenLabs anziché un token monouso.
- Supporta lo streaming diretto da un URL, senza dover suddividere manualmente l’audio in chunk.
Per lo streaming audio direttamente dal microfono, consulta la guida allo streaming lato client.
Guida rapida
Questa guida presuppone che tu abbia configurato la chiave API e l’SDK. Se non l’hai ancora fatto, completa prima la guida rapida.
Configura l'SDK
L’SDK offre due modi per trascrivere l’audio in tempo reale: streaming da un URL oppure suddivisione manuale dell’audio in chunk da un file o dal tuo stream audio.
Per l’elenco completo dei parametri e delle opzioni supportati dall’API, consulta il riferimento API.
Streaming da URL
Suddivisione manuale dell'audio in chunk
Questo esempio mostra come eseguire lo streaming di un file audio da un URL usando l’SDK ufficiale.
Lo strumento ffmpeg è obbligatorio per lo streaming da un URL. Visita il sito web per le istruzioni di installazione.
Crea un nuovo file denominato example.py o example.mts, in base al linguaggio scelto, e aggiungi il codice seguente: