Streaming lato client
Guida pratica · Presuppone che tu abbia completato la guida rapida di Speech to Text .
Panoramica
L’API Trascrizione vocale in tempo reale di ElevenLabs ti consente di trascrivere flussi audio in tempo reale con una latenza estremamente bassa usando il modello Scribe Realtime v2. Che tu stia creando assistenti vocali, servizi di trascrizione o qualsiasi applicazione che richieda il riconoscimento vocale in diretta, questa API basata su WebSocket fornisce trascrizioni parziali mentre parli e trascrizioni confermate quando i segmenti vocali sono completi.
Puoi implementare Scribe v2 Realtime lato client per trascrivere l’audio in tempo reale, tramite microfono o suddividendo manualmente l’audio in blocchi.
L’implementazione lato client differisce da quella lato server per alcuni aspetti:
- Richiede un token monouso: è un token temporaneo che può essere usato per connettersi all’API senza esporre la chiave API.
- L’audio dal microfono può essere inviato direttamente all’API per la trascrizione, senza doverlo suddividere manualmente in blocchi.
Per lo streaming dell’audio da un URL, consulta la guida Streaming lato server.
Guida rapida
Questa guida presuppone che tu abbia configurato la tua chiave API. Se non l’hai ancora fatto, completa prima la guida rapida.
Crea un token
Per usare l’SDK lato client, devi creare un token monouso. È un token temporaneo che può essere usato per connettersi all’API senza esporre la chiave API. Puoi farlo tramite l’API ElevenLabs lato server.
Non esporre mai la tua chiave API al client.
Un token monouso scade automaticamente dopo 15 minuti.
Avvia la sessione di trascrizione
Puoi eseguire la trascrizione tramite microfono oppure suddividendo manualmente il tuo audio in blocchi. Il tuo audio può essere un file o uno stream.
Per l’elenco completo dei parametri e delle opzioni supportati dall’API, consulta il Riferimento API.