Modifica della trascrizione
Guida pratica · Presuppone che tu abbia completato la guida rapida di Speech to Text .
Panoramica
La modifica della trascrizione è una funzionalità sperimentale e comporta un costo aggiuntivo del 30% rispetto al costo base della trascrizione, fatturato per un minimo di 10 secondi di audio per richiesta. Consulta la pagina dei prezzi delle API per informazioni dettagliate sui prezzi.
La modifica della trascrizione ti consente di allegare un’istruzione in linguaggio naturale a una richiesta di trascrizione. Dopo che l’audio è stato trascritto, l’istruzione viene applicata alla trascrizione e il testo modificato viene restituito insieme all’originale.
Questo sostituisce una fase di post-elaborazione separata nella tua pipeline. Gli utilizzi tipici includono la normalizzazione della scrittura di date, orari o unità, l’espansione delle abbreviazioni, la rimozione di contenuti non necessari, l’applicazione di uno stile o tono diverso oppure la riformattazione della trascrizione.
Ad esempio, la trascrizione di un messaggio vocale con l’istruzione Write all dates in ISO 8601 format (YYYY-MM-DD) restituisce entrambe le versioni del testo:
I campi text e words descrivono sempre la trascrizione originale. La versione modificata viene restituita separatamente in edited_transcript.
Integrare la modifica della trascrizione
La modifica della trascrizione è integrata nell’API Speech to Text passando il parametro transcript_edit al metodo convert. L’istruzione può contenere fino a 2000 caratteri.
La modifica della trascrizione funziona sia con richieste sincrone sia con richieste webhook. Per le richieste webhook, edited_transcript è incluso nell’oggetto transcription del payload del webhook.
Scribe v2 Realtime supporta le stesse istruzioni per ogni trascrizione confermata. Consulta la guida alla modifica delle trascrizioni in tempo reale.
Scrivere istruzioni
L’istruzione viene applicata all’intera trascrizione ovunque sia pertinente e ogni occorrenza corrispondente viene modificata, non solo la prima. Un’istruzione può modificare parole o frasi specifiche lasciando invariato tutto il resto, oppure può riscrivere o annotare il testo completo. Una singola istruzione può combinare più modifiche.
I seguenti esempi illustrano la gamma di istruzioni supportate:
Alcune modifiche dispongono di parametri dedicati più economici e prevedibili di un’istruzione di
modifica. Usa il keyterm
prompting per orientare il
riconoscimento verso nomi e termini specifici, no_verbatim per rimuovere parole riempitive e
disfluenze e numbers_format (dove supportato) per scegliere tra cifre e parole. Riserva la
modifica della trascrizione ai cambiamenti che queste opzioni non coprono.
Tieni presente quanto segue quando scrivi le istruzioni:
- Sii esplicito sul risultato desiderato.
Write all dates in ISO 8601 format (YYYY-MM-DD)è più affidabile difix the dates. - L’istruzione può essere scritta in qualsiasi lingua, anche se quelle scritte in inglese funzionano meglio. La trascrizione modificata rimane nella lingua dell’originale.
- Viene eseguita solo l’istruzione. Il contenuto pronunciato nell’audio viene trattato come dati e non può modificare l’applicazione dell’istruzione.
- Se l’istruzione non influisce su nulla nella trascrizione, la trascrizione modificata è identica all’originale.
Formato della risposta
Quando è impostato transcript_edit, la risposta contiene un oggetto edited_transcript. Il campo kind indica se la modifica è riuscita:
Il campo è assente quando non è stato richiesto transcript_edit.
Comportamenti da tenere presenti:
- La trascrizione modificata è testo semplice. I timestamp a livello di parola, le etichette dei parlanti e
additional_formatscontinuano a descrivere la trascrizione originale. - La modifica viene eseguita dopo il completamento della trascrizione, quindi aggiunge una latenza che aumenta con la lunghezza della trascrizione.
- Il supplemento viene applicato alla durata audio della richiesta, con un minimo di 10 secondi fatturati per richiesta.
La modifica della trascrizione non può essere combinata con entity_detection, entity_redaction o
use_multi_channel. Le richieste che li combinano vengono rifiutate con un errore di parametri non validi.