Hoppa till navigering

Snabbstart för Speech to Text

Lär dig hur du omvandlar talat ljud till text.

Den här guiden visar hur du omvandlar talat ljud till text med Speech to Text API:t.

Använd ElevenLabs tal-till-text-skill för att transkribera ljud från din AI-kodningsassistent:

npx skills add elevenlabs/skills --skill speech-to-text

Den här handledningen visar hur du använder batch-API:t för Speech to Text. För en guide om hur du använder API:t för Speech to Text i realtid, se guiderna för streaming på klientsidan eller streaming på serversidan.

Använda Speech to Text API:t

1

Skapa en API-nyckel

Skapa en API-nyckel i kontrollpanelen här, som du använder för att säkert få åtkomst till API:et.

Spara nyckeln som en hanterad hemlighet och skicka den till SDK:erna antingen som en miljövariabel via en .env-fil eller direkt i appens konfiguration, beroende på vad du föredrar.

.env
ELEVENLABS_API_KEY=<your_api_key_here>
2

Installera SDK:t

Vi använder också biblioteket dotenv för att läsa in vår API-nyckel från en miljövariabel.

pip install elevenlabs
pip install python-dotenv
3

Gör API-begäran

Skapa en ny fil med namnet example.py eller example.mts, beroende på vilket språk du väljer, och lägg till följande kod:

# example.py
import os
from dotenv import load_dotenv
from io import BytesIO
import requests
from elevenlabs.client import ElevenLabs
load_dotenv()
elevenlabs = ElevenLabs(
api_key=os.getenv("ELEVENLABS_API_KEY"),
)
audio_url = (
"https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
)
response = requests.get(audio_url)
audio_data = BytesIO(response.content)
transcription = elevenlabs.speech_to_text.convert(
file=audio_data,
model_id="scribe_v2", # Model to use
tag_audio_events=True, # Tag audio events like laughter, applause, etc.
language_code="eng", # Language of the audio file. If set to None, the model will detect the language automatically.
diarize=True, # Whether to annotate who is speaking
)
print(transcription)

Kör sedan den:

python example.py

Du bör se transkriberingen av ljudfilen skrivas ut i konsolen.

För medicinskt och kliniskt ljud anger du model_id till scribe_v2_medical. Begärans format är detsamma som för scribe_v2 och debiteras enligt samma pris. Se Scribe v2 Medical.

Nästa steg