API zamiany mowy na tekst
Transkrybuj mowę z ElevenLabs Scribe v2
Najdokładniejsze STT do dużych projektów. Wykrywa akcenty i efekty dźwiękowe, pozwala kierować transkrypcją za pomocą słów kluczowych.
- Lovable
- Veed model
- Synthesia
- Stripe
- Perplexity
- Twilio
Najdokładniejsze Speech to Text API do dużych zadań
Twórz napisy, transkrypcje do podcastów, wideo, wywiadów i innych nagrań – wszystko z najwyższą dokładnością przez API.
Bezprecedensowa dokładność transkrypcji
Scribe v2 zapewnia czołową w branży dokładność transkrypcji i tworzy czysty, edytowalny tekst nawet przy trudnym audio i różnych akcentach.
Do każdego scenariusza
Transkrypcja działająca w hałasie, z muzyką w tle, mocnymi akcentami i niską jakością audio.
Precyzyjna kontrola czasu, mówców i zdarzeń pozamownych.
ElevenLabs Transcription API wykrywa śmiech, emocje i efekty dźwiękowe. Użyj keyterm promptingu, aby kierować transkrypcją za pomocą terminów z danej dziedziny.
Transkrybuj audio i wideo
.webp&w=3840&q=95)
Czyste, edytowalne transkrypcje
.webp&w=3840&q=95)
Podpowiedzi słów kluczowych

Dynamiczne tagowanie audio
Wykrywaj zdarzenia pozamowne, takie jak śmiech, oklaski, muzyka i szum w tle. Transkrypcje zawierają pełny kontekst audio, nie tylko słowa.
Inteligentne rozpoznawanie mówców
Automatycznie rozpoznawaj i oznaczaj do 48 mówców. Jasno określ, kto co powiedział, w czytelnych transkrypcjach.
Wykrywanie encji
Automatycznie wykrywaj i oznaczaj 56 typów encji, w tym imiona, daty, lokalizacje i organizacje w transkrypcjach.
Transkrybuj audio kliniczne z Scribe v2 Medical
Model Speech to Text zoptymalizowany pod transkrypcję medyczną i workflow kliniczne, z lepszym rozpoznawaniem nazw leków oraz terminów anatomicznych i patologicznych.

Transkrypcja mowy klinicznej
Zamieniaj rozmowy lekarzy z pacjentami, dyktowanie lekarza i wywiady z pacjentami na precyzyjny tekst gotowy do sprawdzenia i użycia w notatkach, kodowaniu oraz dalszych procesach dokumentacyjnych.

Mniej błędów w terminach medycznych
W teście term-WER Scribe v2 Medical popełnia o 15% mniej błędów niż Scribe v2 w zestawie testowym Eka Medical ASR, lepiej rozpoznając terminy z zakresu słownictwa klinicznego.

Scribe v2
Najwyższa dokładność, do przetwarzania zbiorczego.
- >95% dokładności
- Ponad 90 języków
- Wykrywanie zdarzeń pozamownych
- Wykrywanie encji
- Keyterm prompting

Scribe v2 Realtime
Najniższe opóźnienie, do zadań realtime.
- Opóźnienie poniżej 150 ms
- Ponad 90 języków
- Streaming transkrypcji
- Wykrywanie aktywności głosowej
- Automatyczne rozpoznawanie języka

Scribe v2 Medical
Fine-tune medyczny, do transkrypcji klinicznej.
- Dostosowanie słownictwa medycznego
- Transkrypcja w ponad 90 językach
- Taka sama skuteczność jak Scribe v2 dla zwykłej mowy
- Lepsze rozpoznawanie nazw leków
- Dostępne dla klientów Enterprise objętych HIPAA
Transkrybuj mowę w ponad 90 językach i wielu akcentach
Wyjątkowa dokładność dla akcentów, dialektów i różnych warunków nagrania.
Zmień languageCode, aby odsłuchać języki
import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";
const elevenlabs = new ElevenLabsClient({
apiKey: "<your_api_key>"
});
const response = await fetch(
"https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
);
const audioBlob = new Blob([await response.arrayBuffer()], { type: "audio/mp3" });
const transcription = await elevenlabs
.speechToText.convert({
file: audioBlob,
modelId: "scribe_v2",
tagAudioEvents: true,
languageCode: , // Ustaw język
diarize: true
});
console.log(transcription);

