Poznaj Eleven v4Poznaj Eleven v4, nasz najbardziej emocjonalny model. 3× więcej kredytów w planie Creator+ do 12 października

Przejdź do treści

API zamiany mowy na tekst

Transkrybuj mowę z ElevenLabs Scribe v2

Najdokładniejsze STT do dużych projektów. Wykrywa akcenty i efekty dźwiękowe, pozwala kierować transkrypcją za pomocą słów kluczowych.

Uh, hi! So, um, I was wondering if you wanted to meet up for coffee? Maybe tomorrow morning? [nervous laugh] Totally fine if not!

  • Lovable
  • Veed model
  • Synthesia
  • Stripe
  • Perplexity
  • Twilio

Najdokładniejsze Speech to Text API do dużych zadań

Twórz napisy, transkrypcje do podcastów, wideo, wywiadów i innych nagrań – wszystko z najwyższą dokładnością przez API.

Scribe v2 zapewnia czołową w branży dokładność transkrypcji i tworzy czysty, edytowalny tekst nawet przy trudnym audio i różnych akcentach.

Bezprecedensowa dokładność transkrypcji

Scribe v2 zapewnia czołową w branży dokładność transkrypcji i tworzy czysty, edytowalny tekst nawet przy trudnym audio i różnych akcentach.

Uh, hi! So, um, I was wondering if you wanted to meet up for coffee? Maybe tomorrow morning? [nervous laugh] Totally fine if not!

Do każdego scenariusza

Transkrypcja działająca w hałasie, z muzyką w tle, mocnymi akcentami i niską jakością audio.

Precyzyjna kontrola czasu, mówców i zdarzeń pozamownych.

ElevenLabs Transcription API wykrywa śmiech, emocje i efekty dźwiękowe. Użyj keyterm promptingu, aby kierować transkrypcją za pomocą terminów z danej dziedziny.

Transkrybuj audio i wideo

Przesyłaj MP3, MP4, WAV, MOV i inne popularne formaty. Scribe obsługuje pliki do 10 godzin, z przetwarzaniem asynchronicznym i powiadomieniami webhook dla dużych partii.
Transcription Formats

Czyste, edytowalne transkrypcje

Otrzymuj poprawnie interpunkcyjny tekst podzielony na akapity, gotowy do edycji, publikacji lub dalszego przetwarzania. Bez dodatkowego czyszczenia.
Editable transcripts

Podpowiedzi słów kluczowych

Zwiększ dokładność rozpoznawania nawet 100 terminów z danej dziedziny. Nazwy produktów, techniczny żargon i specjalistyczne słownictwo poprawnie zapisane za pierwszym razem.
Keyterm Prompting

Dynamiczne tagowanie audio

Wykrywaj zdarzenia pozamowne, takie jak śmiech, oklaski, muzyka i szum w tle. Transkrypcje zawierają pełny kontekst audio, nie tylko słowa.

Inteligentne rozpoznawanie mówców

Automatycznie rozpoznawaj i oznaczaj do 48 mówców. Jasno określ, kto co powiedział, w czytelnych transkrypcjach.

Wykrywanie encji

Automatycznie wykrywaj i oznaczaj 56 typów encji, w tym imiona, daty, lokalizacje i organizacje w transkrypcjach.

Transkrybuj audio kliniczne z Scribe v2 Medical

Model Speech to Text zoptymalizowany pod transkrypcję medyczną i workflow kliniczne, z lepszym rozpoznawaniem nazw leków oraz terminów anatomicznych i patologicznych.

Medication renewal message flags metformin 500mg and asks about continued levothyroxine.

Transkrypcja mowy klinicznej

Zamieniaj rozmowy lekarzy z pacjentami, dyktowanie lekarza i wywiady z pacjentami na precyzyjny tekst gotowy do sprawdzenia i użycia w notatkach, kodowaniu oraz dalszych procesach dokumentacyjnych.

Mniej błędów w terminach medycznych

W teście term-WER Scribe v2 Medical popełnia o 15% mniej błędów niż Scribe v2 w zestawie testowym Eka Medical ASR, lepiej rozpoznając terminy z zakresu słownictwa klinicznego.

Abstract gray textured background with soft diagonal light and dark bands.

Scribe v2

Najwyższa dokładność, do przetwarzania zbiorczego.

  • >95% dokładności
  • Ponad 90 języków
  • Wykrywanie zdarzeń pozamownych
  • Wykrywanie encji
  • Keyterm prompting
Abstract grayscale bands of soft light and shadow sweeping diagonally.

Scribe v2 Realtime

Najniższe opóźnienie, do zadań realtime.

  • Opóźnienie poniżej 150 ms
  • Ponad 90 języków
  • Streaming transkrypcji
  • Wykrywanie aktywności głosowej
  • Automatyczne rozpoznawanie języka
Abstract grayscale texture with diagonal streaks and a soft gradient from dark to light.

Scribe v2 Medical

Fine-tune medyczny, do transkrypcji klinicznej.

  • Dostosowanie słownictwa medycznego
  • Transkrypcja w ponad 90 językach
  • Taka sama skuteczność jak Scribe v2 dla zwykłej mowy
  • Lepsze rozpoznawanie nazw leków
  • Dostępne dla klientów Enterprise objętych HIPAA

Transkrybuj mowę w ponad 90 językach i wielu akcentach

Wyjątkowa dokładność dla akcentów, dialektów i różnych warunków nagrania.

Zmień languageCode, aby odsłuchać języki

import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";

const elevenlabs = new ElevenLabsClient({
	apiKey: "<your_api_key>"
});
const response = await fetch(
  "https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
);
const audioBlob = new Blob([await response.arrayBuffer()], { type: "audio/mp3" });

const transcription = await	elevenlabs
	.speechToText.convert({
	  file: audioBlob,
	  modelId: "scribe_v2",
	  tagAudioEvents: true,
	  languageCode: 
, // Ustaw język diarize: true }); console.log(transcription);
Flag for en
Angielski
Flag for zh
Chiński
Flag for es
Hiszpański
Flag for fr
Francuski
Flag for pt
Portugalski
Flag for de
Niemiecki
Flag for ja
Japoński
Flag for it
Włoski
Flag for hi
Hindi
Flag for en
AngielskiKliknij, aby zobaczyć podgląd

Wspieramy czołowe firmy i marki na świecie

  • “Od dubbingu Reels w lokalnych językach po generowanie muzyki i głosów postaci w Horizon — platforma ElevenLabs pozwala twórcom, firmom i przedsiębiorstwom z całego świata tworzyć na dużą skalę z wykorzystaniem głosu, muzyki i dźwięku.”
    Meta Color Logo
  • “Niezrównana dokładność Scribe w tak wielu językach pozwala Fieldy rozumieć każdą codzienną rozmowę i łatwo skalować działalność na innych kontynentach. Po przejściu na ElevenLabs Scribe Fieldy zwiększyło retencję użytkowników o 50%.”
    Fieldy logo
  • “ElevenLabs ułatwiło nam szybkie dodanie zaawansowanej funkcji zamiany tekstu na mowę do naszego SDK, dzięki czemu Agenci mogą odpowiadać w czasie rzeczywistym ekspresyjnymi głosami na pytania użytkowników lub przekazywać informacje o tym, co widzą.”
    Stream Color Logo
  • “Twilio zintegrowało technologię generatywnego głosu AI od ElevenLabs ze swoją platformą CPaaS, ulepszając ConversationRelay. Dzięki tej integracji firmy i deweloperzy mogą tworzyć konwersacyjne interakcje głosowe AI, które brzmią naturalnie, są ekspresyjne i odpowiadają w czasie rzeczywistym bezpośrednio z platformy Twilio CPaaS. W ElevenLabs cieszymy się, że Twilio wybrało ElevenLabs, by wzbogacić ConversationRelay o najbardziej ekspresyjne i naturalnie brzmiące głosy. ”
    Twilio logo

API gotowe do produkcji

Enterprise data protection developers

Dane są szyfrowane podczas przesyłania i przechowywania, z obsługą zgodności z SOC 2, HIPAA i RODO. Tryby EU Data Residency i Zero Retention zapewniają ściślejszą kontrolę nad danymi.

Dane są szyfrowane podczas przesyłania i przechowywania, z obsługą zgodności z SOC 2, HIPAA i RODO. Tryby EU Data Residency i Zero Retention zapewniają ściślejszą kontrolę nad danymi.

SDKs

Oficjalne SDK dla Pythona i TypeScript z bezpieczeństwem typów, obsługą streamingu i jasnymi przykładami.

Nasz zespół zapewnia sprawne uruchomienie i niezawodne działanie, dając stałą wydajność i spokój.

Najczęściej zadawane pytania

Najnowsze aktualizacje

    Najbardziej realistyczna platforma audio AI