Scribe v2 Medical jest już dostępny dla wszystkich
- Autor
- Min Kim
- Opublikowano
- Ostatnia aktualizacja
PosłuchajPosłuchaj tego artykułu
Audio kliniczne to jeden z najtrudniejszych testów dokładnego rozpoznawania mowy. Nazwy leków są długie, rzadkie i łatwo je pomylić (hydroksyzynę i hydralazynę różni jedna źle usłyszana sylaba). Słownictwo jest gęste — dawki, jednostki oraz terminy anatomiczne i patologiczne mogą padać szybko, jeden po drugim. Stawka jest też wyższa, bo błąd w transkrypcji może trafić do dokumentacji pacjenta.
Dlatego ElevenLabs udostępnia dziś Scribe v2 Medical, nasz model Speech to Text dostrojony do audio klinicznego, który jest teraz powszechnie dostępny w ElevenAPI. We wszystkich przedstawionych niżej testach osiąga jeden z najniższych wskaźników błędów słów (WER) spośród porównywanych modeli i zmniejsza WER dla audio klinicznego o około 35% względem naszego bazowego modelu Scribe v2.
Modele ogólnego przeznaczenia świetnie radzą sobie z codzienną mową, ale ich jakość może spadać tam, gdzie workflow kliniczne najbardziej ich potrzebują. Wytrenowaliśmy medyczną wersję Scribe v2, skupioną na nazwach leków i dyktowaniu klinicznym, na publicznych benchmarkach, które każdy może odtworzyć.
Scribe v2 Medical zoptymalizowany pod kątem zastosowań klinicznych
Dyktowanie kliniczne (MedDictate)
MedDictate Corti testuje transkrypcję dyktowanych notatek klinicznych zawierających następujące po sobie nazwy leków, dawki i jednostki po angielsku, francusku i niemiecku. W naszym teście Scribe v2 Medical osiąga najniższy łączny WER spośród sprawdzonych modeli oraz WER o około 35% niższy niż bazowy Scribe v2.
Model | EN | FR | DE | Łączny WER |
Scribe v2 Medical | 3.0% | 8.3% | 7.2% | 4.9% |
OpenAI GPT Transcribe | 3.9% | 7.8% | 9.6% | 5.9% |
Scribe v2 (bazowy) | 5.0% | 10.7% | 11.7% | 7.6% |
Muse Voice Transcribe 1.0 | 4.5% | 11.0% | 13.3% | 7.8% |
Deepgram Nova-3 Medical* | 5.5% | - | - | - |
*Tylko angielski (24 nagrania) — Deepgram Nova-3 Medical nie obsługuje francuskiego ani niemieckiego.
Terminologia medyczna (MedTerm)
MedTerm to również zbiór danych opublikowany przez Corti. Zawiera benchmark terminologii klinicznej z 600 próbkami w tych samych trzech językach, z oznaczonymi terminami medycznymi w każdej próbce. Dzięki tym oznaczeniom można oceniać modele w dwóch wymiarach wykraczających poza WER całej transkrypcji. Recall terminów to odsetek oznaczonych terminów medycznych, które poprawnie pojawiają się w transkrypcji (więcej znaczy lepiej). Term-WER to wskaźnik błędów wyłącznie dla tych terminów, bez zwykłej mowy wokół nich (mniej znaczy lepiej).
Scribe v2 Medical prowadzi w obu wymiarach wśród wszystkich testowanych modeli oraz przed każdym innym dostawcą we wszystkich trzech językach:
Model | Recall terminów ↑ | Term-WER ↓ |
Scribe v2 Medical | 77.7% | 10.4% |
Scribe v2 (bazowy) | 77.1% | 10.7% |
OpenAI GPT Transcribe | 74.0% | 12.3% |
Muse Voice Transcribe 1.0 | 73.4% | 12.9% |
Deepgram Nova-3 Medical* | 72.5% | 13.6% |
Benchmark Eka Medical ASR
Benchmark Eka Medical ASR zawiera 3619 angielskich próbek audio klinicznego — od pojedynczych nazw leków i schorzeń, przez zdania kliniczne, po rozmowy lekarzy z pacjentami — z oznaczeniami każdego terminu i opublikowanym rankingiem na karcie zbioru danych.
Ponieważ opublikowany zbiór danych obejmuje starsze modele, takie jak Gemini 2.5 Flash i GPT-4o, przeprowadziliśmy test z nowszymi modelami. SemWER (semantyczny WER) sprawdza, czy model usłyszał właściwą treść niezależnie od formatu („mg” i „miligramy” liczą się jako ta sama odpowiedź), a kwWER (WER słów kluczowych) stosuje tę samą ocenę tylko do oznaczonych medycznych słów kluczowych.
Model | semWER | kwWER |
Scribe v2 Medical | 6.50% | 6.02% |
Scribe v2 (bazowy) | 7.35% | 7.04% |
Deepgram Nova-3 Medical | 7.79% | 7.65% |
Muse Voice Transcribe 1.0 | 8.85% | 8.99% |
OpenAI GPT Transcribe | 13.90% | 13.20% |
Eka oznacza terminy medyczne w każdej próbce, co pozwala dokładniej ocenić przewagę Scribe v2 Medical nad wersją bazową wyłącznie dla terminów medycznych. Scribe v2 Medical popełnia o 15% mniej błędów niż wersja bazowa (9,5% vs 11,1%), a największa poprawa występuje, gdy terminy pojawiają się w pełnych zdaniach klinicznych (7,5% vs 9,9%).

Te same dane pokazują jednak, że izolowane nagrania pojedynczych słów — sama nazwa leku wypowiedziana bez kontekstu — pozostają najtrudniejszym przypadkiem dla każdego modelu w rankingu, w tym Scribe v2 Medical. Model osiągnął 14,3% WER dla izolowanych terminów, wobec 7,5%, gdy pojawiają się w zdaniach. Bez żadnego kontekstu źle usłyszana sylaba może prowadzić do pamiętnych błędów:
- etodolac (NLPZ) → „It'll do the luck”
- levomilnacipran (lek przeciwdepresyjny) → „Leave me alone now, Sephora.”
- methdilazine (lek przeciwhistaminowy) → „Let's play our scene.”
Jednym ze sposobów na ograniczenie tych błędów jest keyterm prompting, które pozwala wyróżnić nazwy leków lub wyrażenia medyczne, aby zwiększyć szansę, że model poprawnie je przetranskrybuje.
Klienci w produkcji
Klienci już używają Scribe v2 Medical w produkcji i widzą poprawę w audio klinicznym.
„Od kiedy przeszliśmy z Deepgram na ElevenLabs Scribe v2 Medical, widzimy znacznie wyższą dokładność w terminologii klinicznej, co zmieniło sposób pracy zespołu” — mówi Mendel Erlenwein, CEO i założyciel CareCo. „Gdy nasi koordynatorzy ufają transkrypcjom, mogą spędzać mniej czasu na poprawianiu notatek, a więcej na rozmowach telefonicznych z pacjentami. Nasi pacjenci stosują złożone schematy leczenia, więc notatka czytana przez zespół opieki musi być poprawna.”
Dobra jakość także dla ogólnej mowy
Zespół potwierdził też, że dostrojenie medyczne nie obniża jakości w innych obszarach. Na 6000 próbek codziennej, niemedycznej mowy pochodzących z Common Voice Scribe v2 Medical osiąga po zaokrągleniu ten sam wynik co bazowy Scribe v2: w obu przypadkach WER wynosi 5,3%. Z v2 Medical zyskujesz więc zalety wyspecjalizowanego modelu medycznego bez utraty dokładności w tym benchmarku.
Stworzony z myślą o chronionych danych zdrowotnych
Scribe v2 Medical kwalifikuje się do HIPAA dla klientów Enterprise z zawartą umową Business Associate Agreement i włączonym Zero Retention Mode (ZRM).
Gdy ZRM jest włączony dla żądań API Speech to Text, wejściowe audio i wyjściowy tekst są usuwane natychmiast po zakończeniu każdego żądania. ElevenLabs nie przechowuje żadnego z nich, a twoja aplikacja otrzymuje pełną odpowiedź API i decyduje, jak przechowywać transkrypcje.
Pierwsze kroki
Scribe v2 Medical jest dostępny w Speech to Text API. Wystarczy przekazać nowy identyfikator modelu: scribe_v2_medical
Model działa na wsadowym endpointcie Speech to Text.



