Scribe v2 Medical är nu tillgängligt för alla
- Skriven av
- Min Kim
- Publicerad
- Senast uppdaterad
LyssnaLyssna på den här artikeln
Kliniskt ljud är ett av de svåraste testen för korrekt taligenkänning. Läkemedelsnamn är långa, ovanliga och lätta att förväxla (hydroxizin och hydralazin skiljs åt av en enda felhörd stavelse). Ordförrådet är tätt, med doser, enheter samt anatomiska och patologiska termer som kan komma i snabb följd. Insatserna är också högre eftersom ett transkriptionsfel kan hamna i en patients journal.
Därför lanserar ElevenLabs idag Scribe v2 Medical, vår Speech to Text-modell finjusterad för kliniskt ljud, som nu är allmänt tillgänglig på ElevenAPI. I utvärderingarna nedan har den konsekvent en av de lägsta felfrekvenserna på ordnivå (WER) bland modellerna som jämförs, och minskar WER för kliniskt ljud med omkring 35 % jämfört med vår basmodell Scribe v2.
Modeller för allmänna ändamål är bra på vardagligt tal, men kan prestera sämre där kliniska arbetsflöden behöver dem som mest. Vi har tränat en medicinsk finjustering av Scribe v2 med fokus på läkemedelsnamn och klinisk diktering, baserat på offentliga riktmärken som vem som helst kan återskapa.
Scribe v2 Medical är optimerad för kliniska användningsområden
Klinisk diktering (MedDictate)
Cortis MedDictate testar transkribering av dikterade kliniska anteckningar, som innehåller läkemedelsnamn, doser och enheter i tät följd på engelska, franska och tyska. I vår utvärdering har Scribe v2 Medical den lägsta totala WER:en bland modellerna vi testade, och en cirka 35 % lägre WER än basmodellen Scribe v2.
Modell | EN | FR | DE | Total WER |
Scribe v2 Medical | 3.0% | 8.3% | 7.2% | 4.9% |
OpenAI GPT Transcribe | 3.9% | 7.8% | 9.6% | 5.9% |
Scribe v2 (bas) | 5.0% | 10.7% | 11.7% | 7.6% |
Muse Voice Transcribe 1.0 | 4.5% | 11.0% | 13.3% | 7.8% |
Deepgram Nova-3 Medical* | 5.5% | - | - | - |
*Endast engelska (24 klipp) – Deepgram Nova-3 Medical har inte stöd för franska eller tyska.
Medicinsk terminologi (MedTerm)
MedTerm är också en dataset som publicerats av Corti och innehåller ett riktmärke för klinisk terminologi med 600 exempel på samma tre språk, där de medicinska termerna i varje exempel har annoterats. Annoteringarna gör det möjligt att bedöma modeller utifrån två dimensioner utöver WER för hela transkriptionen. Termåterkallelse är andelen annoterade medicinska termer som förekommer korrekt i transkriptionen (högre är bättre). Term-WER är felfrekvensen för enbart dessa termer, utan hänsyn till det vanliga talet runt dem (lägre är bättre).
Scribe v2 Medical leder bland alla testade modeller i båda dimensionerna och leder alla andra leverantörer på samtliga tre språk:
Modell | Termåterkallelse ↑ | Term-WER ↓ |
Scribe v2 Medical | 77.7% | 10.4% |
Scribe v2 (bas) | 77.1% | 10.7% |
OpenAI GPT Transcribe | 74.0% | 12.3% |
Muse Voice Transcribe 1.0 | 73.4% | 12.9% |
Deepgram Nova-3 Medical* | 72.5% | 13.6% |
Eka Medical ASR-riktmärke
Eka Medical ASR-riktmärket innehåller 3 619 engelska kliniska ljudexempel — med enskilda namn på läkemedel och tillstånd, kliniska meningar och samtal mellan vårdpersonal och patienter — med annoteringar per term och en publicerad topplista på datasetsidan.
Eftersom den publicerade datamängden innehåller äldre modeller som Gemini 2.5 Flash och GPT-4o körde vi utvärderingen mot nyare modeller. SemWER (semantisk WER) bedömer om modellen uppfattade rätt innehåll, oavsett formatering (”mg” och ”milligram” räknas som samma svar), och kwWER (WER för nyckelord) tillämpar samma bedömning enbart på de annoterade medicinska nyckelorden.
Modell | semWER | kwWER |
Scribe v2 Medical | 6.50% | 6.02% |
Scribe v2 (bas) | 7.35% | 7.04% |
Deepgram Nova-3 Medical | 7.79% | 7.65% |
Muse Voice Transcribe 1.0 | 8.85% | 8.99% |
OpenAI GPT Transcribe | 13.90% | 13.20% |
Eka annoterar de medicinska termerna i varje exempel, vilket gör det möjligt att mer detaljerat bedöma förbättringarna för Scribe v2 Medical jämfört med basmodellen enbart för de medicinska termerna. Scribe v2 Medical gör 15 % färre fel än basmodellen (9,5 % jämfört med 11,1 %), och förbättringarna är störst när termerna förekommer i hela kliniska meningar (7,5 % jämfört med 9,9 %).

En begränsning i samma data är att enskilda klipp med ett enda ord (ett ensamt läkemedelsnamn som sägs utan omgivande sammanhang) fortfarande är det svåraste fallet för alla modeller på topplistan, även Scribe v2 Medical. Den fick 14,3 % WER för isolerade termer, jämfört med 7,5 % när termerna förekommer i meningar. Utan något sammanhang kan en felhörd stavelse leda till minnesvärda missar:
- etodolac (ett NSAID-läkemedel) → ”It'll do the luck”
- levomilnacipran (ett antidepressivt läkemedel) → ”Leave me alone now, Sephora.”
- methdilazine (ett antihistamin) → ”Let's play our scene.”
Ett sätt att minska dessa fel är med keyterm prompting, som låter dig lyfta fram läkemedelsnamn eller medicinska fraser för att styra modellen mot att transkribera dem korrekt.
Kunder i produktion
Kunder använder redan Scribe v2 Medical i produktion och ser förbättringar för kliniskt ljud.
”Sedan vi bytte från Deepgram till ElevenLabs Scribe v2 Medical har vi sett betydligt högre träffsäkerhet för klinisk terminologi, och det har förändrat hur teamet arbetar”, säger Mendel Erlenwein, VD och grundare av CareCo. ”När våra samordnare litar på transkriptionerna kan de lägga mindre tid på att rätta anteckningar och mer tid på att prata med patienter i telefon. Våra patienter har komplicerade behandlingsregimer, och anteckningen som vårdteamet läser måste vara korrekt.”
Stark prestanda för allmänt tal
Teamet har också verifierat att den medicinska finjusteringen inte försämrar prestandan inom andra områden. På 6 000 exempel av vardagligt, icke-medicinskt tal från Common Voice har Scribe v2 Medical samma resultat som basmodellen Scribe v2 vid avrundning: 5,3 % WER i båda fallen. Med v2 Medical får du alltså fördelarna med en specialiserad medicinsk modell utan att ge upp precisionen i detta riktmärke.
Utvecklad för skyddad hälsoinformation
Scribe v2 Medical uppfyller kraven för HIPAA för företagskunder som har Business Associate Agreements på plats och har Zero Retention Mode (ZRM) aktiverat.
När ZRM är aktiverat för förfrågningar till Speech to Text API raderas ljudinmatning och textutdata direkt när varje förfrågan har slutförts. ElevenLabs lagrar ingendera, och din applikation får hela API-svaret och styr hur transkriptioner sparas.
Kom igång
Scribe v2 Medical är tillgänglig i Speech to Text API. Skicka bara med det nya modell-id:t: scribe_v2_medical
Modellen körs på batchslutpunkten för Speech to Text.



