Vi presenterar Eleven v4Möt Eleven v4, vår mest uttrycksfulla modell hittills. Med 3× fler krediter inkluderade i Creator+ till och med den 12 oktober

Hoppa till innehållet

Scribe v2 Medical är nu tillgängligt för alla

Skriven av
Min Kim
Publicerad
Senast uppdaterad

LyssnaLyssna på den här artikeln

Kliniskt ljud är ett av de svåraste testen för korrekt taligenkänning. Läkemedelsnamn är långa, ovanliga och lätta att förväxla (hydroxizin och hydralazin skiljs åt av en enda felhörd stavelse). Ordförrådet är tätt, med doser, enheter samt anatomiska och patologiska termer som kan komma i snabb följd. Insatserna är också högre eftersom ett transkriptionsfel kan hamna i en patients journal. 

Därför lanserar ElevenLabs idag Scribe v2 Medical, vår Speech to Text-modell finjusterad för kliniskt ljud, som nu är allmänt tillgänglig på ElevenAPI. I utvärderingarna nedan har den konsekvent en av de lägsta felfrekvenserna på ordnivå (WER) bland modellerna som jämförs, och minskar WER för kliniskt ljud med omkring 35 % jämfört med vår basmodell Scribe v2.

Modeller för allmänna ändamål är bra på vardagligt tal, men kan prestera sämre där kliniska arbetsflöden behöver dem som mest. Vi har tränat en medicinsk finjustering av Scribe v2 med fokus på läkemedelsnamn och klinisk diktering, baserat på offentliga riktmärken som vem som helst kan återskapa.

Scribe v2 Medical är optimerad för kliniska användningsområden

Klinisk diktering (MedDictate)

Cortis MedDictate testar transkribering av dikterade kliniska anteckningar, som innehåller läkemedelsnamn, doser och enheter i tät följd på engelska, franska och tyska. I vår utvärdering har Scribe v2 Medical den lägsta totala WER:en bland modellerna vi testade, och en cirka 35 % lägre WER än basmodellen Scribe v2.

Modell

EN

FR

DE

Total WER

Scribe v2 Medical

3.0%

8.3%

7.2%

4.9%

OpenAI GPT Transcribe

3.9%

7.8%

9.6%

5.9%

Scribe v2 (bas)

5.0%

10.7%

11.7%

7.6%

Muse Voice Transcribe 1.0

4.5%

11.0%

13.3%

7.8%

Deepgram Nova-3 Medical*

5.5%

-

-

-

*Endast engelska (24 klipp) – Deepgram Nova-3 Medical har inte stöd för franska eller tyska.

Medicinsk terminologi (MedTerm)

MedTerm är också en dataset som publicerats av Corti och innehåller ett riktmärke för klinisk terminologi med 600 exempel på samma tre språk, där de medicinska termerna i varje exempel har annoterats. Annoteringarna gör det möjligt att bedöma modeller utifrån två dimensioner utöver WER för hela transkriptionen. Termåterkallelse är andelen annoterade medicinska termer som förekommer korrekt i transkriptionen (högre är bättre). Term-WER är felfrekvensen för enbart dessa termer, utan hänsyn till det vanliga talet runt dem (lägre är bättre).

Scribe v2 Medical leder bland alla testade modeller i båda dimensionerna och leder alla andra leverantörer på samtliga tre språk:

Modell

Termåterkallelse ↑

Term-WER ↓

Scribe v2 Medical

77.7%

10.4%

Scribe v2 (bas)

77.1%

10.7%

OpenAI GPT Transcribe

74.0%

12.3%

Muse Voice Transcribe 1.0

73.4%

12.9%

Deepgram Nova-3 Medical*

72.5%

13.6%

Eka Medical ASR-riktmärke

Eka Medical ASR-riktmärket innehåller 3 619 engelska kliniska ljudexempel — med enskilda namn på läkemedel och tillstånd, kliniska meningar och samtal mellan vårdpersonal och patienter — med annoteringar per term och en publicerad topplista på datasetsidan. 

Eftersom den publicerade datamängden innehåller äldre modeller som Gemini 2.5 Flash och GPT-4o körde vi utvärderingen mot nyare modeller. SemWER (semantisk WER) bedömer om modellen uppfattade rätt innehåll, oavsett formatering (”mg” och ”milligram” räknas som samma svar), och kwWER (WER för nyckelord) tillämpar samma bedömning enbart på de annoterade medicinska nyckelorden.

Modell

semWER

kwWER

Scribe v2 Medical

6.50%

6.02%

Scribe v2 (bas)

7.35%

7.04%

Deepgram Nova-3 Medical

7.79%

7.65%

Muse Voice Transcribe 1.0

8.85%

8.99%

OpenAI GPT Transcribe

13.90%

13.20%

Eka annoterar de medicinska termerna i varje exempel, vilket gör det möjligt att mer detaljerat bedöma förbättringarna för Scribe v2 Medical jämfört med basmodellen enbart för de medicinska termerna. Scribe v2 Medical gör 15 % färre fel än basmodellen (9,5 % jämfört med 11,1 %), och förbättringarna är störst när termerna förekommer i hela kliniska meningar (7,5 % jämfört med 9,9 %).

Fine-tuning lowers medical term error rates overall and in clinical sentences, but not conversation.

En begränsning i samma data är att enskilda klipp med ett enda ord (ett ensamt läkemedelsnamn som sägs utan omgivande sammanhang) fortfarande är det svåraste fallet för alla modeller på topplistan, även Scribe v2 Medical. Den fick 14,3 % WER för isolerade termer, jämfört med 7,5 % när termerna förekommer i meningar. Utan något sammanhang kan en felhörd stavelse leda till minnesvärda missar:

  • etodolac (ett NSAID-läkemedel) → ”It'll do the luck”
  • levomilnacipran (ett antidepressivt läkemedel) → ”Leave me alone now, Sephora.”
  • methdilazine (ett antihistamin) → ”Let's play our scene.”

Ett sätt att minska dessa fel är med keyterm prompting, som låter dig lyfta fram läkemedelsnamn eller medicinska fraser för att styra modellen mot att transkribera dem korrekt.

Kunder i produktion

Kunder använder redan Scribe v2 Medical i produktion och ser förbättringar för kliniskt ljud.

”Sedan vi bytte från Deepgram till ElevenLabs Scribe v2 Medical har vi sett betydligt högre träffsäkerhet för klinisk terminologi, och det har förändrat hur teamet arbetar”, säger Mendel Erlenwein, VD och grundare av CareCo. ”När våra samordnare litar på transkriptionerna kan de lägga mindre tid på att rätta anteckningar och mer tid på att prata med patienter i telefon. Våra patienter har komplicerade behandlingsregimer, och anteckningen som vårdteamet läser måste vara korrekt.”

Stark prestanda för allmänt tal

Teamet har också verifierat att den medicinska finjusteringen inte försämrar prestandan inom andra områden. På 6 000 exempel av vardagligt, icke-medicinskt tal från Common Voice har Scribe v2 Medical samma resultat som basmodellen Scribe v2 vid avrundning: 5,3 % WER i båda fallen. Med v2 Medical får du alltså fördelarna med en specialiserad medicinsk modell utan att ge upp precisionen i detta riktmärke.

Utvecklad för skyddad hälsoinformation

Scribe v2 Medical uppfyller kraven för HIPAA för företagskunder som har Business Associate Agreements på plats och har Zero Retention Mode (ZRM) aktiverat.

När ZRM är aktiverat för förfrågningar till Speech to Text API raderas ljudinmatning och textutdata direkt när varje förfrågan har slutförts. ElevenLabs lagrar ingendera, och din applikation får hela API-svaret och styr hur transkriptioner sparas.

Kom igång

Scribe v2 Medical är tillgänglig i Speech to Text API. Skicka bara med det nya modell-id:t: scribe_v2_medical

import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";

const elevenlabs = new ElevenLabsClient({ apiKey: "YOUR_API_KEY" });

const fileData = await fs.promises.readFile("clinical_audio.mp3");

const transcription = await elevenlabs.speechToText.convert({
  file: new Blob([fileData], { type: "audio/mp3" });,
  modelId: "scribe_v2_medical",
});

console.log(transcription.text);

Modellen körs på batchslutpunkten för Speech to Text. 

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet