Vi presenterar Eleven v4Möt Eleven v4, vår mest uttrycksfulla modell hittills. Med 3× fler krediter inkluderade i Creator+ till och med den 12 oktober

Hoppa till innehållet

Så använder du ett API för mötestranskribering: realtid och batch med Scribe v2

Skriven av
Jack Limebear
Publicerad

LyssnaLyssna på den här artikeln

Att manuellt föra mötesanteckningar är tidskrävande och felbenäget, särskilt när ett möte pågår i mer än en timme. Det slösar tid och distraherar deltagarna från diskussionen. Även med en ljudinspelning är det svårt att koppla specifika samtal till enskilda talare. 


Med ett API för mötestranskribering kan du omvandla live- eller inspelade möten till tidsstämplad text med talaretiketter i din produkt. Du skickar in ljud och får tillbaka ett strukturerat transkript, utan att behöva bygga en talmodell själv.

I den här artikeln förklarar vi hur ett API för mötestranskribering fungerar, jämför realtids- och batchtranskribering och visar hur du bygger med Eleven Scribe v2 och Eleven Scribe v2 Realtime.

Sammanfattning

  • Ett API för mötestranskribering omvandlar mötesljud till transkript med tidsstämplar och talaretiketter.
  • Realtidstranskribering erbjuder låg latens för textning under möten, medan batchtranskribering bearbetar ljudinspelningar efter att mötet har avslutats.
  • Noggrannheten vid mötestranskribering beror på ljudkvaliteten, talarnas röstegenskaper och den underliggande talmodellen. 
  • ElevenLabs erbjuder modellerna Scribe v2 och Scribe v2 Realtime, som låter utvecklingsteam bygga mycket träffsäkra produkter för mötestranskribering. 

Vad ett API för mötestranskribering gör och vem som behöver det

Ett API för mötestranskribering tar emot mötesljud och returnerar text. Det hanterar taligenkänning, talarseparering och tidsstämpling, så att du får ett komplett paket att arbeta med. Jämfört med manuella anteckningar ger tal till text för möten deltagarna en sökbar dokumentation som de kan återvända till.

När fler team börjar använda AI-agenter blir skriftlig mötesdokumentation ett sökbart sammanhang. En intern agent kan söka i transkript efter detaljer och lyfta fram information som minskar datasilor och förbättrar tillgången till information mellan team.

Många kommersiella verktyg erbjuder transkribering, men de uppfyller inte alltid organisationens krav fullt ut.


För produktutvecklingsteam kan det ibland vara mer praktiskt att bygga en STT-app för möten eller lägga till funktionen i ett befintligt verktyg. Med en egen programvara för mötestranskribering har du kontroll över följande:

  • Integritet: ElevenLabs erbjuder Zero Retention Mode för företagskunder, vilket bättre uppfyller integritetskrav i vissa regioner. 
  • Anpassat ordförråd: Du ger modellen ytterligare kontext så att den kan förstå och transkribera termer som är specifika för ditt företag, din produkt och din bransch. 
  • Anpassat workflow: I stället för att begränsas till leverantörsspecifika workflow bygger du ett verktyg för mötestranskribering som ansluter till din interna databas, ditt CRM och din företagsprogramvara. 


ElevenLabs erbjuder ledande röst- och ljudmodeller som hjälper dig att bygga en app för mötestranskribering. Med vårt API för mötestranskribering kan du fånga det som sägs på ett möte i textanteckningar med hög noggrannhet. Våra modeller har stöd för fler än 90 språk, så att du kan transkribera på engelska, franska, mandarin och dussintals andra språk. 

Why teams build custom meeting transcription API: privacy, vocabulary, workflow, and searchable AI context.

Tal till text för möten i realtid eller batch: Så väljer du 

Realtidstranskribering fångar ljudströmmar medan de talas och omvandlar dem till liveundertexter. Du använder realtidstranskribering för att ge textstöd under mötet eller utlösa åtgärder mitt i sessionen med en livebot. Batchtranskribering bearbetar däremot hela inspelningen efter ett möte för att ge ett mer koncist och strukturerat transkript. Batchtranskribering hjälper till med anteckningar efter mötet, dokumentation och att upprätthålla granskningsbara register. 

Det är viktigt att förstå de tekniska konsekvenserna och kostnadseffekterna när du väljer mellan realtids- och batchtranskribering från tal till text. 

Här är en snabb överblick över hur de två metoderna skiljer sig åt.

Egenskaper

Realtidstranskribering

Batchtranskribering

Teknisk drift

Fångar ljudströmmar live medan de talas. Kräver en aktiv anslutning till talmodellen. 

Bearbetar hela ljudinspelningen efter ett möte. Kan köras asynkront.  

Noggrannhet 

Standard. Bearbetar ljud löpande utan fullständig kontext.

Högre. Har gott om tid att analysera hela samtalskontexten.

Användningsområden

Liveundertexter under möten, mötesbot. 

Anteckningar efter mötet, dokumentation.

Kostnad

Högre eftersom den kräver en beständig anslutning.

Lägre tack vare effektiviteten i bulkbearbetning. 

I slutändan beror ditt val på dina prioriteringar. Om du bygger en liveassistent för möten måste du transkribera i realtid. Annars använder du batchtranskribering, som har fördelar vad gäller kostnad och precision. 

Så konfigurerar du ett API för mötestranskribering med Scribe v2

ElevenLabs Speech to Text låter dig transkribera möten med Scribe v2 Realtime och Scribe v2. Båda talmodellerna är tränade för att korrekt märka upp talare med olika accenter, dialekter och ljudkvalitet. Scribe v2 Realtime låter dig transkribera tal live direkt, medan Scribe v2 omvandlar ljudinspelningar till mycket träffsäkra transkript. 

Du får åtkomst till båda modellerna via vårt API. Nedan utforskar vi varje modell mer i detalj och lyfter fram viktiga funktioner, API-arkitektur och sätt att integrera dem med din transkriberingslösning. 

Alternativ 1: Realtidstranskribering (live) 

Realtidstranskribering låter dig bearbeta samtal under ett möte och omvandla dem till text medan talarna pratar. Det finns få eller inga märkbara glapp mellan det hörbara och transkriberade talet. 

För att transkribera i realtid använder du modellen Scribe v2 Realtime, som uppnår låg latens på 150 ms mellan ljudinmatning och textutmatning (nästan omedelbara deltranskriberingar). Det innebär att du får textning utan glapp när du integrerar modellen i din transkriberingsapp. 

Scribe v2 Realtime är utformad för att stödja livesamtal och passar användningsfall som kräver liveundertexter, mötesanteckningar i realtid eller att mata in live-text i en AI-assistent för sekundära utlösare. Modellen har dessutom stöd för upp till 50 nyckeltermer för prompting. 

Så transkriberar du med Scribe v2 Realtime


För att utföra livetranskribering ansluter du din produkt till Scribe v2 Realtime med ElevenAPI. 

  1. Öppna först en WebSocket så att din produkt kan ta emot transkript från modellen Scribe v2 Realtime. 
  2. Skicka sedan strömmar med livekonversationer från mötet till modellen. 
  3. Ta slutligen emot preliminära och slutliga transkript inom 150 ms. 


I din kod skapar du hanterare för API-händelser som inträffar under hela transkriberingsprocessen. Din kod hanterar till exempel händelser när ljuddata skickas och ett bekräftat transkript tas emot. 

Live meeting transcription workflow: open WebSocket, stream audio, receive partial and final text.

Metoder för livestreaming med Scribe v2 Realtime

Exemplet nedan skapar en token för engångsbruk i din backend. Din klient kan strömma mötesljud till API:t för mötestranskribering utan att exponera din API-nyckel.

// Node.js server
import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";

const elevenlabs = new ElevenLabsClient({
  apiKey: process.env.ELEVENLABS_API_KEY,
});

app.get("/scribe-token", yourAuthMiddleware, async (req, res) => {
  const token = await elevenlabs.tokens.singleUse.create("realtime_scribe");

  res.json(token);
});

Beroende på appens arkitektur kan du strömma livekonversationer med Scribe v2 Realtime från klientappen eller backendservern.

  • Streaming på klientsidan: Med den här metoden matar du ljud till ljudmodellen direkt från mikrofonen eller genom manuell uppdelning i delar. För att ansluta till API:t validerar du med en token för engångsbruk, vilket förhindrar att din API-nyckel exponeras. 
  • Streaming på serversidan: Med den här metoden kan du strömma ljud direkt från en URL, filuppladdningar eller en ljudström. Du använder din ElevenLabs API-nyckel i stället för en token för engångsbruk. 

Välja en bekräftelsestrategi för Scribe v2 Realtime

Exemplet nedan konfigurerar talaktivitetsdetektering. API:t bekräftar ett transkriptsegment varje gång en talare pausar.

import { Scribe, AudioFormat, CommitStrategy } from "@elevenlabs/client";

const connection = Scribe.connect({
  token: "sutkn_1234567890",
  modelId: "scribe_v2_realtime",
  audioFormat: AudioFormat.PCM_16000,
  commitStrategy: CommitStrategy.VAD,
  vadSilenceThresholdSecs: 1.5,
  vadThreshold: 0.4,
  minSpeechDurationMs: 100,
  minSilenceDurationMs: 100,
});

Det slutliga transkriptet ger dokumentation som korrekt fångar vad som sägs under mötet. Det finns två sätt att bekräfta slutliga transkript: manuellt eller med Voice Activity Detection (VAD). 

  • Manuell bekräftelse: Som standard måste du manuellt bekräfta transkriptsegmentet i din kod. Vi rekommenderar att du bekräftar var 20:e till 30:e sekund för optimal latens. Om du är orolig för att förlora kontext kan du skicka den föregående texten tillsammans med ljudsegmentet som ska bearbetas.
  • Voice Activity Detection: Du kan också använda VAD, som upptäcker tystnad i ljudströmmen för att starta transkribering. 

Alternativ 2: Batchtranskribering (efter mötet) 

Batchtranskribering är ett effektivt sätt att omvandla timmar av mötesinspelningar till textformat. Det ger koncisa, kontextuellt relevanta och talarseparerade transkript i stor skala.

Scribe v2 är en tal-till-text-modell från ElevenLabs som stöder dynamisk taggning av ljud. Du kan exakt extrahera samtalsdata tillsammans med händelser som inte är tal, till exempel skratt och fotsteg. 

Till skillnad från realtidstranskribering är Scribe v2 byggd för mötesanteckningar efter inspelningen. Du kan till exempel spela in möten på plattformar som Zoom, Teams och Google Meet. Sedan laddar du upp ljudfilerna till Scribe v2 efter sessionen för batchtranskribering. 

Batch transcription workflow: upload recording, receive webhook, and verify its HMAC signature.

Så batchtranskriberar du med Scribe v2 

Transkribering med Scribe v2 sker asynkront via ett REST API. Du behöver inte upprätthålla en aktiv anslutning till talmodellen. I stället använder du en webhook för att få en avisering när transkriptet är klart.

Nedan ser du det logiska flödet som omvandlar ljudinspelningar till ett transkript.

Create webhook dialog configuring callback URL, HMAC authentication, and event subscriptions.

 

  1. Först skapar du en webhook i ElevenLabs dashboard för att ta emot transkriberingsresultaten.
  2. Skapa sedan händelsehanterare i din kod för att bearbeta den returnerade transkriberingen. 
  3. Ladda sedan upp ljudfiler till REST-slutpunkten för Scribe v2. 


När transkriberingen är klar anropas den händelsehanterare du har konfigurerat. 

Nyckelordsprompting för Scribe v2

Scribe v2 (batch) har stöd för upp till 1 000 termer för nyckelordsprompting. När du skickar en ljudfil för transkribering kan du inkludera termerna i API-anropet. Till skillnad från en vokabulärlista jämför Scribe v2 nyckeltermerna med samtalets kontext för att avgöra lämplig transkribering.


Det gör att modellen kan vara extra uppmärksam när någon säger specifika termer och transkribera dem korrekt. 

Exemplet nedan skickar företags- och produkttermer med begäran, vilket innebär att API:t transkriberar dem korrekt i sitt sammanhang. 

connection = await elevenlabs.speech_to_text.realtime.connect(RealtimeUrlOptions(
    model_id="scribe_v2_realtime",
    keyterms=["ElevenLabs"],
))

Den transkriberar till exempel ”ElevenLabs” när du uttalar ordet i ett sammanhang där det är ett varumärke eller företag. 

Flerkanalstranskribering för Scribe v2

Flerkanalstranskribering låter modellen Scribe v2 transkribera enskilda kanaler i en ljudfil med tal från olika talare. Funktionen är användbar när du bygger ett transkriberingsverktyg för konferenser, domstolsinspelningar eller poddar. 

Varje kanal märks med en unik identifierare som representerar en talare.

Vanliga utmaningar vid mötestranskribering och hur API:t hanterar dem 

Vid transkribering av möten ställs utvecklingsteam ofta inför flera utmaningar.

Slide outlines four meeting transcription challenges, API solutions, and keyterm limits.

Överlappande samtal 

När flera talare pratar i mun på varandra blir det svårt att förstå vad som sägs. För att skilja på talare använder du talarseparering eller flerkanalstranskribering, som Scribe v2 erbjuder. På så sätt får du separata transkriberingar märkta med respektive talare.

Feltolkningar

Ett annat problem för transkriberingsverktyg är att korrekt upptäcka och tolka specifika produkter, varumärken eller branschtermer. Till exempel kan ”DevOps”, en term som är välbekant för mjukvaruutvecklare, feltranskriberas som ”dev ops”. Med ElevenLabs API för mötestranskribering kan du vägleda modellen till korrekt tolkning med nyckelordsprompting.

Flerspråkiga talare

Vissa möten hålls på olika språk, där talarna växlar mellan två eller fler språk som de behärskar. Standardtalmodeller har svårt att tolka kontext och talinnehåll, vilket ger låg transkriberingskvalitet. Scribe v2 möjliggör flerspråkig transkribering på fler än 90 språk och fångar samtal med hög precision medan de utspelar sig. 

Liveundertexter och transkript efter inspelningen

Vissa team behöver visa liveundertexter och skapa ett transkript efter mötet. Tyvärr erbjuder inte alla färdiga transkriberingsverktyg båda funktionerna. Med ElevenLabs API kan du göra båda med Scribe v2 och Scribe v2 Realtime. 

Kom igång med API:t för mötestranskribering

ElevenAPI ger dig tillgång till ledande Speech to Text-modeller för att bygga transkriberingsverktyg för möten. Det är enkelt att konfigurera en utvecklingsmiljö. Du får en API-nyckel och installerar SDK:t för Python eller Node.js. Sedan integrerar du Scribe v2 eller Scribe v2 Realtime i din produkt med det medföljande API:t. 

Få åtkomst till ElevenLabs och skicka din första API-begäran nu. 

Bygg med ElevenAPI i stor skala

Behöver du något annat? Besök vår kundtjänst

Vanliga frågor 

Skriven av

Man smiling, wearing a checkered shirt against a plain background.

Jack Limebear

Growth Marketing

Jack Limebear jobbar i Growth-teamet och skriver innehåll samt planerar strategier för bloggen och insiktssidorna. Innan ElevenLabs ledde han innehållsstrategi i över tio år för allt från snabbt växande SaaS-startups till Fortune 500-företag. Han har en masterexamen i engelsk litteratur från University of Cambridge.

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet