Hoppa till navigering

Modeller

Lär dig hur du väljer rätt modell för ditt användningsfall

ElevenAgents erbjuder ett enhetligt gränssnitt för att ansluta din agent till flera modeller och leverantörer, med flexibilitet, tillförlitlighet och kostnadsoptimering.

Viktiga funktioner

  • Enhetlig åtkomst: Växla mellan leverantörer och modeller med minimala kodändringar
  • Hög tillförlitlighet: Växla automatiskt från en leverantör till en annan om en slutar fungera
  • Utgiftsövervakning: Övervaka dina utgifter för olika modeller

Modeller som stöds

Följande modeller stöds för närvarande direkt och kan konfigureras via agentinställningarna:

LeverantörModell
ElevenLabsDeepSeek Flash 4.1
GLM 5.2
Qwen3.6-35B-A3B
Qwen3.5-397B-A17B
GoogleGemini 3.8 Flash
Gemini 3.7 Flash
Gemini 3.6 Flash
Gemini 3.5 Flash
Gemini 3.5 Flash-Lite
Gemini 3.1 Pro Preview
Gemini 3.1 Flash Lite
Gemini 3 Flash Preview
Gemini 2.5 Flash
Gemini 2.5 Flash Lite
OpenAIGPT-6.1 Sol
GPT-6 Astra
GPT-6 Sol
GPT-6 Luna
GPT-5.6 Sol
GPT-5.6 Terra
GPT-5.6 Luna
GPT-5.5
GPT-5.4
GPT-5.4 Mini
GPT-5.4 Nano
GPT-5.2
GPT-5.1
GPT-5
GPT-5 Mini
GPT-5 Nano
GPT-4.1
GPT-4.1 Mini
GPT-4.1 Nano
GPT-4o
GPT-4o Mini
AnthropicClaude Opus 5.5
Claude Opus 5
Claude Opus 4.8
Claude Opus 4.7
Claude Sonnet 5.5
Claude Sonnet 5
Claude Sonnet 4.6
Claude Sonnet 4.5
Claude Haiku 4.5

Priser anges vanligtvis i USD per 1 miljon token, om inget annat anges. En token är en grundläggande enhet av textdata för LLM:er och motsvarar i genomsnitt ungefär 4 tecken.

Anpassad LLM

Du kan använda en egen anpassad LLM genom att ange den slutpunkt som vi ska skicka förfrågningar till och tillhandahålla autentiseringsuppgifter via vår säkra hemlighetslagring. Läs mer om integrering av anpassad LLM.

Vissa modeller är inte tillgängliga när datalagring inom EU är aktiverad. Se GDPR och datalagring för information om tillgänglighet.

Välja modell

När du väljer den LLM som passar bäst för din applikation behöver du ta hänsyn till flera faktorer:

  • Uppgiftens komplexitet: Utvärdera modeller mot representativa uppgifter från din applikation
  • Latenskrav: För röstkonversationer i realtid väljer du en modell med låg latens och mäter svarstiden med dina prompter och verktyg
  • Kontextfönstrets storlek: Om din applikation behöver bearbeta, förstå eller komma ihåg information från långa konversationer eller omfattande dokument väljer du modeller med större kontextfönster
  • Kostnadseffektivitet: Balansera önskad prestanda och funktioner mot din budget. LLM-priser kan variera avsevärt, så analysera prisstrukturen (indata-, utdata- och cachetoken) i förhållande till dina förväntade användningsmönster
  • HIPAA-efterlevnad: Om din applikation hanterar skyddad hälsoinformation (PHI) är det viktigt att använda en LLM som är klassad som HIPAA-kompatibel och att säkerställa att hela din datahanteringsprocess uppfyller regelkraven

Den maximala storleken för systemprompten är 2 MB, inklusive agentens instruktioner, innehåll i kunskapsbasen och annan kontext på systemnivå.

Modellkonfiguration

Temperatur

Temperatur styr hur slumpmässiga modellens svar är. Lägre värden ger mer konsekventa och fokuserade resultat, medan högre värden ökar kreativiteten och variationen.

  • Låg (0.0–0.3): Deterministiska, konsekventa svar för strukturerade interaktioner
  • Medel (0.4–0.7): Balanserad kreativitet och konsekvens
  • Hög (0.8–1.0): Kreativa, varierade svar för dynamiska konversationer

Konfiguration av reserv-LLM

Konfigurera reserv-LLM:er för att säkerställa kontinuitet i konversationer när den primära LLM:en slutar fungera eller blir otillgänglig.

Konfigurationsalternativ:

  • Standard: Använder ElevenLabs rekommenderade reservsekvens
  • Anpassad: Definiera en egen kaskadsekvens av reservmodeller
  • Inaktiverad: Ingen reservlösning (avråds starkt från i produktion)

Om du inaktiverar reserv-LLM:er avslutas konversationer abrupt om din primära LLM slutar fungera eller blir otillgänglig. Detta avråds starkt från i produktionsmiljöer.

Läs mer om LLM-kaskadering.

Resonemang

Resonemang hjälper agenter att hantera komplexa beslut, till exempel att välja mellan verktyg, tillämpa policyer eller slutföra arbetsflöden i flera steg. Beroende på modellen styr du hur mycket resonemang den utför med antingen en tankebudget eller en nivå för resonemangsinsats.

Tankebudget

Ange det maximala antalet resonemangstoken med den numeriska skjutreglaget. Större budgetar kan öka svarstiden. Sätt budgeten till 0 för att inaktivera tänkande när modellen tillåter det.

Resonemangsinsats

Resonemangsinsats styr hur mycket resonemang modellen utför innan den svarar. Tillgängliga nivåer beror på den valda modellen.

Börja med en lägre budget eller insats för röstagenter i realtid, eftersom extra tänkande kan fördröja turordningen. Öka den för arbetsflödessteg som kräver mer komplexa beslut.

Sammanfattning av resonemang

Aktivera sammanfattning av resonemang för att fånga modellens returnerade resonemang när du felsöker svar, verktygsanrop eller arbetsflödesvägar. Aktivera Sammanfattning av resonemang i agentens LLM-inställningar eller ange enable_reasoning_summary via API:et. Inställningen är inaktiverad som standard.

För anpassade slutpunkter, se hur ElevenLabs begär och lagrar resonemang.

Resonemangsinnehåll omfattas av inställningar för lagringstid och borttagning av PII. Du kan komma åt det via följande kanaler:

DestinationTillgänglighet
KonversationshistorikTillgängligt under märkningen Resonemang
API för att hämta konversationReturneras i transkriptpostens fält reasoning
OpenTelemetryIngår i agentens svarsspann efter samtalet som elevenlabs.reasoning_content
KlienthändelserTillgängligt som agent_reasoning_response_part endast i textkonversationer

Med Zero Retention Mode **lagrar inte ElevenLabs resonemangsinnehåll **. Det levereras endast till chattklienter och webhooks efter samtal.

Begränsningar

  • Att begära en sammanfattning av resonemang kan öka svarslatensen. Testa det innan du aktiverar det för röstagenter som är känsliga för latens.
  • Leverantörer kan returnera en sammanfattning, tanketext, råa resonemangsdelta eller inget innehåll som kan visas.

Förstå prissättning

  • Token: LLM-användning debiteras vanligtvis baserat på antalet bearbetade token. Som en generell riktlinje för engelsk text motsvarar 100 token ungefär 75 ord
  • Prissättning för indata jämfört med utdata: Leverantörer skiljer ofta mellan priset för indatatoken (data du skickar till modellen) och utdatatoken (data modellen genererar som svar)
  • Cacheprissättning:
    • input_cache_read: Detta avser kostnaden för att hämta tidigare bearbetad indata från en cache. Att använda cachad data kan ge kostnadsbesparingar om identiska indata bearbetas flera gånger
    • input_cache_write: Detta är kostnaden för att lagra indata i en cache. Vissa LLM-leverantörer kan debitera för denna åtgärd
  • Priserna i detta dokument gäller per 1 miljon token och baseras på informationen som fanns tillgänglig när texten skrevs. Priserna kan ändras av LLM-leverantörerna
  • Vidaredebiterad prissättning: ElevenLabs vidaredebiterar tredjepartskostnader för LLM:er enligt leverantörens publicerade pris, utan påslag. Utvalda Gemini- och Claude-modeller följer Vertex AI:s regionala prissättning (inte global), som amerikansk och europeisk trafik debiteras enligt — en ökning med 10 % för indata-, utdata- och cachetoken, i linje med Vertex regionala priser

För aktuella modellfunktioner, priser och användarvillkor, se leverantörens dokumentation.

HIPAA-efterlevnad

Vissa LLM:er som finns tillgängliga på vår plattform kan vara lämpliga att använda i miljöer som kräver HIPAA-efterlevnad. Se dokumentationen om HIPAA-efterlevnad för mer information.

Relaterade resurser

Modeller som hostas av ElevenLabs

ElevenLabs erbjuder åtkomst till en rad AI-modeller, inklusive utvalda tredjepartsmodeller som hostas av ElevenLabs.

När en modell är märkt med ”Hostas av ElevenLabs” distribueras och drivs modellen på infrastruktur som hanteras av ElevenLabs. Dessa modeller hostas för närvarande i USA eller i regionen för din företagsdistribution.

Så identifierar du modeller som hostas av ElevenLabs

Modeller som hostas av ElevenLabs är tydligt märkta i ElevenLabs gränssnitt. Leta efter märkningen ”Hostas av ElevenLabs” när du bläddrar bland eller väljer modeller.

Så hanteras dina data

För modeller som hostas av ElevenLabs behandlas förfrågningar i infrastruktur som hanteras av ElevenLabs. Det innebär att den ursprungliga modellleverantören inte tar emot, får åtkomst till eller behandlar indata och utdata som skickas via ElevenLabs.

Genom att hosta dessa modeller kan ElevenLabs erbjuda en konsekvent upplevelse och samtidigt behålla kontrollen över infrastrukturen som används för modellförfrågningar.

Vanliga frågor

Var hostas självhostade modeller?

Modeller som hostas av ElevenLabs hostas för närvarande på infrastruktur i USA eller i regionen för din företagsdistribution.

Får den ursprungliga modellleverantören åtkomst till mina data eller metadata om min användning?

För modeller som hostas av ElevenLabs får modellens ursprungliga utvecklare aldrig dina indata eller utdata och har ingen åtkomst till data om distributionen som behandlar dem.

Hur vet jag om en modell hostas av ElevenLabs?

Modeller som hostas av ElevenLabs identifieras tydligt i ElevenLabs gränssnitt med märkningen ”Hostas av ElevenLabs”.