Hoppa till navigering

LLM-kaskadering

Lär dig hur Agents Platform säkerställer tillförlitliga LLM-svar med en kaskadmekanism för reservlösningar.

Översikt

Agents Platform använder en LLM-kaskadmekanism för att förbättra tillförlitligheten och motståndskraften i sina funktioner för textgenerering. Systemet försöker automatiskt använda reservmodeller för stora språkmodeller (LLM:er) om den primära konfigurerade LLM:en misslyckas, vilket ger en smidigare och mer konsekvent användarupplevelse.

Fel kan omfatta API-fel, tidsgränser eller tomma svar från LLM-leverantören. Kaskadlogiken hanterar dessa situationer smidigt.

Så fungerar det

Kaskadprocessen följer en definierad sekvens:

  1. Försök med föredragen LLM: Systemet försöker först generera ett svar med LLM:en som har valts i agentens konfiguration.

  2. Sekvens för reserv-LLM:er: Om den föredragna LLM:en misslyckas växlar systemet automatiskt till en fördefinierad sekvens av reserv-LLM:er. Den här sekvensen sammanställs utifrån modellprestanda, hastighet och tillförlitlighet. Den nuvarande standardsekvensen (kan ändras) är:

    1. Gemini 2.5 Flash
    2. GPT-4o
    3. Gemini 2.5 Flash Lite
    4. Claude Sonnet 4.5
  3. HIPAA-efterlevnad: Om agenten körs i ett läge som kräver strikt datasekretess (HIPAA-efterlevnad / ingen datalagring), filtreras reservlistan så att den endast innehåller kompatibla modeller från sekvensen ovan.

  4. Nya försök: Systemet försöker generera flera gånger (minst 3 försök) i sekvensen av tillgängliga LLM:er (föredragen + reservmodeller). Om även en reserv-LLM misslyckas fortsätter det till nästa i sekvensen. Om unika reserv-LLM:er tar slut inom gränsen för nya försök kan systemet försöka igen med reservmodeller som tidigare misslyckats.

  5. Fördröjd initiering: Anslutningar till reserv-LLM:er initieras endast vid behov, vilket optimerar resursanvändningen.

Den specifika listan och ordningen av reserv-LLM:er hanteras internt av ElevenLabs och optimeras för prestanda och tillgänglighet. Sekvensen ovan är den nuvarande standarden, men kan uppdateras utan föregående meddelande.

Anpassade LLM:er

När du konfigurerar en anpassad LLM kringgås den vanliga kaskadlogiken till andra modeller. Systemet försöker använda din angivna anpassade LLM.

Om din anpassade LLM misslyckas försöker systemet begäran igen med samma anpassade LLM flera gånger (i enlighet med det vanliga minsta antalet försök) innan begäran betraktas som misslyckad. Det växlar inte till modeller som driftas av ElevenLabs, vilket säkerställer att din specifika konfiguration respekteras.

Fördelar

  • Ökad tillförlitlighet: Minskar effekten av tillfälliga problem hos en specifik LLM-leverantör.
  • Högre tillgänglighet: Ökar sannolikheten för att ett svar genereras även vid partiella LLM-avbrott.
  • Smidig drift: Reservmekanismen är automatisk och transparent för slutanvändaren.

Konfiguration

LLM-kaskadering är en automatisk bakgrundsprocess. Den enda konfiguration som krävs är att välja din Föredragna LLM i agentens inställningar. Systemet hanterar resten för att säkerställa robust prestanda.