Vi presenterar Eleven v4Möt Eleven v4, vår mest uttrycksfulla modell hittills. Med 3× fler krediter inkluderade i Creator+ till och med den 12 oktober

Hoppa till innehållet

Conversational AI-design: Så skapar du mer mänskliga användarupplevelser

Skriven av
Jack Limebear
Publicerad
Senast uppdaterad

LyssnaLyssna på den här artikeln

Design för Conversational AI handlade tidigare om att bygga ett beslutsträd. Tidiga chattbotar och IVR-menyer byggde på rigida, förskrivna grenar: tryck 1 för fakturering, säg ”ja” eller ”nej” och hoppas att kundens fråga matchade en av de vägar du hade förutsett. Den modellen fungerade bara så länge samtalet höll sig inom det du redan hade byggt.

AI-agenter tog bort den begränsningen. De kan nu resonera utifrån ett samtal i realtid, hämta information från en kunskapsbas, anropa verktyg och komma ihåg vad som redan sagts, så de är inte längre begränsade till ett fast manus.

Men den här förändringen tog inte bort behovet av design för Conversational AI. I stället höjde den ribban. Utan ett stelt manus att falla tillbaka på måste en agents persona, workflow och beslutspunkter vara tillräckligt väl definierade för att fungera i ett öppet samtal i realtid, snarare än ett förutbestämt samtal.

Den här guiden förklarar vad design för Conversational AI faktiskt innebär för chatt och röstagent, varför det spelar roll för de mätvärden du redan utvärderas utifrån, och vad du behöver optimera för att det ska kännas mer naturligt. Gör du rätt kan du lansera AI-agenter som skapar kontakt med kunder och ger snabbare, bättre service.

Sammanfattning

  • Design för Conversational AI handlar om hur en AI-agents kommunikation struktureras och optimeras så att ett samtal känns naturligt.
  • Röst-AI är mindre förlåtande än text, eftersom problem med röst, latens och timing som inte märks i ett chattgränssnitt kan få ett röstsamtal att kännas robotaktigt.
  • ElevenAgents är utformat för att möjliggöra mänskliga AI-agenter för röst och chatt genom funktioner som låter dig styra röst, persona och samtalsflöde samt optimera latensen i varje kanal.

Vad är design för Conversational AI?

Design för Conversational AI är UX-arbetet med att konfigurera hur en AI-agent beter sig. Det omfattar allt från dess persona till de skyddsräcken, workflows och kunskapsbaser den använder, som tillsammans får samtalet att kännas lika genomarbetat som alla andra delar av produktupplevelsen.

Den konfigurationen ser dock inte likadan ut överallt. Agenter kan köras i flera kanaler, som chatt, röst eller SMS, från en enda konfiguration. Varje kanal har sina egna begränsningar, men för röst är de som störst. När röst är en av agentens kanaler måste agenten välja och leverera en röst, hantera tempo och turordning i realtid och svara innan en paus börjar kännas som att samtalet har brutits. Inget av detta är valfritt på samma sätt som i chatt, där ett något långsamt eller ofullständigt svar sällan förstör interaktionen.

Här är vad du behöver tänka på när du implementerar design för Conversational AI för en chattagent, och vad röst tillför utöver det.

Feature
Chat
Voice
Latency
Small delays are unnoticeable, and there is often more time to think as users type their own answers.
Voice agents have almost no room for delay. A pause that's fine in a chat window reads as dead air on a call, and the customer assumes it dropped.
Persona
Comes through in font, color, and word choice.
Persona also has to come through in accent, pacing, and tone, since the customer hears it instead of reading it.
Conversation flow
Messages simply queue up. No turn-taking, interruption handling, or silence detection needed.
The agent has to decide, in real time, when the customer is done talking and when it’s safe to respond.
Language and accent
The agent just needs to detect and match the right language.
The agent also has to get the accent right, since language detection alone won't catch it.

Kunder bedömer inte medvetet var och en av dessa faktorer. De märker bara när något känns fel, och den känslan räcker för att undergräva förtroendet för agenten som helhet och hota de mål du lanserade den för från början.

Varför design för Conversational AI är viktigt för en bra användarupplevelse

Alla faktorer ovan, från turordning till latens och persona, påverkar hur en kund uppfattar ditt varumärke i ett avgörande ögonblick som kan göra dem till en förespråkare eller kritiker. Den uppfattningen syns direkt i de mätvärden som team utvärderas utifrån.

  • Högre nöjdhet och lösningsgrad: Kunder betygsätter en interaktion högre när agenten svarar snabbt och inte avbryter på ett obekvämt sätt.
  • Minskade avhopp: Kunder lämnar ett samtal av fler skäl än långa väntetider. Ett bemötande som inte motsvarar förväntningarna, oavsett om det är en obekväm paus i ett samtal eller ett stelt svar i chatt som inte passar varumärket, kan väcka samma impuls att avsluta samtalet.
  • Snabbare lösning: Tydliga inställningar för samtalsflödet och välkartlagda workflows innebär färre återvändsgränder, upprepade frågor och ”jag kopplar dig vidare”-ögonblick.
  • Färre eskaleringar till mänskliga handläggare: När en agent hanterar samtalsflödet naturligt och följer ett definierat workflow löser den fler ärenden vid första försöket, i stället för att förvirra kunden så att de ber om en person.

Ta till exempel eDreams ODIGEO, en av världens största onlineplattformar för resor. De implementerade AI-agenter med ElevenAgents på fem huvudspråk och såg en tvåsiffrig förbättring av lösningshastigheten och en tvåsiffrig minskning av antalet vidarekopplade samtal. Det drevs delvis av röstsyntes med låg latens och mer träffsäker avsiktsigenkänning i början av varje samtal. Resultat som dessa beror på många faktorer utöver själva samtalsdesignen, men de visar vad bra design för Conversational AI kan möjliggöra.

Så fungerar design för Conversational AI i ElevenAgents

I ElevenAgents kan du optimera exempelvis persona, röst, turordning, överlämningar och latens – samma faktorer som avgör om en agent känns mänsklig. Så här konfigurerar och optimerar du var och en så att din agent klarar sin del av ett verkligt samtal.

Val av persona och röst

Personan ger kunden ett första intryck, och en dålig matchning undergräver förtroendet innan samtalet ens har kommit i gång. En persona som är för stel för ett vänligt detaljhandelsvarumärke får kunder att börja tvivla på agenten innan den har sagt något användbart. Börja forma den i systemprompten, där du definierar agentens roll, personlighet och skyddsräcken före allt annat.

För röstagenter måste personan också komma fram i rösten. En röst som är för avslappnad för ett finansiellt samtal skickar samma signal som en felmatchad persona i text, så röstvalet blir en del av samma uppgift. Här kan du börja:

  • Röstval: Matcha rösten med ditt varumärke, din målgrupp och ämnet. Accent, kön och ton bidrar alla till att skapa förtroende hos den som ringer och sätter tonen för samtalet.
  • Stöd för flera språk: Välj en röst för varje språk du stöder i stället för att använda en och samma röst på alla marknader. En enda röst som tvingas över flera språk låter ofta främmande på minst ett av dem, vilket undergräver förtroendet du försöker bygga.

ElevenAgents ger dig tillgång till över 11 000 röster i Voice Library, där du kan söka efter accent, karaktär och användningsområde, så du behöver sällan börja från noll. Om ingen passar har du två alternativ till: klona en befintlig röst från ett kort ljudprov eller skapa en från grunden med en textprompt som beskriver önskad ålder, accent, ton och tempo.

Inställningar för samtalsflöde

Röst är där samtalet följer den stramaste tidsramen. Till skillnad från chatt, där en paus bara är tomt utrymme, uppfattas ett avbrott i rytmen i ett samtal direkt som tystnad eller en bruten anslutning. Att få rytmen rätt är den viktigaste faktorn för att få en röstagent att kännas som en naturlig deltagare i samtalet, och det börjar med själva modellen för turordning.

ElevenLabs modell för turordning är ett forskningsbaserat system som är byggt för att upptäcka när en talare faktiskt har pratat klart, snarare än bara pausar. Det gör att den kan avgöra när en agent ska svara i stället för att gissa utifrån en fast fördröjning.

Utöver det finns här några inställningar du kan justera för att få samtalsflödet rätt:

  • Turtimeout: Hur länge agenten väntar i tystnad innan den svarar, så att den inte avbryter medan kunden fortfarande tänker eller lämnar kunden väntande efter att de har pratat klart. 
  • Mjuk timeout: En kort utfyllnadsfras som agenten använder för att täcka en bearbetningspaus, till exempel ”Ett ögonblick” eller ”Låt mig se”, så att kunderna inte tror att samtalet bröts. Undvik utfyllnad som lovar en specifik tidsram, som ”en sekund”, eftersom de faktiska svarstiderna varierar.
  • Avbrott: Om agenten slutar prata när kunden börjar prata över den. Aktivera detta för naturliga samtal fram och tillbaka. Inaktivera det när ett fullständigt meddelande är viktigt, till exempel för juridiska friskrivningar, säkerhetsinstruktioner och annat som måste höras i sin helhet.
  • Svarsbenägenhet: Hur snabbt agenten svarar när kunden slutar prata. ”Eager” passar kundtjänst, där snabba svar är viktigast. ”Patient” fungerar bäst när kunduppgifter samlas in, som ett telefonnummer eller en e-postadress, så att agenten inte avbryter kunden mitt i en siffra. ”Normal” är ett bra standardval för vanliga samtal.

Små justeringar här gör stor skillnad. Även en liten ändring av timeouten kan avgöra om en agent känns uppmärksam eller som att den avbryter människor. 

Workflow, design för överlämningar och manus

Workflows är där mycket av designen för Conversational AI omsätts i praktiken i ElevenAgents. De definierar vad som händer och när: beslutspunkter, eskaleringsvägar, överlämningar – allt som annars skulle lämnas åt agenten att improvisera. 

Workflows samverkar med två andra system för att förfina din agent. Systemprompten definierar agentens grundläggande beteende, som dess roll, ton och vad den ska och inte ska säga, vid viktiga tillfällen som hälsningar eller överlämningar. Procedurer är ett mer styrt alternativ för en enskild, tydligt definierad uppgift, till exempel att verifiera en kunds identitet eller gå igenom en retur. I stället för att förgrena sig utifrån vad kunden säger följer de en fast sekvens från början till slut, steg för steg, oavsett hur samtalet utvecklas.

Det enklaste sättet att börja bygga din agent är att använda färdiga agentmallar, som ger dig en utgångspunkt för både workflows och systemprompter, så att du finjusterar i stället för att bygga från grunden. Här är några ändringar du kan börja med för att göra dem till dina egna:

  • Kartläggning av beslut: Kartlägg exakt vad agenten gör vid varje beslutspunkt, så att hela samtalet är definierat från öppning till lösning. Noder för underagenter låter dig justera systemprompten, modellen eller till och med rösten vid specifika punkter i flödet, så att ett känsligt verifieringssteg kan köras med striktare skyddsräcken än vardagligt småprat tidigare i samtalet.
  • Eskaleringstriggers: Definiera tydliga triggers för att lämna över till en människa, inbyggda i workflowet i stället för att låta agenten avgöra det i stunden. Eskalera exempelvis när ett problem inte är löst efter två försök, när kunden ber om en chef eller när transaktionen är tillräckligt känslig eller värdefull för att kräva en person.
  • Kontext vid överlämning: Definiera i systemprompten vad agenten ska samla in före överlämningen, till exempel ett order-ID eller kontonummer, och vilka villkor som utlöser den. Mappa sedan dessa sparade uppgifter till överföringsverktygets konfiguration, så att de följer med automatiskt i stället för att kunden behöver upprepa sig för en mänsklig handläggare.
  • Manusformuleringar: Definiera exakta formuleringar för kritiska tillfällen i systemprompten. Inledande hälsningar, felmeddelanden, juridiska friskrivningar och eskaleringsöverlämningar bör aldrig lämnas åt agenten att improvisera i stunden. En exakt formulering som ”Jag har problem med att komma åt den informationen just nu” är mer tillförlitlig än att låta agenten gissa hur den ska uttrycka sig när något går fel.

Själva workflowet byggs som en visuell graf i ElevenAgents, där varje beslutspunkt och eskaleringstrigger mappas som en nod som du kan se och redigera direkt.

Conversational AI design. Workflow interface for managing agent transfers and meetings in ElevenLabs platform.

När agenten är live läggs analysdata från verkliga samtal ovanpå samma graf, så att du ser exakt var kunder fastnar eller faller bort och kan åtgärda det utan att gissa.

Latens och prestanda

Latens är en av de största faktorerna för om en interaktion känns mänsklig eller inte. Ett långsamt svar är ett av de snabbaste sätten att påminna en kund om att de pratar med en maskin, även om allt annat i samtalet fungerar bra.

Varje del av pipelinen bidrar med sin egen latens, oavsett om agenten körs via chatt eller röst. Vissa gäller i båda fallen. Andra gäller bara när röst är en del av lösningen.

  • LLM: Varje modellval innebär en avvägning mellan kostnad, kvalitet på resonemang och hastighet, och rätt balans beror på samtalet. Enkla, återkommande interaktioner som vanliga frågor eller mötesbekräftelser kan köras på en snabbare, lättare modell utan att försämra upplevelsen. För mer komplexa uppgifter, som finansiell rådgivning eller felsökning i flera steg, är det oftast värt att betala för en modell med starkare resonemang, även om den svarar lite långsammare. 
  • Kunskapsbas och RAG: Varje uppslag i kunskapsbasen lägger till en tur-och-retur-fördröjning innan agenten kan svara, så en slimmad och fokuserad kunskapsbas svarar snabbare än en som agenten måste söka brett i.
  • Integrationer och verktygsanrop: Varje externt verktygsanrop, som att slå upp en order i Salesforce eller kontrollera tillgänglighet i en kalender, lägger till sin egen tur-och-retur-fördröjning. Skriv tydliga verktygsbeskrivningar så att agenten inte tvekar kring vilket verktyg den ska använda, och anropa bara de verktyg som samtalet faktiskt behöver.
  • Geografi och datahosting: Matcha din ElevenAgents-region med var dina data lagras och, för telefonbaserade lösningar, även med din telefonioperatörs region, oavsett om det är Twilio, SIP eller något annat. Om agentens region och din samtalsgateways region ligger på motsatta sidor av världen tillkommer latens innan samtalet ens har börjat.
  • Tal-till-text (endast röst): Scribe transkriberar vad kunden säger innan agenten kan resonera kring något. Använd realtidsversionen (Scribe v2 Realtime) för livesamtal i stället för batchversionen, som är byggd för noggrannhet framför hastighet.
  • Turordning (endast röst): Avgör när agenten över huvud taget bestämmer sig för att svara, vilket beskrivs mer ingående ovan. Det är värt att komma ihåg som en latensfaktor i sig, eftersom en modell som tvekar att upptäcka slutet på en tur lägger till fördröjning innan resten av pipelinen ens börjar.
  • Text-to-Speech och röstval (endast röst): Standardröster och syntetiska röster, tillsammans med Instant Voice Clones, svarar snabbare än Professional Voice Clones. Använd Professional Voice Clones endast när den extra naturtrogenheten är värd kompromissen i latens.

För en närmare titt på latens, se bästa praxis för latensoptimering och hur latens mäts och rapporteras i hela pipelinen.

Designa din första agent med ElevenAgents

Reglagen som tas upp här är vad design för Conversational AI innebär i praktiken för en AI-agent. Allt finns inbyggt i ElevenAgents och kan konfigureras från en kodfri konsol, så att du kan bygga en agent som för ett verkligt samtal i stället för att bara svara rätt på frågor.

För team som vill ha praktisk hjälp med att nå dit arbetar ElevenLabs Forward Deployed Engineers direkt med ditt team för att definiera omfattning, bygga och lansera en produktionsklar agent, och fortsätter sedan att finjustera prestandan efter lanseringen.

Oavsett om du bygger själv eller tar in hjälp är det snabbaste sättet att se skillnaden att prova. Börja redan i dag med att skapa en agent eller prata med vårt säljteam.

Designa en produktionsklar agent med vårt team

Behöver du något annat? Besök vår kundtjänst

Vanliga frågor om design för Conversational AI

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet