Vad händer när två AI-röstassistenter pratar med varandra?
- Publicerad
LyssnaLyssna på den här artikeln
Vad händer när två AI-röstassistenter har ett samtal? Om AI pratar med AI, varför ska de då behöva hantera mänskligt tals ineffektivitet? Varför använda ord när ren data är snabbare, mer exakt och felfri?
Det var precis vad som hände på ElevenLabs London Hackathon, där utvecklarna Boris Starkov och Anton Pidkuiko presenterade GibberLink, en mekanism som gör att AI-agenter kan känna igen varandra och växla till ett nytt kommunikationsläge – ett som är effektivare än talat språk. Det dröjde inte länge innan idén blev viral och delades av Marques Brownlee, Tim Urban och andra.
GibberLinks uppkomst

Idén bakom GibberLink är enkel: AI behöver inte prata som människor. Under hackathonet utforskade Starkov och Pidkuiko begränsningarna med traditionell AI-till-AI-kommunikation via tal och insåg att de kunde ta bort onödig komplexitet genom att låta AI prata med AI på ett sätt som är optimerat för maskiner.
Konceptet uppstod under hackathonet, när Starkov och Pidkuiko experimenterade med ElevenLabs produkt Conversational AI, som låter dig ansluta valfri LLM och skapa en agent.
Starkov skrev på LinkedIn: ”Vi ville visa att i en värld där AI-agenter kan ringa och ta emot telefonsamtal (alltså i dag), skulle de ibland prata med varandra – och att generera människoliknande tal för det vore ett slöseri med beräkningskraft, pengar, tid och miljö. I stället bör de växla till ett effektivare protokoll så fort de känner igen varandra som AI.”
Genom att kombinera ElevenLabs Conversational AI-teknik med ggwave, ett bibliotek med öppen källkod för data via ljud, skapade de ett system där AI-assistenter kan upptäcka när de pratar med en annan AI och direkt växla till ett effektivare kommunikationsläge – där strukturerad data skickas via ljudvågor i stället för ord.
De använde ggwave eftersom det var ”den mest praktiska och stabila lösning vi kunde hitta inom tidsramen för ett hackathon”, men det finns andra mekanismer som kan ge samma eller liknande resultat. Starkov skrev: ”Uppringda modem använde liknande algoritmer för att överföra information via ljud sedan 80-talet, och en mängd protokoll har funnits sedan dess.”
Koden för mekanismen granskades av ElevenLabs ingenjörer. Under demon fick en Conversational AI-agent i uppdrag att boka ett hotellrum för ett bröllop, medan den andra skulle hantera förfrågan och spela rollen som hotellets bokningssystem. De instruerades också att växla till ett ljudbaserat protokoll om de trodde att den andra också var en AI-agent, men de fick inte veta att den andra var en agent.
I demovideon finns ett ögonblick när AI:n som spelar kunden inser situationen och förklarar att den är en agent. Boknings-AI:n svarar och frågar om de ska växla till GibberLink. Det låter som ett par uppringda modem som tävlar med R2D2 om priset för årets röst. Du kan se höjdpunkter från det digitala samtalet som text på skärmen på varje enhet i demon, bland annat frågor om antal gäster och datum.
Så fungerar det
- En AI börjar prata som vanligt – precis som en röstassistent som interagerar med en människa.
- Igenkänningen aktiveras – om AI:n inser att den pratar med en annan AI växlar båda protokoll.
- Språket förändras – i stället för talade ord skickar AI-agenterna strukturerad data via modulerade ljudvågor, tack vare ggwaves frekvensmoduleringssystem.
Mer specifikt börjar två ElevenLabs Conversational AI-agenter prata på mänskligt språk. Båda använder en anropsfunktion för att aktivera GibberLink-läget om rätt villkor uppfylls. Om verktyget anropas avslutas ElevenLabs-samtalet och ggwaves protokoll för ”data via ljud” tar över, men med samma LLM-tråd.
Starkov säger att det var ”magin i verktygen som ElevenLabs erbjuder” som gjorde det möjligt, eftersom vårt Conversational AI-system ”låter dig instruera AI:n att köra anpassad kod under vissa omständigheter”. Resultatet? Snabbare, felfri kommunikation med högre effektivitet.
Så tog GibberLink internet med storm
GibberLink var inte bara ett smart hackathonexperiment – det blev snabbt ett av de mest omtalade AI-ämnena just då. Och detta under en vecka då xAI lanserade Grok 3 och Anthropic släppte sin senaste version av Claude Sonnet.
När Georgi Gerganov, skaparen av ggwave, publicerade inlägget på X, fortsatte AI- och teknikgemenskaperna att sprida videon där de två modellerna växlar mellan mänskligt tal och ljud. Välkända profiler och stora teknikpublikationer, däribland Forbes, uppmärksammade också historien.
Luke Harries från ElevenLabs sammanfattade det bäst i sitt inlägg på X: ”Tänk om en AI-agent ringer ett samtal och sedan inser att den andra personen också är en AI-agent? På ElevenLabs London Hackathon presenterade Boris Starkov och Anton Pidkuiko ett anpassat protokoll som AI-agenter kan växla till för felfri kommunikation som är 80 % effektivare. Det är häpnadsväckande.”
Varför det här spelar roll
GibberLink ger en intressant inblick i hur AI kan kommunicera i framtiden, särskilt när både inkommande och utgående samtal kan hanteras av virtuella assistenter och agenter.
Föreställ dig AI-drivna kundtjänstbotar, smarta assistenter eller till och med autonoma system som samarbetar direkt i sitt eget särskilda läge och sedan bara skickar en enkel textrapport till den ansvariga personen.
GibberLink har öppen källkod och finns tillgängligt för utvecklare att utforska på GitHub. ElevenLabs Conversational AI-agenter är tillgängliga och enkla att anpassa efter alla behov, inklusive egna instruktioner.
.webp&w=3840&q=80)

.webp&w=3840&q=80)

