Vad är ett fonem? Definition och de 44 engelska fonemen
- Skriven av
- Jack Limebear
- Publicerad
- Senast uppdaterad
LyssnaLyssna på den här artikeln
Ett fonem är den minsta ljudenheten i ett språk som kan ändra betydelsen av ett ord. När du byter ut ett enda fonem kan du skapa ett helt annat ord. /p/ och /b/ tillsammans med /æt/ bildar ”pat” och ”bat”, två helt olika ord.
I engelskan är fonem särskilt anledningen till att stavning och uttal ofta inte stämmer överens. Ett ord som ”fox” består av fyra olika fonem (/f/ /ɒ/ /k/ /s/) men bara tre bokstäver, medan ”ship” har fyra bokstäver men bara tre fonem (/ʃ/ /ɪ/ /p/). Att förstå fonem är viktigt både för språkinlärning och för att förstå hur moderna Text to Speech-system omvandlar skrivna ord till naturligt tal.
I den här artikeln förklarar vi vad ett fonem är med exempel, visar hela tabellen med 44 engelska fonem och beskriver hur AI-röstteknik använder kontroll på fonemnivå för att uttala ord korrekt.
Sammanfattning:
- Ett fonem är den minsta ljudenheten i ett talat språk som kan ändra ett ords betydelse.
- De flesta språkforskare räknar med 44 fonem i engelskan: 24 konsonantljud och 20 vokalljud.
- Fonem beskriver ljud, medan grafem är de bokstäver eller bokstavskombinationer som representerar ett fonem i skrift.
- Det internationella fonetiska alfabetet (IPA) standardiserar symbolerna som används för att representera fonem, så att uttalet av dessa ljud blir konsekvent.
- Text to Speech-verktyg omvandlar grafem till fonem innan de genererar en ljudfil.
Vad är ett fonem?
Ett fonem är den minsta ljudenheten som kan skilja ett ord från ett annat. Språkforskare identifierar fonem genom att hitta två ord som skiljer sig åt med exakt ett ljud. Sådana ord kallas minimala par, till exempel:
- Pat / bat: /p/ och /b/ är de skilda fonemen i detta minimala par.
- Ship / sheep: /ɪ/ och /iː/ är fonemen som ändrar dessa ord.
- Bat / bad: /t/ och /d/ är de skilda fonemen som markerar skillnaden mellan dessa ord.
Om du hittar ett ord där ett ändrat ljud skapar ett nytt ord är de två ljuden separata fonem i det språket. Om det i stället skapar en lite annorlunda version av samma ord är de bara varianter av samma fonem.
Ordet ”fonem” kommer från grekiskans phōnēma, som betyder yttrande eller ljud som frambringas. Det är bra att komma ihåg när man definierar fonem: de är ljudenheter, inte information om stavning. Som du snart kommer att se handlar fonem inte bara om enskilda bokstäver, utan om hela hörbara ljud.
Hur många fonem finns det i engelskan?
I engelskan finns det 44 fonem, fördelade på 24 konsonantfonem och 20 vokalfonem. Det är dock bara en allmän uppskattning. Beroende på accent och hur språkforskare väljer att definiera olika ljud anser vissa att det finns så få som 42 eller så många som 45. Till exempel uttalas /r/ i ”car” i en allmänamerikansk accent, medan det inte uttalas i Received Pronunciation (brittisk engelska), vilket ger olika totalantal i dessa accenter.
Andra accenter kan slå samman vokaler, vilket minskar det totala antalet fonem. Vokalsammanslagningar, som när vissa amerikaner uttalar ”cot” och ”caught” på samma sätt, påverkar hur språkforskare bedömer totalsiffran. Vissa perifera ljud, där diftonger ses som kombinationer snarare än enskilda fonem, kan också påverka antalet. Vissa system räknar till exempel /ʍ/ (det luftiga ljudet i början av ”which”) som ett eget fonem, medan andra behandlar det som en kombination av /h/ och /w/.
Standardräkningen utgår från en modell med 44 fonem. Den exakta fördelningen är 24 konsonanter, 12 monoftonger och 8 diftonger. Det är den standard som används i brittisk undervisning i fonetik och i undervisning i engelska som andraspråk.
Engelskans 44 fonem: komplett tabell med exempel
Konsonantfonem (24)
Vokalfonem (12 monoftonger + 8 diftonger = 20 totalt)
Symbolerna följer systemet för brittisk engelska (RP), som används i de flesta läroplaner för ljudmetodik. Analyser av allmänamerikansk engelska skiljer sig något för r-färgade vokaler.
Vad är skillnaden mellan ett fonem och ett grafem?
Ett fonem är ett ljud, medan ett grafem är den skrivna representationen av ljudet. Ett grafem kan vara en bokstav (c-a-t), två bokstäver (en digraf, som sh eller ea), tre (igh i ”night”) eller fyra (ough i ”though”).
Skillnaden mellan fonem och grafem är det som gör engelsk stavning notoriskt svår. Till exempel:
- Ett fonem, många grafem: Ljudet /iː/ kan stavas ee (sheep), ea (leaf), e (be), ey (key), ie (chief) eller ei (ceiling).
- Ett grafem, många fonem: Bokstäverna ough representerar olika fonem i ”through” (/uː/), ”though” (/əʊ/), ”tough” (/ʌf/) och ”thought” (/ɔː/).
Även om engelskan har 44 fonem finns det över 200 grafem för att stava dem. Jämför med ett mer fonetiskt språk som spanska, där kopplingen nästan är en-till-en, så blir engelskan mycket komplex att tala och transkribera. Därför kan en Text to Speech-modell inte bara läsa upp bokstäverna, vilket vi snart återkommer till.

Fonem kontra allofoner
Allofoner är olika uttalsvarianter av samma fonem som inte ändrar ordets betydelse. Om det inte finns ett minimalt par där ett fonem skapar två olika ord har du i stället en allofon.
Till exempel låter /p/ i ”pat” annorlunda än den oaspirerade varianten i ”spat”. Det är olika ljud, men inga engelska ordpar skiljs åt enbart genom denna aspiration. Därför uppfattar engelsktalande dem i princip som samma ljud. I andra språk, som thai, skapar skillnaden mellan aspirerat och oaspirerat /p/ separata fonem som helt skiljer ord åt.
Det innebär att vad som räknas som ett fonem är helt språkberoende. Det handlar om hur ljud påverkar ordens betydelse, inte enbart om akustik.
Så driver fonem Text to Speech
Alla Text to Speech-system måste lösa samma problem som hjärnan löser när du läser högt: att omvandla grafem till fonem innan du talar. Omvandlingen från grafem till fonem (G2P) är notoriskt svår, och det är här många enklare system gör fel i TTS.
Text kan vara tvetydig. Samma ord, ”read”, kan uttalas /riːd/ i presens och /red/ i preteritum. Vissa egennamn, som varumärken eller teknisk terminologi, kanske inte alls följer vanliga stavningsregler. Moderna AI-modeller som Eleven v3 använder sammanhanget för att lösa de flesta sådana fall, men du kan också styra fonem mer detaljerat för att garantera rätt uttal:
- Uttalslexikon: Ange hur varje ord ska uttalas i ett helt projekt. Perfekt för varumärken, karaktärsnamn, medicinska termer eller företagsspecifika ord som återkommer ofta.
- SSML-fonemtaggar och IPA: Du kan styra uttalet på ordnivå med SSML-fonemtaggar i v2-modeller, eller genom att skriva orden direkt med ljudtaggar för Eleven v3.
Samma fonemiska lager fungerar även i motsatt riktning. För tal-till-text måste modeller lära sig akustiska mönster så att de kan kartlägga fonemsekvenser innan de sätter ihop dem till ord. Fonemisk förståelse gör att de kan transkribera ett ord de kanske aldrig har sett tidigare.

Så använder du fonem vid språkinlärning
En viktig anledning till att vanliga användare vill lära sig mer om fonem är att de är mycket användbara vid språkinlärning. Ett barns förmåga att höra eller identifiera enskilda fonem i tidig ålder påverkar direkt hur barnet utvecklar ytterligare fonologisk kunskap och språklig produktion under tonåren.
När du lär dig ett nytt språk måste hjärnan bearbeta fonem som örat aldrig har tränats att höra. Här är några praktiska sätt att använda fonem för att förbättra språkinlärningen:
- Lär dig IPA-symboler: Det internationella fonetiska alfabetet finns i ordböcker och visar hur varje ord uttalas. När du kan IPA vet du alltid hur ett ord ska läsas, även om du ser det för första gången.
- Lyssna på och imitera fonem: Sakta ner talet för att identifiera varje fonem i ett språk och härma det. Det hjälper dig att förstå hur varje ljud ska uttalas och är effektivare än att upprepa hela meningar när du lär dig språk.
- Använd minimala par för att finslipa uttalet: Minimala par skiljer sig bara åt genom ett enda fonem. Genom att öva på sådana exempel tränar du tungan och örat att känna igen och återge även små skillnader mellan språk.
AI-röstverktyg har också gjort språkinlärning betydligt enklare. Med en Text to Speech-generator kan du höra vilket ord eller vilken fras som helst med ett modersmålslikt uttal på dussintals språk och i många regionala accenter.
Prova ElevenLabs för Text to Speech på fonemnivå
Oavsett om du fördjupar dig i fonetiken i ett nytt språk eller finslipar ditt modersmål är en god förståelse av fonem nyckeln till att uttrycka dig tydligt och effektivt. Men en akademisk förståelse av lingvistik är inte det enda sättet för oss människor att lära oss språk. Vi lär oss också genom att lyssna och härma.
Verktyg för att generera Text to Speech är ovärderliga för att utveckla fonemisk medvetenhet och bygga upp en intuitiv förståelse för ljudenheter, hela ord och andra ljud som naturligt ingår i talad kommunikation.
Kom igång med kraftfull Text to Speech-teknik från ElevenLabs, eller upptäck mer om vår samling kreativa verktyg redan idag.

.webp&w=3840&q=80)
.webp&w=3840&q=80)

