# Finns det en lista med alla svenska stavelser?
Author: Niklas

Jag letar efter en lista över alla, eller väldigt många, svenska stavelser. Google gav inget alls, vilket förvånar mig. Det måste finnas mängder av sånt. 

Är det någon här som vet var jag kan hitta en stavelselista för svenska?

## Comment 1
Author: Pyttelite

Är det fonem du letar efter?

https://www.su.se/polopoly_fs/1.29954.1320939955%21/Svenskt_Fonologikompendium.pdf

## Comment 2
Author: Niklas

Nix, stavelser. En stavelse kan ju bestå av flera fonem.

## Comment 3
Author: Ephraim

Det borde gå att hitta en sådan lista någonstans men kan tyvärr inte säga var du skulle hitta den på rak arm.

Men vad ska du ha listan till? Om det är för att du vill veta vilka stavelser som är möjliga finns det en hel del mer eller mindre uttömmande beskrivningar av svenskans _fonotax_ (eng. _phonotactics_), dvs de principer som styr vilka stavelser som är möjliga.

Om du behöver data till någon form av teknisk applikation bör du nog även fundera på vad för typ av data du är intresserad av. Är det teoretiskt möjliga stavelser eller stavelser som faktiskt förekommer? Vill du ha det med fonetisk skrift eller svensk stavning och om det är det senare, hur hanterar du problem med att stavningen inte matchar uttalet helt? Sen finns en hel del gränsfall i fråga om huruvida de ska anses vara tillåtna stavelser.

Det kan vara en idé att faktiskt genera listan själv beroende på kraven.

## Comment 4
Author: Niklas

#3: Listan ska i första hand användas för att skapa nya (främst) **svenska namn med hjälp av slumpen**. Stavelserna bör vara stavade så som vi ser dem i svenska ord, inte fonetiskt eller något annat. Det spelar egentligen ingen roll om de förekommer eller inte, men det viktigaste är att förekommande stavelser är med. Saknas en mindre andel förekommande stavelser är det inte hela värden. Det räcker om jag har tillräckligt många för att bilda miljontals namn med högst tre stavelser. 

Jag har funderat på att generera listan själv, men vill då helst göra det programmatiskt så att det går någorlunda fort. Tyvärr har jag varken hittat någon komplett algoritm för att söka stavelser i svenska ord eller en tillräckligt tydlig definition för att kunna skriva den själv.

En gång skrev jag en egen lista över engelska stavelser utifrån huvudet. Kom upp i drygt 1500 stycken, men det tog sin tid. 🙂 

En lista över svenska **morfem** skulle också kunna fungera, men någon sån har jag inte heller hittat.

## Comment 5
Author: Ephraim

Jag hade nog föreslagit att du gör tre listor som sedan kan kombineras relativt fritt:
1. Ansats, dvs alla kombinationer av noll, en, två eller tre konsonanter som kan inleda en stavelse.
2. Kärna, dvs i princip alla vokaler.
3. Koda, dvs alla kombinationer av konsonanter som kan avsluta stavelsen.

Jag tror att följande lista på ansatser kan vara hyfsat uttömmande, och då är det bara fråga om stavning, inte uttal:
p, t, k, b, d, g, f, s, h, m, n, r, l, j, v
sp, st, sk, sm, sn, sl, sv, pj, tj, kj, bj, dj, gj, fj, sj, mj, nj, lj, vr, tv, dv, kv, hj
spr, str, skr, spl, spj, stj, skj

Vissa ansatser som i huvudsak tillhör lånord eller namnstavning:
ps, x, z, c, w, qu, qv, qw, vl, skl, ch, sch, sf

Jag kan mycket väl ha missat några uppenbara här.

Kärnan är bara en lista på alla vokaler. Dock kan särskilt kombinationer av j+i undvikas.

Tillåtna kodor är nog lite fler än ansatserna, och här förekommer ju dubbeltecknade konsonanter.

Om du vill ha flerstaviga namn får du kanske tänka till lite mer för normalt är ju obetonade stavelser enklare än betonade. Men ett enkelt sätt att bilda tvåstaviga namn är ju att lägga till -a eller -e på slutet.

## Comment 6
Author: Ephraim

Jag inser att jag missade ganska många möjliga ansatser, här är en uppdaterad lista:

p, b, t, d, k, g, f, s, h, m, n, r, l, j, v
pr, br, tr, dr, kr, gr, fr, vr
pl, bl, kl, gl, fl, sl
pj, bj, tj, dj, kj, gj, fj, sj, hj, mj, nj, lj
tv, dv, kv, sv
fn, kn, gn, sn
sp, st, sk, sm, (sn, sl, sj, sv)*
spr, str, skr
spl
spj, stj, skj
skv

Kan fortfarande ha missat några. Förhoppningsvis är det tydligt att det finns ett system här, även om det finns många luckor. Lånord och namn kan fylla några av luckorna, med t.ex. sf, skl, pn, sr, vl.

*upprepning för systematiken

## Comment 7
Author: Niklas

#6: Tack för hjälpen och förslagen! Din idé kan vara en enklare väg till det jag vill ha. 😃 Jag ska nysta mer i dem och se vad jag kan få till.

## Comment 8
Author: Niklas

Nu har jag gjort ett första försök att bilda svenska stavelser enligt förslaget i #5. Jag uteslöt ansatsen ”sf” som bara skapade onödigt krångliga kombinationer. Resultatet är en lista med drygt 21.000 svenska stavelser (bifogas i zippad textfil om någon kan ha nytta av det i framtiden).

Många är naturligtvis svåranvända, exempelvis **tvåf**, **tvåff**, **tvåg** och **tvågg**, men det blir garanterat kvar mängder av användbara kombinationer om jag rensar bort de sämsta. 🙂

## Comment 9
Author: Niklas

Jag provade att lägga till fler tänkbara koda i programmet och fick tillbaks en lista med nästan 50.000 teoretiska svenska stavelser. De har kanske ingen praktisk användning annat än för att skapa svenska-liknande ord. 

Kanske kan man hitta namn till **nya företag**, **domännamn** eller **varumärken** bland dem. Eller göra ett nytt **nonsens-språk**. 😃 

Aj um yrs pask skvelk!

## Comment 10
Author: Niklas

#5: *”Dock kan särskilt kombinationer av j+i undvikas.”*

Jag har funderat över det här. Vad menar du med det?

## Comment 11
Author: Ephraim

#10: Vad jag menar är att du även kan vilja införa restriktioner på vilka kärnor som kan förekomma tillsammans med vissa ansatser eller vissa kodor.

Det kan först vara värt att påpeka det att vad som är en "svensk stavelse" inte är alldeles självklart, utan gränserna är lite flytande. Man kanske kan hitta en skala från mest svenska till minst svenska enligt följande (där gränserna mellan kategorierna är lite flytande). 
* Till att börja med finns en innersta krets av stavelser som kan förekomma i svenska arvord. Av språkhistoriska skäl finns det många stavelser som vi inte hittar här.
* Några ytterligare stavelser tillkommer med väldigt gamla lånord, från urnordisk tid och tidigare, varav vissa kanske är svåra av identifiera som lån.
* Medeltida lån från andra germanska språk, företrädesvis lågtyska, har gett oss några andra stavelser. Dessa lån är i allmänhet så välintegrerade i svenskan att de flesta talare antagligen inte är medvetna om att det är fråga om lånord.
* Lånord från latin och grekiska, samt äldre lån och försvenskade lån från bl.a. franska är i och för sig en välintegrerad del av språket, men de kan ändå ofta vara lätta att känna igen som lån, och kan innehålla stavelser som inte hittas i kategorierna ovan. En hel del vanliga namn hör även till denna kategori.
* Nyare lånord som inte är lika välintegrerade kan ju ofta behålla det långivande språkets stavning, och ibland även uttalas mer eller mindre efter det språkets mönster (i synnerhet om det långivande språket är engelska). Denna kategori ord bidrar ju med ytterligare stavelser, även skriftspråkliga sådana.

Utöver denna skala finns ju även interjektioner, ljudhärmande ord och mer lekfulla bildningar (som kan vara vanliga som smeknamn, slang m.m.), som i princip kan vara inhemska men som kan bidra med vissa ytterligare stavelser som vi annars inte hittar i arvord.

För att ta ett exempel med dina *tvåf*, *tvåff*, *tvåg* och *tvågg* så skulle jag säga att *tvåg* är den mest svenska, och en sådan stavelse skulle vi kunna hitta i svenska arvord, det är mer en tillfällighet att det såvitt jag vet inte är ett ord. Jag är osäker på *tvågg*, det finns många arvord med *gg* men jag är osäker på om det kombineras med en kärna där vokalen stavas med *å*. Dock känns stavelsen inte särskilt främmande. Jag tror i princip att *ff* bara förekommer i lånord, men dessa kan vara medeltida lån som känns väldigt svenska. Kombinationen med å-stavning för kärnan hittar vi ju i *våffla* bl.a. (vilket är ett lånord). Mest främmande av dessa känns *tvåf*. Enkelt *f* efter vokal (utom kanske i kombinationen *ft* eller *fs* och kanske någon mer) tillhör också främst lånord, och ofta tror jag lite senare lån. Med äldre stavning skrev vi ju ljudet /v/ med *f* i dessa positioner, vilket fungerade bra eftersom vi inte direkt hade ljudet /f/ i dessa positioner, frånsett då vissa lån som till exempel *graf*.

Så med det sagt skulle jag säga att vi nog inte hittar svenska arvord där ansatsen innehåller *j* i stavningen, och där kärnan skrivs med *i*, dvs stavelser som *ji*, *pji*, *lji* etc. Detsamma gäller nog faktiskt även *jy*, och i betonad stavelse också *je* (utom som en äldre stavning av ord där vi idag skriver *jä*). I obetonad stavelse förekommer kombinationen *je* (*varje*), och över morfemgränser kan *ji* förekomma (*röjig*), även i arvord. Vi har ju arvord som uttalas med /jiː/ etc. men då stavas orden med *g*.

I bl.a. lånord kan dessa kombinationer förekomma, exempelvis _jingel_ och _jycke_. Det är dock sammantaget rätt få ord i svenskan som börjar på *ji* eller *jy*. Kombinationen <je> är emellertid ganska vanlig, inte minst i inlånade namn som _Jesper_, _Jennifer_, _Jesus_ m.fl.

Kombinationen av *konsonant+j* i ansatsen och *i*, *e* eller *y* kärnan förekommer i princip inte såvitt jag kan komma på, frånsett några ord som stavas med *tj*, *dj* eller *sj*, såsom *tjim* (ljudhärmande), *tjyv* (vardaglig variant), *djinn* (lån) eller *sjyst* (lån).

Likaså finns det vissa begränsningar när det gäller kodor som börjar på *j*. I arvord tror jag främst vi hittar *ej*, *äj* och *öj*. I bl.a. interjektioner och i kategorin medeltida lån hittar vi dock *aj* och *oj* och dessa är väldigt väl integrerade i språket. I ett fåtal fall kan vi hitta *uj*, men jag kommer inte på något exempel på *åj* (även om *åj* och *oj* torde uttalas identiskt), och *ij* eller *yj* känns rätt främmande.

Så sammanfattningsvis är exempelvis stavelser stavade *jif* eller *ljyj* inte så "typiskt svenska" och det finnas skäl att lägga in restriktioner vad gäller vissa kombinationer.

## Comment 12
Author: Niklas

Intressant. Det känns som att hur man än drar gränsen för vad som räknas som typiskt svenska ord och stavelser så blir det ändå fel. 😉 Jag tror jag ska försöka göra det så enkelt som möjligt och inte krångla så mycket med ovanliga stavelsekombinationer.

Tack för ditt uttömmande svar!

## Comment 13
Author: raphanus

#12 Jag följer tråden, för jag tycker att frågan är intressant. Vill du räkna tvågg och tvogg (som timmar på blogg) som två olika stavelser, eller går du mer efter uttal än stavning?

Kan du tänka dig stavelser som går att uttala, men som i praktiken aldrig förekommer i svenska. På ryska finns det många ord som börjar på vl- och vn-, men nästan inga som börjar på fl- och fn-. I svenskan är det precis tvärtom - flera stycken på både fl- och fn-, men inte ett enda på vl- och vn-. Dock skulle det ju vara teoretiskt tänkbart, för de stavelserna är ju ändå inte omöjliga att uttala.

## Comment 14
Author: Niklas

#13: Egentligen vill jag helst bara ha en version av varje uttal och företrädesvis den mest lättstavade.

Svaret på andra frågan är att jag hoppar över de ovanligaste stavningarna av en stavelse. Eftersom det finns såna mängder svenska stavelser ändå så behöver jag inte jaga udda varianter. 🙂
