Bästa praxis för undertexter: så gör du undertexter som faktiskt går att läsa
De praktiska reglerna för undertexter som är lätta att läsa på mobilen, med siffrorna som professionella stilguider faktiskt använder.
Uppdaterad 9 min läsningAv AutoCap-teamet
En undertext fungerar bara om någon hinner läsa den under tiden den syns och ändå ser vad som händer i bild. Tv-bolag och streamingtjänster har gjort exakta regler av det. Sociala videor ändrar en del av förutsättningarna – skärmen är hög och liten, stilen är skrikigare, tittaren scrollar – men reglerna är fortfarande rätt utgångspunkt, och de flesta går att ta med rakt av.
Riktlinjerna som är värda att känna till
Fyra källor dyker upp gång på gång. Siffrorna i den här guiden kommer från deras aktuella versioner. Där de går isär beror det oftast på att de skrevs för olika skärmar och olika publik.
- BBC Subtitle Guidelines (version 1.2.5, mars 2026) täcker tv och webbvideo och innehåller särskilda råd för stående video i 9:16.
- Netflix English (USA) Timed Text Style Guide sätter reglerna för undertexter och SDH som levereras till Netflix.
- DCMP Captioning Key, från amerikanska Described and Captioned Media Program, är skriven med utbildningsmedier i åtanke.
- WCAG 2.2 kräver undertexter för förinspelad video (framgångskriterium 1.2.2) men säger inget om radlängd, hastighet eller stil.
Radlängd
Långa rader gör att ögat måste vandra längre, och de täcker mer av bilden. BBC begränsar undertexter i tv till 37 tecken per rad, ett arv från text-tv. För webbvideo sätts gränsen i stället efter bredd: 68 % av bredden i en liggande 16:9-video, eller 90 % i en stående 9:16-video. Netflix engelska riktlinje tillåter upp till 42 tecken per rad.
Stående video är smal, så det får plats betydligt färre tecken i läsbar storlek. BBC ger en användbar jämförelse: 37 tecken i en yta som täcker 75 % av bredden i en 16:9-video motsvarar 25 tecken över 90 % av en 9:16-bild. För TikTok, Reels och Shorts kan du se omkring 25 tecken per rad som ett tak, och gå kortare om din undertextstil använder stora, feta typsnitt.
Rader per undertext
Netflix tillåter högst två rader, och DCMP Captioning Key föredrar också högst två. BBC rekommenderar två rader för liggande, 4:3 och kvadratisk video, och upp till tre för stående video i 9:16, där varje rad är kortare. I en rörig stående klippning håller en rad – eller två korta – mer av bilden fri och ger tittaren mindre att ta in på en gång.
Läshastighet
Läshastighet mäts i ord per minut (wpm) eller tecken per sekund (cps). Så här mycket tillåter varje riktlinje:
| Riktlinje | Gräns | Gäller |
|---|---|---|
| BBC Subtitle Guidelines | 160–180 wpm (0,33–0,375 sekunder per ord) | Rekommenderad undertexthastighet |
| Netflix English (USA) | Upp till 20 cps | Program för vuxna |
| Netflix English (USA) | Upp till 17 cps | Barnprogram |
| DCMP Captioning Key | Högst 130, 140 eller 160 wpm | Utbildningsmedier för låg-, mellan- och högstadiet |
Räkna ut det genom att dela antalet tecken i undertexten med tiden den syns. En undertext på 38 tecken som visas i 1,5 sekunder hamnar på ungefär 25 cps – snabbare än Netflix tillåter för program för vuxna. Visa den längre om talet ger utrymme för det, eller dela den i två undertexter.
Snabba talare är det svåra fallet i sociala videor. BBC noterar att tittare brukar föredra ordagranna undertexter, och i sociala medier är talarens exakta formulering ofta själva poängen. I stället för att skriva om det någon sagt kan du dela upp det i fler och kortare undertexter som följer talet. Korta bara ner när orden verkligen inte hinner läsas, och aldrig på ett sätt som ändrar betydelsen.
Timing och visningstid
- Börja med talet. BBC:s riktlinjer säger att en undertext ska läggas vid det ögonblick talet börjar och att eftersläpningen ska hållas till ett minimum.
- Kortaste visningstid. Netflix sätter en undre gräns på fem sjättedels sekund (20 bildrutor vid 24 bilder per sekund). DCMP Captioning Key anger 40 bildrutor – 1 sekund och 10 bildrutor. BBC föreslår att du siktar på omkring 0,3 sekunder per ord, så en undertext på fyra ord ligger kvar i ungefär 1,2 sekunder.
- Längsta visningstid. Netflix sätter gränsen vid 7 sekunder per undertext och DCMP vid 6. En undertext som ligger kvar långt efter att orden tagit slut stämmer inte längre med det tittaren hör.
- Klippgränser. BBC avråder från undertexter som sträcker sig över ett klipp: dela meningen, eller låt den nya undertexten börja vid klippet. Snabbt klippta sociala videor gör det svårt att följa strikt, men undvik en undertext som blinkar förbi under några bildrutor precis före ett klipp.
Var du ska bryta raderna
Bryt raden där den som talar naturligt skulle pausa, helst efter ett skiljetecken. BBC listar par som bör hålla ihop på samma rad:
- en artikel och dess substantiv (ett bord, en bok);
- en preposition och frasen efter den (på bordet);
- en konjunktion och satsen efter den (och de där böckerna);
- ett pronomen och dess verb (de kommer);
- delarna i en sammansatt verbform (har hållit på att göra).
Netflix engelska riktlinje säger att du ska bryta efter skiljetecken och före konjunktioner eller prepositioner, och att du inte ska dela ett namn, skilja ett adjektiv från sitt substantiv eller ett subjekt från sitt verb. DCMP Captioning Key säger på samma sätt att du inte ska dela en persons namn eller skilja en titel från namnet den hör till.
Klumpigt Vi lanserade den
nya appen i mars.
Bättre Vi lanserade
den nya appen i mars.Radbrytningar är ändå inte det viktigaste. BBC säger att när bra radbrytningar krockar med välredigerad text och bra timing väger texten och timingen tyngre.
Placering i stående video
Traditionella undertexter ligger centrerat längst ner i bild och flyttas när de skulle täcka något viktigt. DCMP säger att undertexterna ska flyttas upp när de skulle skymma ansiktet på den som talar eller viktig text i bild, och Netflix placerar undertexterna där de är lättast att läsa när text visas i bild.
Stående plattformar lägger till ytterligare ett hinder: appens eget gränssnitt. På TikTok, Reels och Shorts ligger kreatörens namn och inläggstexten över nederkanten av videon, och knapparna för gilla, kommentera och dela löper längs högerkanten.
- Höj undertexterna. BBC noterar att det i stående video är vanligt att lägga undertexterna lite högre upp, men oftast fortfarande i den nedre tredjedelen, eftersom ansikten brukar hamna i bildens övre halva.
- Lämna en marginal till höger så att orden inte hamnar under knapparna, och håll raderna centrerade.
- Håll munnar och text i bild fria. Flytta hellre en undertext än att låta den täcka en produktbild eller en titel.
- Testa i en telefon. Apparnas layout ändras och skiljer sig mellan enheter, så ladda upp ett test och kontrollera det på en riktig skärm i stället för att lita på en fast mall.
Kontrast, kontur och storlek
En undertext måste vara läsbar mot varje bildruta, från ett mörkt rum till en vit vägg bakom den som talar. Det finns tre pålitliga sätt att lyckas med det:
- En bakgrundsruta. BBC:s standard är vit text på svart bakgrund. DCMP Captioning Key föredrar en genomskinlig ruta, så att texten syns även mot ljus bakgrund.
- En kontur eller skugga. DCMP vill ha vita tecken i mellanfet sans serif med slagskugga eller kantskugga. I feta sociala stilar gör en heltäckande mörk kontur samma jobb.
- Mätt kontrast. WCAG:s lägsta kontrastvärde för text är 4,5:1 (framgångskriterium 1.4.3). Det är skrivet för text på webbsidor snarare än för text i video, men det är ett rimligt riktmärke för undertexten mot dess ruta eller kontur.
När det gäller storlek anger BBC undertextens radhöjd som en andel av videons höjd: 7–8 % för liggande, 4:3 och kvadratisk video, och 3,9–4,5 % för stående video i 9:16. Sociala undertextstilar är ofta större och fetare än så. Det kan fungera, så länge raderna är korta nog att få plats och texten inte täcker motivet.
Till sist versalerna. DCMP föredrar blandade gemener och versaler för läsbarhetens skull och sparar versaler till när någon skriker. Stilar med bara versaler är vanliga i korta videor – använder du en sådan bör du hålla undertexterna ännu kortare.
Talare, ljud och musik
Tittare som inte kan höra ljudet – för att de är döva eller hörselskadade, eller bara scrollar utan ljud – behöver mer än dialogen.
- Talarbyten. Gör det tydligt när någon ny börjar tala. BBC använder ett litet antal textfärger mot svart – vitt, gult, cyan och grönt – och håller varje talares färg konsekvent. Netflix engelska riktlinje lägger till talarens namn inom hakparentes bara när tittaren inte kan se vem som talar. DCMP föredrar att undertexten placeras under den som talar, med namnet inom parentes när placeringen inte räcker.
- Ljudeffekter. Texta de ljud som har betydelse för berättelsen eller poängen. Konventionerna skiljer sig åt: BBC skriver ljudetiketter med vita versaler som korta fraser med subjekt och verb, till exempel GOLVET KNARRAR, Netflix använder hakparenteser och gemener, som [dörr slår igen], och DCMP sätter beskrivningen inom hakparentes och namnger ljudkällan.
- Musik. DCMP sätter sjungen text mellan notsymboler (♪). För bakgrundsmusik räcker en kort beskrivning av stämningen inom hakparentes, när den har betydelse.
- Välj ett sätt och håll fast vid det. Att vara konsekvent inom en video betyder mer än vilket system du väljer.
Korrekthet: namn, siffror och fackuttryck
Automatisk taligenkänning ger dig ett snabbt första utkast, och den gör förutsägbara fel. YouTubes hjälpcenter varnar för att deras automatiska undertexter kan återge det som sades felaktigt på grund av uttal, brytning, dialekt eller bakgrundsljud. Kontrollera det här för hand varje gång:
- Namn på personer, varumärken, produkter och platser, inklusive stora begynnelsebokstäver.
- Siffror, priser, datum och enheter. Välj ett sätt att skriva tal och håll dig till det. DCMP skriver ut ett till tio med bokstäver och använder siffror över tio.
- Fackuttryck och förkortningar från ditt område, som en allmän taligenkänning kanske inte känner till.
- Ord som låter lika, som de och dem, var och vart, än och en.
- Utfyllnadsord och omtagningar. Bestäm om du ska behålla ”öh” och upprepade ord. Att ta bort dem hjälper läshastigheten, att behålla dem bevarar talarens tonfall. Ta aldrig bort ett ord som ändrar betydelsen.
Rättningen ska gå snabbt. I AutoCap har varje ord sin egen start- och sluttid, så du kan rätta ett felhört namn, dela en lång rad eller finjustera ett enskilt ord utan att göra om timingen för allt runt omkring.
Stilar ord för ord och karaoke
Undertexter ord för ord visar ett till några få ord åt gången, eller låter en rad växa fram ord efter ord. Karaokestilar visar hela raden och markerar varje ord när det sägs. Båda är vanliga i korta videor eftersom rörelse drar till sig blicken. De förändrar också hur man läser:
- Mindre text åt gången betyder att man inte kan läsa i förväg. Med en hel rad på skärmen hinner tittaren ta in frasen och titta tillbaka på bilden. När orden kommer ett i taget går det bara att läsa i talarens takt, och blicken fastnar på texten.
- Tv-riktlinjerna ser det som ett undantag. BBC säger att kumulativa undertexter – där en del av undertexten dyker upp efter resten – bara bör användas när det finns ett gott skäl, som dramatisk effekt eller rytmen i en låt.
- Animeringen konkurrerar med orden. En studs eller färgväxling på varje ord är mer att bearbeta än en stillastående rad med en enda markering.
Använd dem till korta, snärtiga klipp, hooks i de första sekunderna och betoning på ett nyckelord. Byt till en lugnare stil för instruktionsvideor, intervjuer, längre förklaringar och snabbt tal. Karaokemarkering är ofta den bästa kompromissen: hela frasen går att läsa medan det aktiva ordet markeras. Det fungerar bara om markeringen landar på ordet när det sägs, och därför är timing per ord avgörande – en markering som ligger en halv sekund före läses som ett fel. Du kan jämföra olika grepp i galleriet med undertextstilar.
Checklista
- En eller två rader per undertext, upp till tre korta rader i stående video.
- Omkring 25 tecken per rad eller färre i stående video, högst 37–42 i liggande video.
- Läshastighet på högst ungefär 20 tecken per sekund (17 för barninnehåll), eller 160–180 ord per minut.
- Ingen undertext på skärmen kortare än ungefär en sekund eller längre än 6–7 sekunder.
- Undertexterna startar med talet och sträcker sig inte över klippgränser.
- Radbrytningar vid naturliga frasgränser, aldrig mitt i ett namn eller mellan artikel och substantiv.
- Undertexterna fria från ansikten, text i bild och appens knappar, kontrollerat i en telefon.
- Hög kontrast med ruta, kontur eller skugga, testad mot både ljusa och mörka bildrutor.
- Talarbyten och viktiga ljud markerade på ett och samma sätt.
- Namn, siffror och fackuttryck kontrollerade av en människa.
- Animering ord för ord sparad till korta klipp.
Läs öppen kontra dold textning för när du ska bränna in undertexterna och när du ska publicera en undertextfil.