Artikel
Ord, tegn og store/små bogstaver: sådan fungerer optælling af tekst egentlig
At tælle tekst lyder som den ene opgave, en computer ikke kan gøre forkert, og alligevel giver to værktøjer villigt forskellige tal for det samme afsnit, en emoji kan koste dig 70 SMS-tegn, og «280 tegn» på X betyder ikke det, det ser ud til. Bag de daglige gøremål med at skrive inden for en grænse, omdøbe variabler eller udfylde en mockup ligger nogle regler, det er værd at kende. Denne artikel gennemgår dem og bruger de små tekstværktøjer på dette site som praktiske eksempler.
Hvad der tæller som et ord
De fleste tællere, vores inklusive, definerer et ord, som maskinskrivere gjorde det: en række synlige tegn mellem mellemrum eller linjeskift. Denne ene regel forklarer allerede de fleste uenigheder. Er «sms-besked» ét ord eller to? Ved opdeling på mellemrum: ét. Er «e-mail» ét ord eller to? Ét. Tal, URL'er og e-mailadresser tæller også hver især som et ord. Konventionen bryder sammen for sprog, der skrives uden mellemrum: på kinesisk eller japansk er der ikke noget mellemrum at dele ved, så en «ordoptælling» giver ikke mening, og man bør i stedet arbejde med tegnoptælling. Estimater for læsetid lægger en anden konvention oveni: vores ordtæller dividerer ordantallet med 200 ord i minuttet, et almindeligt gennemsnit for stille læsning hos voksne, så betragt resultatet som et planlægningstal, ikke et løfte.
Et tegn er ikke altid ét symbol
Tegnoptælling er mere uklar, fordi Unicode-tekst har lag. Det, du opfatter som ét tegn (et grafem), kan være bygget op af flere kodepunkter, og hvert kodepunkt optager en eller to af de 16-bit enheder, som JavaScripts length-egenskab tæller. Emojien med det grinende ansigt er ét grafem, men to af disse enheder, så en naiv tæller siger 2. En familieemoji, dannet ved at sammenføje flere person-emojier, er ét grafem, fem kodepunkter og otte enheder. Selv almindelig tekst har dette problem: «café» kan gemmes med é som ét kodepunkt eller som et e efterfulgt af en kombinerende accent, identisk på skærmen, men forskelligt i optællingen. Det er derfor, to tællere er uenige: de måler forskellige lag. Reglerne for at gruppere kodepunkter til tegn, som brugeren opfatter dem, er standardiseret i Unicodes bilag om tekstsegmentering (UAX #29), og veludførte tællere følger det.

De grænser, du reelt tæller for
Tegngrænser er der, hvor optælling bliver til penge. En SMS bærer 160 tegn i det kompakte GSM-7-alfabet, men ét enkelt tegn uden for det (en emoji eller et bogstav, alfabetet ikke har) skifter hele beskeden til UCS-2, og grænsen falder til 70; lange beskeder deles op i dele på 153 eller 67 tegn, hver faktureret separat. X tillader 280 tegn pr. opslag, men vægter dem: hver URL tæller som 23 uanset dens reelle længde, og de fleste emojier og CJK-tegn tæller som 2. Søgeresultatuddrag har i stedet bløde grænser: Google afkorter titler og beskrivelser efter pixelbredde, så de velkendte tal på 60 tegn for titlen og 155 for beskrivelsen er arbejdskonventioner snarere end garantier. Når en grænse virkelig betyder noget, så tæl efter de samme regler, som platformen bruger, og efterlad en margin.
Bogstavstørrelse er en konvention, og hver stil har et hjem
At ændre bogstavstørrelse lyder trivielt, indtil man støder på de konventioner, der hober sig op ovenpå det. Løbende tekst kender Title Case, favoriseret af amerikanske overskrifter, og sentence case, som de fleste europæiske stilguider foretrækker. Kode har sine egne familier: camelCase til variabler i JavaScript og Java, PascalCase til klasse- og komponentnavne, snake_case i Python og databaser, SCREAMING_SNAKE_CASE til konstanter og kebab-case til CSS-klasser, filnavne og URL-slugs, hvor små bogstaver undgår den klassiske fælde med links, der kun adskiller sig ved bogstavstørrelse. At konvertere en håndfuld identifikatorer i hånden er fint; at konvertere en liste på firs er sådan, tastefejl opstår. En konverter til store/små bogstaver anvender omdannelsen mekanisk, herunder de vanskelige dele som at afgøre, hvad der skal ske med forkortelser og eksisterende skilletegn.

Fyldtekst, og filer din telefon nægter at åbne
To gøremål mere fuldender sættet. Layouts bedømmes med fyldtekst, fordi rigtige sætninger trækker opmærksomheden hen på deres betydning; lorem ipsum virker netop, fordi det er næsten, men ikke helt, læselig latin. Vores generator producerer det afsnits-, sætnings- eller ordvis, så en mockup kan udfyldes med realistiske længder i stedet for én indsat blok gentaget igen og igen. Og når nogen sender en .md-, .json-, .csv- eller .log-fil, som telefonen nægter at åbne, viser en browserbaseret tekstvisning den uden at installere et redigeringsprogram eller videresende filen til et konverteringssite. Alt ovenstående, optælling inklusive, kører helt i din browser: teksten forlader aldrig din enhed, hvilket betyder mere end normalt, når det, du måler, er et udkast, en kontrakt eller en log fuld af interne stier.
Værktøjer i denne artikel
- OrdtællerTæl ord, tegn, sætninger, afsnit og estimér læsetid. Live, ingen upload.
- Store/små bogstaver-konverterKonverter tekst mellem camelCase, snake_case, kebab-case, Title Case og mere. Ingen upload.
- Lorem Ipsum-generatorGenerer lorem ipsum-pladsholdertekst i afsnit, sætninger eller ord. Kopiér med ét klik. Ingen upload.
- Tekst- og kodevisningÅbn tekst- og kodefiler, som din telefon afviser, Markdown, HTML, JSON, CSV, XML og mere.
Ofte stillede spørgsmål
Hvor mange ord er der plads til på en side?
Forlagskonventionerne regner med omkring 500 ord for en side med enkelt linjeafstand og omkring 250 for en med dobbelt linjeafstand, forudsat en standard 12-punkts skrifttype på A4- eller letter-papir. Rigtige dokumenter afviger fra disse tal ved hver ændring af skrifttype, margen eller overskrift, og det er derfor, opgaver og afleveringer i stigende grad angiver et ordantal i stedet for et sideantal. Hvis du allerede har teksten, så tæl den direkte, og spring estimatet over; sidekonventionerne er kun nyttige, før teksten findes.
Hvad betyder lorem ipsum egentlig?
Det er omrodet latin, ikke volapyk. Standardpassagen er klippet og omrokeret fra Ciceros De finibus bonorum et malorum, en filosofisk tekst fra 45 f.Kr.; fragmentet «dolorem ipsum» betyder «selve smerten». Omrokeringen er selve pointen: teksten ligner naturligt sprog med troværdige ordlængder og sætningsrytme, men modstår at blive læst, så betragteren bedømmer layoutet i stedet for indholdet. Dens moderne udbredelse tilskrives normalt Letraset-overføringsark i 1960'erne og software til computerbaseret satsning i 1980'erne.
Hvorfor tæller en platform færre tegn end min tæller?
Fordi platforme tæller med deres egne vægte. X starter ved 280, men fakturerer hver URL som 23 tegn og de fleste emojier og CJK-tegn som 2 hver. SMS-gateways skifter hele beskeden fra det 160-tegns GSM-7-alfabet til den 70-tegns UCS-2-tilstand, så snart ét tegn kræver det. Og enhver platform kan tælle kodeenheder i stedet for grafemer, så en enkelt familieemoji kan bruge 8 enheder af grænsen. Når tallet på knappen ikke stemmer med din tæller, vinder platformens regler; skriv med margin, eller tjek med platformens egen tæller, før du sender.