Artikel
Kata, karakter, dan huruf besar-kecil: bagaimana penghitungan teks sebenarnya bekerja
Menghitung teks terdengar seperti satu-satunya pekerjaan yang tidak mungkin salah dilakukan komputer, tetapi dua alat bisa saja memberikan angka berbeda untuk paragraf yang sama, satu emoji bisa menghabiskan 70 karakter SMS-mu, dan «280 karakter» di X tidak berarti seperti yang terlihat. Di balik pekerjaan sehari-hari seperti menulis sesuai batas, mengganti nama variabel, atau mengisi mockup, ada beberapa aturan yang layak diketahui. Artikel ini membahasnya satu per satu, menggunakan alat teks kecil di situs ini sebagai contoh nyata.
Apa yang dihitung sebagai kata
Sebagian besar penghitung, termasuk milik kami, mendefinisikan kata seperti yang dilakukan juru ketik: rangkaian karakter yang terlihat di antara spasi atau ganti baris. Satu aturan ini saja sudah menjelaskan sebagian besar perbedaan hasil. Apakah «anak-anak» satu kata atau dua? Dengan pemisahan di spasi, satu. Bagaimana dengan «warna-warni»? Satu. Angka, URL, dan alamat e-mail juga masing-masing dihitung sebagai satu kata. Konvensi ini runtuh untuk bahasa yang ditulis tanpa spasi: dalam bahasa Mandarin atau Jepang tidak ada spasi untuk memisahkan, sehingga «jumlah kata» tidak bermakna dan sebaiknya menghitung karakter saja. Perkiraan waktu baca menumpuk konvensi kedua: penghitung kata kami membagi jumlah kata dengan 200 kata per menit, rata-rata umum untuk membaca diam orang dewasa, jadi anggap hasilnya sebagai angka perencanaan, bukan janji.
Satu karakter tidak selalu satu simbol
Penghitungan karakter lebih keruh, karena teks Unicode memiliki beberapa lapisan. Apa yang kamu rasakan sebagai satu karakter (grafem) bisa dibangun dari beberapa titik kode, dan setiap titik kode menempati satu atau dua dari unit 16-bit yang dihitung oleh properti length JavaScript. Emoji wajah tersenyum adalah satu grafem tetapi dua unit tersebut, sehingga penghitung sederhana akan menyebutkan 2. Emoji keluarga yang dibentuk dengan menggabungkan beberapa emoji orang adalah satu grafem, lima titik kode, dan delapan unit. Bahkan teks biasa pun punya masalah ini: «café» bisa disimpan dengan é sebagai satu titik kode atau sebagai e diikuti aksen penggabung, terlihat identik di layar tetapi berbeda dalam hitungan. Inilah sebabnya dua penghitung bisa berbeda hasil: keduanya mengukur lapisan yang berbeda. Aturan pengelompokan titik kode menjadi karakter yang dipersepsikan pengguna distandarkan dalam lampiran segmentasi teks Unicode (UAX #29), dan penghitung yang dirancang dengan baik mengikutinya.

Batas yang sebenarnya kamu hitung
Batas karakter adalah tempat penghitungan berubah menjadi uang. Satu SMS membawa 160 karakter dalam alfabet ringkas GSM-7, tetapi satu karakter saja di luar itu (emoji, atau huruf yang tidak dimiliki alfabet tersebut) mengalihkan seluruh pesan ke UCS-2 dan batas turun menjadi 70; pesan panjang terbagi menjadi bagian-bagian 153 atau 67 karakter, masing-masing ditagih terpisah. X mengizinkan 280 karakter per unggahan, tetapi memberi bobot: setiap URL dihitung sebagai 23 tanpa memandang panjang aslinya, dan sebagian besar emoji serta karakter CJK dihitung sebagai 2. Cuplikan hasil pencarian justru punya batas yang lentur: Google memotong judul dan deskripsi berdasarkan lebar piksel, sehingga angka umum 60 karakter untuk judul dan 155 untuk deskripsi adalah konvensi kerja, bukan jaminan. Ketika sebuah batas benar-benar penting, hitunglah dengan aturan yang sama seperti yang dipakai platform tersebut, dan sisakan ruang.
Huruf besar-kecil adalah konvensi, dan setiap gaya punya tempatnya
Mengubah huruf besar-kecil terdengar sepele sampai kamu bertemu tumpukan konvensi di atasnya. Prosa mengenal Title Case, favorit judul berita Amerika Serikat, dan sentence case, yang disukai sebagian besar panduan gaya Eropa. Kode punya keluarganya sendiri: camelCase untuk variabel di JavaScript dan Java, PascalCase untuk nama kelas dan komponen, snake_case di Python dan basis data, SCREAMING_SNAKE_CASE untuk konstanta, dan kebab-case untuk kelas CSS, nama berkas, dan slug URL, di mana huruf kecil menghindari jebakan klasik tautan yang hanya berbeda huruf besar-kecil. Mengonversi segelintir pengenal secara manual masih aman-aman saja; mengonversi daftar delapan puluh adalah cara salah ketik lahir. Konverter huruf besar-kecil menerapkan transformasi itu secara mekanis, termasuk bagian yang rumit seperti memutuskan apa yang terjadi pada akronim dan pemisah yang sudah ada.

Teks pengisi, dan berkas yang ditolak dibuka ponselmu
Dua pekerjaan lagi melengkapi daftar ini. Tata letak dinilai dengan teks pengisi karena kalimat sungguhan menarik perhatian ke maknanya sendiri; lorem ipsum berhasil justru karena hampir, tetapi tidak sepenuhnya, bahasa Latin yang bisa dibaca. Generator kami membuatnya per paragraf, kalimat, atau kata, sehingga mockup bisa diisi dengan panjang yang realistis alih-alih satu blok tempel yang diulang-ulang. Dan ketika seseorang mengirim berkas .md, .json, .csv, atau .log yang ditolak dibuka ponselnya, penampil teks berbasis peramban menampilkannya tanpa memasang editor atau meneruskan berkas itu ke situs konversi mana pun. Semua di atas, termasuk penghitungan, berjalan sepenuhnya di peramban kamu: teks tidak pernah meninggalkan perangkatmu, yang lebih penting dari biasanya ketika yang kamu ukur adalah draf, kontrak, atau log yang penuh jalur internal.
Alat dalam artikel ini
- Penghitung KataHitung kata, karakter, kalimat, paragraf, dan perkirakan waktu membaca. Langsung, tanpa unggah.
- Konverter HurufKonversi teks antara camelCase, snake_case, kebab-case, Title Case, dan lainnya. Tanpa unggah.
- Generator Lorem IpsumBuat teks placeholder lorem ipsum berdasarkan paragraf, kalimat, atau kata. Salin dalam satu klik. Tanpa unggah.
- Penampil teks / kodeBuka berkas teks dan kode yang ditolak ponsel Anda, Markdown, HTML, JSON, CSV, XML, dan lainnya.
Pertanyaan yang sering diajukan
Berapa banyak kata yang muat dalam satu halaman?
Konvensi penerbitan menyebutkan sekitar 500 kata untuk halaman berspasi tunggal dan sekitar 250 kata untuk halaman berspasi ganda, dengan asumsi fon standar 12 poin pada kertas A4 atau letter. Dokumen nyata bergeser dari angka-angka itu setiap kali fon, margin, atau judul berubah, itulah sebabnya tugas dan pengumpulan makin sering menetapkan jumlah kata, bukan jumlah halaman. Jika kamu sudah punya teksnya, hitung saja langsung dan lewati perkiraan; konvensi halaman hanya berguna sebelum teks itu ada.
Apa sebenarnya arti lorem ipsum?
Itu adalah bahasa Latin yang diacak, bukan omong kosong. Bagian standarnya dipotong dan disusun ulang dari De finibus bonorum et malorum karya Cicero, teks filsafat dari tahun 45 SM; pecahan «dolorem ipsum» berarti «rasa sakit itu sendiri». Pengacakan itulah intinya: teks itu terlihat seperti bahasa alami, dengan panjang kata dan ritme kalimat yang masuk akal, tetapi menolak untuk dibaca, sehingga orang menilai tata letak, bukan isinya. Penyebarannya di era modern biasanya dikaitkan dengan lembar transfer Letraset pada tahun 1960-an dan perangkat lunak desktop publishing pada tahun 1980-an.
Mengapa suatu platform menghitung lebih sedikit karakter daripada penghitungku?
Karena platform menghitung dengan bobotnya sendiri. X mulai dari 280 tetapi menagih setiap URL sebagai 23 karakter dan sebagian besar emoji serta karakter CJK sebagai 2 karakter masing-masing. Gateway SMS mengalihkan seluruh pesan dari alfabet GSM-7 160 karakter ke mode UCS-2 70 karakter begitu satu karakter saja membutuhkannya. Dan platform mana pun bisa menghitung unit kode, bukan grafem, sehingga satu emoji keluarga saja bisa menghabiskan 8 unit dari batasnya. Ketika angka pada tombol tidak cocok dengan penghitungmu, aturan platform yang menang; tulislah dengan ruang lebih atau periksa dengan penghitung milik platform itu sendiri sebelum mengirim.