PlayPendium
WordChess · Bahan Renungan

Mengajari mesin 149.000 kata, dalam 22 bahasa

Permainan kata membutuhkan lebih dari sekadar daftar untaian huruf yang sah. Ia perlu menjelaskan apa arti masing-masing, dan makna adalah hal yang paling sulit disimpan.

Ditulis dan disunting dalam bahasa Inggris. Versi bahasa Indonesia ini dihasilkan oleh terjemahan mesin; jika ketepatan menjadi penting, naskah asli berbahasa Inggris adalah yang berlaku. Baca naskah asli dalam bahasa Inggris →

01 · Lema dan bayang-bayangnya

Satu kata, dan semua bentuk yang dapat diambilnya

WordChess dimainkan di papan 25×25 dengan kamus bahasa Inggris berisi 148.941 kata 6, dengan panjang entri rata-rata 8,6 huruf dan yang terpanjang mencapai 27 huruf. Itu bagian yang mudah. Daftar kata yang sah hanyalah sekumpulan untaian huruf yang akan diterima permainan. Bagian yang menarik adalah memberi tahu pemain apa arti untaian huruf di papan, dan melakukannya dalam dua puluh dua bahasa sekaligus.

Para leksikograf menarik garis tegas antara lema dan bentuk-bentuk infleksinya. Lema adalah kata kepala yang Anda cari di kamus, misalnya run ("berlari"), house ("rumah"), be ("menjadi"). Di sekelilingnya beredar paradigma bentuk permukaan: runs, ran, running. Masing-masing membawa makna inti yang sama, dikenakan untuk peran gramatikal yang berbeda. 3 Kamus mencurahkan uraiannya pada lema dan membiarkan bayang-bayangnya sekadar menunjuk kembali ke sana.

Berapa banyak bayang-bayang yang dimiliki sebuah kata bergantung pada bahasanya. Bahasa Inggris bersifat analitis: ia bertumpu pada urutan kata dan kata-kata bantu kecil, sehingga sebuah verba jarang memiliki lebih dari segelintir bentuk. Bahasa Finlandia bersifat aglutinatif, membangun makna dengan menempelkan akhiran pada sebuah akar. Satu nomina bahasa Finlandia berinfleksi untuk sekitar lima belas kasus, dalam bentuk tunggal dan jamak, sebelum akhiran posesif dan klitik ditumpuk di atasnya; jumlah praktis bentuk yang berbeda mencapai ribuan. 4 Bahasa Hungaria memadatkan satu frasa bahasa Inggris utuh, in my house ("di rumahku"), menjadi satu kata, házamban. 5

02 · Kamus yang ditulis oleh semua orang

Di mana definisi-definisi itu berada

Definisinya berasal dari Wiktionary, kamus bebas yang dapat disunting siapa saja. Kamus ini sangat besar dan multibahasa: proyeknya mencakup jauh lebih dari seratus edisi bahasa yang aktif dan puluhan juta entri, ditulis secara kolaboratif oleh sukarelawan, bukan oleh dewan redaksi bergaji. 1 Untuk permainan yang berjalan dalam 22 bahasa, tidak ada leksikon bebas lain yang mendekati cakupannya.

Namun cakupan di atas kertas bukanlah cakupan yang bisa Anda bacakan. Wiktionary menyimpan bentuk infleksi dengan cara yang menghindarkan para penyunting manusia dari menulis glosa yang sama sepuluh ribu kali. Alih-alih menuliskan definisi, entri non-lema membawa templat form-of ("bentuk dari"), penunjuk kecil yang pada dasarnya menyatakan, "ini adalah bentuk gramatikal tertentu dari lema itu." 2 Entri untuk smoulders bukanlah uraian; ia adalah templat yang ditampilkan sebagai "third-person singular simple present form of smoulder" (bentuk kini orang ketiga tunggal dari smoulder, "membara"). 1

Penunjuk-penunjuk ini bukan sekadar pembulatan kecil. Di Wiktionary bahasa Inggris, dari sekitar 1,27 juta definisi, sekitar 478.000, jauh lebih dari sepertiga, adalah definisi "bentuk dari" alih-alih makna yang dituliskan lengkap. 1 Datanya ada. Hanya saja terlipat.

03 · Masalah penguraian, bukan kekosongan data

Glosa adalah templat yang dibuka lipatannya

Jadi tantangan yang penting tidak pernah berupa "katanya tidak ada." Tantangannya adalah makna kata itu tersimpan di dalam templat yang akan dibuang begitu saja oleh pengurai yang naif. Definisi WordChess dibangun dengan membaca dump mentah Wiktionary dan menjabarkan templat infleksi bahasa demi bahasa, mengajari pengurai apa arti setiap penunjuk dan menuliskannya kembali sebagai glosa sederhana. 6

Setiap bahasa menyembunyikan bentuk-bentuknya di balik mesin yang berbeda. Bahasa Spanyol menyelipkan bentuk verba di balik {{forma verbo}}, yang diuraikan menjadi "bentuk verba dari X." Bahasa Jerman memakai {{Grundformverweis Dekl/Konj}} untuk bentuk deklinasi dan konjugasi. Bahasa Finlandia bertumpu pada {{taivutusmuoto}}. Bahasa Rusia sering kali tidak menyimpan templat bentuk sama sekali; kata berinfleksinya hanyalah pengalihan polos (собаки → собака) yang harus diikuti untuk memperoleh glosa "bentuk dari". 6 Tangani setiap konvensi, dan cakupannya melonjak.

Cakupan definisi, sebelum → sesudah penjabaran templat
BahasaSebelumSesudahKenaikan
Jerman45%92%+47
Belanda58%90%+32
Finlandia54%74%+20
Rusia20%70%+50
Yunani15%57%+42

Diukur dari catatan desain dan pembangunan proyek ini. Persentase adalah bagian entri kamus yang memiliki definisi yang dapat digunakan atau glosa "bentuk dari" yang telah diuraikan.

Datanya tidak pernah hilang. Ia terlipat di dalam sebuah penunjuk, dan memberikan kata itu kepada mesin berarti belajar membuka lipatannya.

04 · Apa arti "mengetahui sebuah kata" bagi mesin

Sebuah untaian huruf, dan sebuah kalimat tentangnya

Ada baiknya jujur tentang apa yang kini dimiliki permainan ini. Ketika WordChess menunjukkan bahwa собаки adalah bentuk dari собака, "anjing," ia tidak memahami apa pun. Ia memetakan satu untaian huruf ke untaian lain, yaitu glosa, dengan mengikuti penunjuk yang sama yang ditinggalkan penyunting manusia. Inilah lematisasi, pekerja keras dalam pemrosesan bahasa alami: mereduksi bentuk permukaan menjadi bentuk dasarnya sehingga mesin memiliki lebih sedikit hal berbeda untuk dilacak. 7

Itu adalah jenis pengetahuan yang nyata dan berguna. Ia memungkinkan permainan menjawab "kata apa ini?" di Athena atau Amsterdam tanpa leksikograf di antara stafnya. Tetapi itu adalah mengetahui-sebagai-pencarian, bukan mengetahui-sebagai-makna. Glosa adalah janji bahwa seseorang yang membacanya akan mengenali kata tersebut. Mesin memegang janji itu; pembacalah yang menghadirkan maknanya.

Di mana temboknya

Sebagian bahasa menabrak batas atas yang tidak dapat diangkat oleh pengurai mana pun, karena datanya memang tidak ada untuk dibuka. Entri bahasa Hungaria sering hanya memuat etimologi dan tabel terjemahan, tanpa teks definisi sama sekali, sehingga pembaca yang sempurna pun pulang dengan tangan kosong. Kasus tersulit berkumpul di tempat linguistiknya paling sulit: bahasa aglutinatif seperti Finlandia dan Hungaria, yang melahirkan paradigma sangat besar, serta aksara Sirilik dan Yunani, yang sejak awal cakupan komunitasnya lebih tipis. Bahasa Yunani naik dari 15% menjadi 57%; bahwa angka itu berhenti jauh di bawah 92% milik bahasa Jerman adalah fakta tentang sumbernya, bukan tentang kodenya. 6

Sources & notes
  1. Wikipedia, "Wiktionary", scale, multilingual structure, collaborative editing, and the "form of" definition counts (including the smoulders example). en.wikipedia.org/wiki/Wiktionary
  2. Wiktionary, "Wiktionary:Form-of templates", how non-lemma entries point back to a lemma on the definition line. en.wiktionary.org/wiki/Wiktionary:Form-of_templates
  3. Wikipedia, "Lemma (morphology)", lemma as citation form; the paradigm of inflected forms. en.wikipedia.org/wiki/Lemma_(morphology)
  4. Wikipedia, "Finnish noun cases", the roughly fifteen cases, in singular and plural, before possessive suffixes and clitics stack on top. en.wikipedia.org/wiki/Finnish_noun_cases. Broader context: en.wikipedia.org/wiki/Finnish_grammar
  5. "Morphology of Different Languages," Psychology of Language (BCcampus Open Textbook), analytic vs. agglutinative typology; the házamban example. opentextbc.ca/psyclanguage/chapter/morphology-of-different-languages/
  6. WordChess definition pipeline, template-expansion rules per language (Spanish {{forma verbo}}, German {{Grundformverweis}}, Finnish {{taivutusmuoto}}, Russian redirects) and coverage figures. Measured from this project's design and build notes.
  7. Wikipedia, "Lemmatization", reducing inflected forms to a base form in NLP. en.wikipedia.org/wiki/Lemmatization
  8. Further reading on Wiktionary, [1011.1368] Transformation of Wiktionary entry structure into tables and relations in a relational database schema. arxiv.org.
  9. Further reading on Wiktionary, CEFR vocabulary level as a predictor of user interest in English Wiktionary entries. doi.org.
  10. Further reading on Lemmatization, BioLemmatizer: a lemmatization tool for morphological processing of biomedical text - PMC. ncbi.nlm.nih.gov.
Was this worth reading?
Play WordChess
PlayPendium · About · Contact · Privacy · Terms · Cookies · Accessibility · Copyright · Browse all games · Classic arcade games · © 2026