1 poin oleh GN⁺ 2024-10-15 | 2 komentar | Bagikan ke WhatsApp
  • Naskah berbahasa Tibet tidak cocok dengan asumsi paragraf pendek pada pengolah kata umum, sehingga sejak lama menghadapi keterbatasan praktis dalam alat penyuntingan dan penerbitan digital
  • BDRC telah mendorong peningkatan teknologi agar bahasa Tibet dapat ditangani dengan baik di lingkungan digital, dan kali ini dukungan LibreOffice untuk paragraf yang sangat panjang menjadi kemajuan kunci
  • Aliran teks panjang tanpa pemaksaan pindah baris dan minim spasi berbeda dari cara pemrosesan dokumen berbahasa Inggris, sehingga masalah performa mudah muncul saat membuka atau mengonversi naskah Tibet yang panjang
  • Berkat perbaikan oleh Jonathan Clark, teks satu “paragraf” sepanjang 153 halaman seperti Yishindzö karya Longchenpa kini bisa dibuka dan disunting dengan cepat, dan konversi RDF ke PDF yang sebelumnya terhenti lebih dari 45 menit kini selesai dalam 13 detik
  • Dukungan untuk paragraf yang sangat panjang telah diintegrasikan ke LibreOffice 24.8.2 yang dirilis pada 27 September 2024, sehingga pengguna bahasa Tibet dapat lebih realistis memanfaatkan alat penerbitan gratis dan open source

Mengapa dukungan digital untuk bahasa Tibet itu penting

  • Salah satu misi penting BDRC adalah inovasi teknologi untuk menjadikan bahasa Tibet warga kelas satu di dunia digital
  • Sejak masuknya agama Buddha pada abad ke-8, masyarakat Tibet telah mencurahkan banyak energi dan sumber daya pada penulisan, inovasi, dan teknologi
    • Aksara Tibet dan bahasa klasiknya dibuat untuk menerjemahkan naskah Buddhis berbahasa Sanskerta dan Tionghoa ke bahasa yang dapat dipahami orang Tibet
    • Pada abad ke-14, cetak balok kayu diadopsi secara luas untuk memproduksi massal terjemahan kitab suci dan ribuan volume naskah Buddhis Tibet karya penulis Himalaya
    • Kemunculan font komputer bahasa Tibet dan penyertaannya dalam Unicode Standard menjadi lompatan besar dalam proses integrasi bahasa Tibet ke dunia digital

Struktur naskah Tibet yang tidak cocok dengan pengolah kata umum

  • Naskah berbahasa Tibet memiliki karakteristik yang masih belum sepenuhnya didukung oleh semua alat dan aplikasi
  • Secara khusus, konsep paragraf ala bahasa-bahasa Eropa tidak berlaku dengan cara yang sama
    • Teks Tibet sering perlu diperlakukan sebagai aliran panjang yang berlanjut tanpa pemaksaan pindah baris
    • Aliran ini kadang bisa mencapai ratusan hingga ribuan halaman
  • Pengolah kata pada umumnya sejak awal dirancang dengan teks bahasa Inggris sebagai acuan
    • Mengasumsikan paragraf yang relatif pendek
    • Menganggap ada spasi antarkata, dan lebar spasi itu bisa diatur secara fleksibel
  • Naskah Tibet pada praktiknya nyaris tidak memiliki batas panjang paragraf dan sangat sedikit spasi, sehingga bertabrakan dengan asumsi-asumsi tersebut
  • Akibatnya, saat membuka teks Tibet yang panjang, pengolah kata bisa menjadi sangat lambat atau bahkan sama sekali tidak berfungsi, sehingga sulit dipakai untuk proyek penerbitan yang serius

Perbaikan LibreOffice dan perubahan performa nyata

  • LibreOffice adalah salah satu pengolah kata open source yang matang dan stabil, terinspirasi oleh MS Word, dan dapat digunakan gratis di berbagai platform termasuk Linux
  • Perangkat lunak komersial seperti Word atau InDesign memang dapat menangani teks Tibet yang panjang, tetapi biayanya tinggi dan di banyak wilayah Asia sering digunakan dalam versi bajakan
  • Selama LibreOffice belum bisa menangani paragraf panjang, praktis tidak ada alat gratis untuk penerbitan bahasa Tibet
  • CTO BDRC, Elie Roux, melaporkan masalah ini ke LibreOffice pada 2015
    • Pekerjaan untuk masuk ke kode LibreOffice adalah proyek besar yang membutuhkan riset dan pengembangan selama beberapa minggu, sehingga untuk waktu yang cukup lama tidak ada kemajuan
  • Beberapa minggu lalu Jonathan Clark menangani masalah ini dan memperbaikinya
    • Yishindzö karya Longchenpa adalah teks panjang yang terdiri dari satu “paragraf” sepanjang 153 halaman
    • Kini teks tersebut dapat dibuka dan disunting dengan cepat di LibreOffice
    • Teks itu dapat dilihat di yid bzhin mdzod dalam arsip BDRC
  • Konversi file RDF untuk teks khusus ini menjadi PDF sebelumnya tetap macet bahkan setelah 45 menit, tetapi sekarang selesai dalam 13 detik
  • Dukungan untuk paragraf yang sangat panjang telah diintegrasikan ke LibreOffice 24.8.2 yang dirilis pada 27 September 2024
  • BDRC meminta masukan tentang kekurangan dan pengalaman penggunaan pada perangkat lunak penyuntingan bahasa Tibet, dan ingin terus meningkatkan alat digital bahasa Tibet melalui kolaborasi komunitas

2 komentar

 
GN⁺ 2024-10-15
Komentar Hacker News
  • Jim Woolsey, seorang hippie dari New Hope, Pennsylvania sekaligus hacker komputer awal, adalah salah satu tokoh awal penting dalam digitalisasi bahasa Tibet
    Wawancara tahun 1993 ini https://www.mcall.com/1993/10/08/new-hope-man-computer-guru-... adalah kapsul waktu yang menarik, dan layak dibaca apa adanya
    Ia kenalan keluarga, dan saya selalu mengagumi dedikasinya yang luar biasa pada pekerjaan penting tetapi kurang diapresiasi ini

    • Sayangnya tautan itu hanya menampilkan “This content is not available in your region
  • “Dokumen memiliki paragraf yang cukup pendek” sepertinya juga harus masuk daftar kesalahkaprahan yang dipercaya programmer tentang teks

    • Di beberapa negara, dokumen hukum tidak boleh memuat pemisahan paragraf, sehingga bisa ada dokumen dengan satu paragraf yang membentang ratusan halaman
      OpenOffice pernah punya batas keras 65534 karakter per paragraf, dan butuh cukup banyak pekerjaan bagi LibreOffice untuk menghapusnya: https://bugs.documentfoundation.org/show_bug.cgi?id=30668
    • Saya belum pernah memikirkan unsur seperti ini dalam struktur lintas bahasa
      Arah teks, tanda diakritik, dan tanda baca tentu terpikirkan, tetapi saya mengira pemecahan menjadi blok-blok itu universal
      Ternyata tidak: “konsep tipografi paragraf dalam bahasa-bahasa Eropa sebenarnya tidak ada dengan cara yang sama dalam teks Tibet. Akibatnya, teks Tibet sering harus diperlakukan sebagai aliran teks panjang yang tidak terputus tanpa line break paksa, kadang mencapai ratusan atau ribuan halaman”
    • Sepertinya ada programmer di suatu tempat yang membuat buffer 4096 karakter lalu mencari '\n' berikutnya, dan dikalahkan oleh bahasa Tibet
  • Dengan penuh hormat, daya inovasi orang Tibet juga diakui dalam The Nine Billion Names of God: https://en.wikipedia.org/wiki/The_Nine_Billion_Names_of_God

    • Unsong juga terinspirasi dari sini: https://unsongbook.com/
    • Saya tidak tahu bagaimana buku itu menggambarkannya, tetapi dalam Buddhisme Tibet tidak ada Tuhan
      Dan inovasi mereka jauh lebih luas daripada buku ini, setidaknya daripada ringkasan alur ceritanya di Wikipedia
  • Saya suka ungkapan seperti “paragraf yang relatif pendek, mungkin sampai beberapa halaman” karena menunjukkan betapa saya melihat dunia dari sudut pandang tertentu
    Rasanya saya bahkan belum pernah menulis paragraf sepanjang satu halaman
    Saya lupa namanya, tetapi contoh paling dekat yang terlintas adalah seorang penulis yang menulis beberapa halaman stream of consciousness tanpa paragraf dan tanda baca

    • Penulis modernis dan postmodernis terkenal dengan gaya seperti ini
      Contohnya James Joyce dan David Foster Wallace
  • Pekerjaan ini sudah berlangsung cukup lama
    Ada juga stack HyperCard lama untuk mengajarkan pelafalan bahasa Tibet, lengkap dengan suara 16-bit: https://hcsimulator.com/Learn-Tibetan

    • Apakah vokalnya cuma satu, AH?
  • Berbagai tulisan bergaya stream of consciousness dan gaya terkait juga menghindari paragraf, kadang bahkan struktur tradisional lain, jadi agak mengejutkan bahwa word processor kesulitan dengan paragraf panjang
    Meski tidak sangat umum, ini bukan hal yang sama sekali tidak ada, dan saya kira para penulis serta penerbit entah bagaimana menanganinya
    Contoh acak yang relatif baru: https://en.wikipedia.org/wiki/Ducks,_Newburyport

    • Sepemahaman saya, spasi pun tidak ada
  • Saya penasaran dengan detail dukungan paragraf superpanjang, atau bagaimana mereka mengatasi ketiadaannya
    Ada yang tahu?

    • https://gerrit.libreoffice.org/c/core/+/172801
      Ini perubahan yang cukup singkat yang mengurangi dampak O(n^2) dengan cache
      Perubahan ini mencakup peningkatan skalabilitas untuk dokumen yang berisi paragraf sangat besar
      Dengan mempertimbangkan karakter kontrol LF, ukuran konteks layout diperkecil, dan karena pola akses tipikal saat menyusun paragraf membuat VCL memanggil vcl::ScriptRun::next() secara O(n^2), diubah agar memakai cache LRU global yang sudah ada sehingga overhead yang besar dapat dihindari
  • Saya kira Bengali dan Assamese memakai aksara Tibet; ada yang tahu seberapa miripnya dengan aksara yang digunakan orang Tibet untuk bahasa mereka sendiri?

    • Aksara Bengali/Assamese dan aksara Tibet sama-sama berkembang dari aksara Gupta, tetapi bahasa sebenarnya sangat berbeda
      Bengali dan Assamese termasuk rumpun Indo-Aryan, sedangkan bahasa Tibet termasuk rumpun Sino-Tibetan yang sama sekali berbeda
      Sebagai penutur Bengali, ketika saya pergi ke Bhutan yang memakai bahasa yang konon 50% saling dapat dipahami dengan bahasa Tibet, saya tidak memahami apa pun
      Saya mengira akan ada cukup banyak kata serapan Buddhis, tetapi saya terkejut karena bahkan kata seperti dharma dan karma terdengar sama sekali berbeda dalam bahasa Tibet
    • Tautan referensi: https://en.wikipedia.org/wiki/Bengali%E2%80%93Assamese_scrip...
      https://en.wikipedia.org/wiki/Tibetan_script
  • Bahasa adalah sesuatu yang sangat menarik
    Ada bahasa yang mudah dipelajari dan menjadi perantara komunikasi di wilayah yang luas, ada pula yang sulit dikuasai tetapi memungkinkan kita membangun struktur dan pemikiran yang sangat kompleks, lalu menyampaikannya antarpenutur
    Bahasa Tibet berada di bagian mana dari spektrum ini?

    • Saya tidak begitu yakin apakah keduanya saling eksklusif
      Topik yang sangat teknis memang biasanya memiliki istilah khusus yang sangat teknis
      Namun saya tidak yakin bahwa banyaknya nuansa halus yang dimiliki suatu bahasa berkaitan dengan kompleksitas gagasan yang dapat diekspresikan dalam bahasa tersebut
  • Saya Eyal, relawan proyek LibreOffice, dan banyak menangani penjaminan mutu terkait aksara yang ditulis dari kanan ke kiri serta skrip complex text layout
    Terima kasih kepada thunderbong3 yang membagikan tautan tulisan tersebut, dan terima kasih yang tulus kepada Jonathan Clark, pengembang baru penanggung jawab RTL-CTL-CJK di The Document Foundation, yang mengimplementasikan peningkatan kinerja untuk bahasa Tibet
    Sebagian besar bug yang saya temui dan laporkan di LibreOffice adalah masalah umum yang tidak terbatas pada sistem tulisan tertentu
    Misalnya, kode yang lupa bahwa konten bisa ditulis dari kanan ke kiri akan berperilaku keliru dalam kasus seperti itu
    Di antara bug yang spesifik pada sistem tulisan, banyak yang terkait dengan aksara Arabic yang paling banyak digunakan, yang juga dipakai untuk Farsi, Urdu, Javanese, dan lainnya
    Meski begitu, ada juga isu terkait sistem tulisan yang kurang luas digunakan seperti Tibetan atau Mongolian: https://bugs.documentfoundation.org/show_bug.cgi?id=115607
    Meta-bug ini melacak isu untuk Mongolian, Tibetan, Uyghur, Zhuang, Kazak, Xibo, Dai, Yi, Miao, Jingpo, Lisu, Lahu, Wa, dan lainnya
    Tidak jelas apakah masalah yang spesifik untuk bahasa-bahasa ini memang benar-benar sedikit, atau penggunaannya tidak banyak dan penggunanya tidak cukup terdorong untuk mengajukan bug
    Namun seperti yang ditunjukkan oleh perbaikan terbaru Jonathan, ketika waktu pengembang tersedia, jelas ada minat untuk menanganinya
    Jika Anda tertarik pada keadilan dalam penyuntingan dokumen lintas sistem tulisan, negara, dan budaya seperti ini, cobalah menggunakan LibreOffice dalam bahasa yang Anda kuasai, dan jika menemukan bug, silakan laporkan ke BugZilla: https://bugs.documentfoundation.org/
    Pertimbangkan juga untuk mendukung secara finansial The Document Foundation, yang mengelola proyek LibreOffice: https://www.libreoffice.org/donate/
    Kami adalah salah satu proyek bebas dan sumber terbuka besar di dunia, dengan puluhan juta pengguna rutin, mungkin lebih dari 100 juta, serta dewan direksi yang berasal dari puluhan negara
    Namun tidak ada perusahaan besar yang menginvestasikan uang atau waktu secara signifikan ke proyek ini
    Beberapa perusahaan komersial seperti Collabora dan Allotropia memang berkontribusi, tetapi banyak isu mendasar tidak cukup dekat dengan kebutuhan pelanggan mereka
    Karena itu kami memutuskan merekrut Jonathan secara langsung untuk memperkuat dukungan RTL-CTL-CJK, dan pekerjaan seperti ini dimungkinkan oleh donasi pengguna perorangan

    • Akan sangat saya syukuri jika Dzongkha juga didukung
 
kayws426 2024-10-15

Untung bahasa Korea punya spasi, kalau tidak bakal repot.