KETEMU:

Menjembatani Diskusi, Riset, dan Kebijakan untuk Teknologi Etis

Infrastruktur Tersembunyi AI Etis: Pelajaran dari Alat Normalisasi Teks Bahasa Vietnam

Saat AI menjadi sorotan utama, pemberitaannya cenderung berkisar pada model-model frontier berskala masif, kesepakatan terkait keamanan nasional, atau pusat data bernilai miliaran dolar. Namun, terkadang perubahan paling penting di bidang etika dan infrastruktur bermula dari hal yang jauh lebih sederhana—seperti sebuah perangkat yang membantu mesin membaca bahasa Vietnam sehari-hari sebagaimana bahasa tersebut benar-benar ditulis oleh penutur aslinya.

Sebuah makalah berjudul VietNormalizer—yang disusun bersama oleh peneliti KETEMU, Dr. Ushik Shrestha—memperkenalkan pustaka Python open-source yang tidak memiliki dependensi eksternal (zero-dependency). Pustaka ini berfungsi mengubah teks bahasa Vietnam sehari-hari yang tidak seragam dan berantakan menjadi bentuk yang terstruktur serta dapat dilafalkan. Sistem ini mampu memproses angka, tanggal, nilai mata uang, persentase, akronim, bahkan melakukan transliterasi kata serapan asing, semuanya melalui alur kerja (pipeline) berbasis aturan yang cepat. Sistem ini tidak bergantung pada model saraf (neural networks) maupun kebutuhan GPU, melakukan pra-kompilasi pola regex untuk pemrosesan berkapasitas tinggi, serta dapat diakses sepenuhnya melalui PyPI dan GitHub.

Sekilas, hal ini mungkin tampak seperti kontribusi teknis yang bersifat khusus (niche). Namun, pada praktiknya, hal ini menyentuh salah satu pertanyaan etis paling mendesak terkait AI: siapa saja yang diakomodasi dalam dunia yang dapat dipahami oleh mesin. Teks daring berbahasa Vietnam sarat dengan bentuk-bentuk nonstandar seperti angka, tanggal, emoji, dan akronim bahasa Inggris, sementara sebagian besar sistem NLP global masih mengandalkan format yang berpusat pada bahasa Inggris atau bergantung pada komponen prapemrosesan yang berat dan bersifat tertutup (proprietary). Dengan menunjukkan bahwa alur kerja (pipeline) berbasis aturan yang transparan dan dapat diaudit mampu melayani seluruh komunitas bahasa, VietNormalizer mengubah cara pandang terhadap prapemrosesan—dari sekadar langkah teknis menjadi sebuah isu kesetaraan.

Poin ini menjadi semakin relevan saat dibandingkan dengan berbagai berita utama mengenai AI, yang banyak di antaranya menyoroti kesenjangan antara tujuan pengembangan AI dan dampak nyata yang ditimbulkannya. Di Kanada, pemerintah federal memerintahkan peninjauan keselamatan resmi terhadap OpenAI setelah terungkap bahwa perusahaan tersebut gagal menindaklanjuti peringatan terkait seorang tersangka penembakan massal, yang pesan-pesan ChatGPT-nya mengindikasikan potensi kekerasan. Para pejabat mendesak CEO Sam Altman untuk menjelaskan mengapa sistem tersebut tidak mencegah pengguna mengakali larangan akses, serta mekanisme apa yang tersedia untuk mendeteksi konten berbahaya di berbagai konteks dan bahasa.

Sementara itu, di AS, kesepakatan baru OpenAI dengan Pentagon—yang mencakup batasan pengamanan terhadap pengawasan domestik dan senjata otonom—memicu perbedaan pendapat internal serta kritik publik dari laboratorium-laboratorium lain. Caitlin Kalinowski, pimpinan bidang perangkat keras robotika, mengundurkan diri seraya memperingatkan bahwa kesepakatan tersebut kurang mempertimbangkan aspek pengawasan dan otonomi untuk pemadaman yang memadai.

Berbagai kontroversi ini menunjukkan bahwa etika mencakup keseluruhan alur kerja sistem, mulai dari cara teks diproses hingga cara keluarannya ditafsirkan. Jika sebuah sistem tidak mampu mengurai tanggal atau mata uang dalam bahasa Vietnam secara andal, atau salah menangani tanda diakritik dalam peringatan keselamatan, maka janji tingkat tinggi mengenai AI yang bertanggung jawab akan runtuh saat sistem tersebut berinteraksi dengan pengguna. Nilai penting VietNormalizer terletak pada aspek linguistik sekaligus kesesuaiannya dengan tata kelola. Komponen berbasis aturan dapat dievaluasi, didokumentasikan, diatur, dan disempurnakan secara kolaboratif.

Bagi pengembang yang bekerja di atau dengan wilayah multibahasa seperti Vietnam, Indonesia, Singapura, dan kawasan ASEAN secara luas, hal ini berarti alur kerja prapemrosesan harus akurat dan siap untuk diaudit. Alat seperti VietNormalizer menunjukkan bagaimana inklusi linguistik dapat selaras secara alami dengan kepatuhan terhadap regulasi. Alat normalisasi berbasis aturan yang terbuka dan terdokumentasi dengan baik jauh lebih mudah untuk dipertanggungjawabkan di hadapan auditor dibandingkan dengan komponen saraf tertutup yang proses pengambilan keputusannya tidak transparan.

VietNormalizer juga menjawab kekhawatiran terkini melalui perspektif keamanan AI dan red-teaming (pengujian keamanan dengan simulasi serangan), di mana penelitian dan kompetisi terbaru mengungkap kerentanan yang terus ada pada model AI mutakhir (frontier models) dan sistem agen AI (agentic systems). Sebuah kompetisi red-teaming publik berskala besar yang menjadi tonggak penting—yang menyasar 22 agen AI mutakhir—mencatat 1,8 juta upaya prompt-injection dan puluhan ribu pelanggaran kebijakan, yang menegaskan betapa rentannya penerapan teknologi ini di dunia nyata.

Bahkan upaya red-teaming masif dari Amazon AGI Labs menemukan lebih dari 1.000 kasus jailbreak (pembobolan batasan keamanan) yang mencakup 17 kategori keamanan, termasuk vektor serangan multibahasa di mana prapemrosesan yang tidak andal menjadi risiko keamanan tersendiri.

Jelaslah bahwa garda terdepan keamanan AI kini semakin terletak pada hal-hal yang tampak sepele, yakni pada lapisan infrastruktur tempat teks bertemu dengan kode, serta tempat pengguna nyata—dengan segala kebiasaan ejaan, akronim, emoji, dan pencampuran bahasa mereka—beraktivitas. Hal ini terutama berlaku di Asia Tenggara, tempat layanan digital kini menjangkau jutaan orang dengan beragam tingkat literasi, dialek, dan format penulisan. Sebagai contoh, chatbot peringatan bencana tidak boleh salah membaca format waktu seperti ‘12/3, 14:30’ atau keliru mengenali nominal mata uang VND, mengingat kejelasan informasi sangatlah krusial bagi keselamatan nyawa.

Dalam bahasa masyarakat awam, pertanyaannya adalah: Bisakah sistem AI Anda menyebut nama saya dengan benar? Bisakah sistem tersebut membaca format tanggal saya, memahami mata uang saya, atau menguraikan akronim organisasi saya? Hal-hal ini merupakan standar dasar bagi martabat dan inklusi. Di tengah maraknya kesepakatan dengan Pentagon, tinjauan keselamatan publik, dan tuntutan regulasi yang kian meningkat, alat seperti VietNormalizer menunjukkan bahwa esensi dari AI yang bertanggung jawab sering kali justru ditemukan pada aspek-aspek teknis yang tidak mencolok.

Teks lengkap makalah VietNormalizer tersedia di sini: https://arxiv.org/abs/2603.04145

Leave a Reply

Alamat email Anda tidak akan dipublikasikan. Ruas yang wajib ditandai *