Common Voice mengumumkan penerbitan Scripted Speech v27.0 dan Spontaneous Speech v5.0 pada 18 September 2026. Perkembangan ini membawa perhatian kepada bahan asas teknologi pengecaman suara: rakaman, transkripsi dan maklumat tentang bahasa yang diwakili.
Bagi pembangun dan pelajar IT di Malaysia, keluaran ini boleh menjadi titik mula untuk memahami pembinaan aplikasi suara. Namun, jumlah data seluruh dunia perlu dibaca bersama batasnya sebelum dijadikan alasan bahawa sesuatu sistem sudah sesuai untuk pengguna tempatan.
Menurut pengumuman pasukan Common Voice, Scripted Speech v27.0 merangkumi 295 bahasa dengan kira-kira 42,593 jam pertuturan. Spontaneous Speech v5.0 pula merangkumi 80 bahasa; sebanyak 302 jam jawapan bebas telah ditranskripsi dan disahkan. Pasukan itu menyatakan kedua-dua keluaran tersedia melalui Mozilla Data Collective.
Pa’O ditambah dalam koleksi berskrip. Enam bahasa pula menyertai koleksi spontan, termasuk bahasa Sunda, Bengali dan Shan. Angka keseluruhan tersebut ialah statistik koleksi yang dilaporkan penerbit, bukannya keputusan ujian ketepatan model atau ukuran liputan bahasa di Malaysia.
Sumber: Common Voice Scripted Speech v27.0 and Spontaneous Speech v5.0 Released.
Notis persediaan keluaran bertarikh 31 Ogos menetapkan 11 September sebagai tarikh tutup sumbangan. Sumbangan selepas tarikh itu perlu menunggu keluaran berikutnya. Notis tersebut turut meminta komuniti menyemak helaian penerangan data, selain menyumbang rakaman, pengesahan dan transkripsi.
Sebagai penjelasan editorial, nombor versi boleh dianggap seperti label pada bahan eksperimen. Jika dua projek menggunakan keluaran berlainan, bahan yang dibandingkan mungkin tidak sama. Oleh itu, catatan projek sebaiknya menyebut versi sebenar dan tarikh muat turun, supaya pembaca dapat memahami asal hasil yang dilaporkan.
Sumber: Dataset release timeline for MCV Scripted Speech v27.0 and Spontaneous Speech v5.0.
Panduan rasmi repositori cv-datasheets menerangkan bahawa helaian data memuatkan maklumat bahasa, sistem tulisan, sumber teks dan komuniti penyumbang. Strukturnya turut menyediakan ruang untuk variasi dialek, aksen, domain teks, pemprosesan dan penerangan proses transkripsi.
Panduan itu membezakan maklumat yang berkembang melalui tambahan sumbangan daripada penerangan yang boleh diperbaik apabila pemahaman berubah. Kandungan komuniti juga boleh digabungkan dengan statistik automatik. Ini menunjukkan bahawa dokumentasi dataset ialah sebahagian daripada kerja penyelenggaraan, bukan sekadar lampiran.
Tafsiran editorialnya mudah: sebelum bertanya berapa banyak fail boleh digunakan, tanyakan jenis pertuturan yang diterangkan oleh fail tersebut. Rekod asal teks dan cara transkripsi membantu pembangun menentukan soalan penilaian yang munasabah.
Sumber: Common Voice cv-datasheets: Contributing Content.
Pengumuman keluaran tidak memberikan keputusan penanda aras bagi aplikasi Bahasa Malaysia, dan tidak membuktikan bahawa semua loghat tempatan diwakili secara seimbang. Ia juga tidak menyatakan bahawa jumlah jam keseluruhan tersedia dalam setiap bahasa. Kesimpulan tentang kesesuaian tempatan memerlukan pemeriksaan dataset bahasa yang dipilih.
Pada penilaian editorial, pertambahan bahasa ialah alasan untuk meneroka bahan baharu, tetapi keputusan penggunaan patut bergantung pada tugas tertentu. Projek transkripsi mesyuarat, arahan suara pendek dan latihan sebutan boleh mempunyai keperluan penilaian yang berbeza.
Sumber: Common Voice Scripted Speech v27.0 and Spontaneous Speech v5.0 Released; Common Voice cv-datasheets: Contributing Content.
Cadangan berikut ialah rancangan pembelajaran editorial, bukan dapatan Mozilla. Mulakan dengan satu tugas yang sempit, seperti menyalin pertanyaan ringkas tentang lokasi bilik atau waktu kaunter. Nyatakan pengguna sasaran dan situasi rakaman sebelum memilih data atau model.
Sediakan rakaman ujian berasingan dengan persetujuan peserta. Masukkan contoh nama tempat, nombor, singkatan dan pertukaran antara Bahasa Malaysia dengan bahasa Inggeris jika unsur itu relevan kepada projek. Elakkan memasukkan maklumat pelanggan atau rakaman dalaman organisasi tanpa kebenaran.
Bandingkan keluaran sistem dengan transkripsi yang disemak manusia. Catat perkataan yang tersalah, perkataan yang hilang dan tambahan yang tidak disebut. Asingkan contoh mengikut keadaan, seperti bilik senyap dan bunyi latar, supaya laporan menunjukkan lokasi masalah dan bukan sekadar satu skor purata.
Untuk portfolio pelajar atau pembangun junior, hasilkan laporan ringkas yang mengandungi versi data, kaedah pemilihan sampel, contoh ralat dan batas eksperimen. Jika sampelnya kecil, nyatakan dengan terus terang. Bahan sebegini memberi ruang untuk menerangkan keputusan teknikal ketika temu duga tanpa mendakwa sistem sudah mewakili seluruh Malaysia.
Disediakan secara automatik dengan bantuan AI berdasarkan sumber yang dipautkan. Semakan sumber: 2026-10-11. Gambar utama ialah ilustrasi janaan AI, bukan foto peristiwa sebenar.