Bandung Conference Series: Statistics
235-242

Peningkatan Automatic Speech Recognition Dialek Bugis-Makassar Menggunakan Data Ucapan Sintetis

Muh Fatwah Fajriansyah M (Teknik Informatika)
Herdianti Darwis (Universitas Muslim Indonesia)
Huzain Azis (Universitas Muslim Bandung)
Abdul Rachman Manga (Universitas Islam Bandung)



Article Info

Publish Date
30 Nov -0001

Abstract

Abstract. Speech in the Bugis-Makassar dialect poses a major challenge for Automatic Speech Recognition (ASR) systems, particularly in detecting clitic particles that are essential to utterance meaning but do not exist in standard Indonesian. This study investigates the effect of synthetic speech data augmentation using OpenAI's gpt-4o-mini-tts on ASR performance for this dialect, testing four ratios of synthetic-to-real data (0%, 50%, 100%, and 150%) through fine-tuning of the wav2vec2-large-xlsr-indonesian model. Evaluation was conducted using Word Error Rate (WER), Character Error Rate (CER), and Particle Detection Rate (PDR) as a dedicated metric for clitic particle detection. Results show that augmentation at a 50% ratio produced consistent improvements across all metrics compared to baseline, with WER decreasing by 3.47 percentage points and PDR increasing by 3.62 percentage points. Further increases in ratio progressively reduced these gains, forming an inverted-U pattern, with performance at a 150% ratio returning to near-baseline levels. Acoustic analysis identified a significant pitch distribution gap between synthetic and real speech (a difference of 58.09 Hz, or 24.8%) as a contributing factor to performance degradation at higher ratios. These findings indicate that TTS-based synthetic data augmentation effectively supports low-resource dialectal ASR, but only when applied at a controlled, moderate ratio. Abstrak. Tuturan dialek Bugis-Makassar merupakan tantangan besar bagi sistem Automatic Speech Recognition (ASR), khususnya dalam mendeteksi partikel klitik yang penting bagi makna ujaran namun tidak terdapat dalam Bahasa Indonesia standar. Penelitian ini menginvestigasi pengaruh augmentasi data sintetis menggunakan OpenAI gpt-4o-mini-tts terhadap performa ASR dialek tersebut, dengan menguji empat rasio data sintetis terhadap data asli (0%, 50%, 100%, dan 150%) melalui fine-tuning model wav2vec2-large-xlsr- indonesian. Evaluasi dilakukan menggunakan Word Error Rate (WER), Character Error Rate (CER), dan Particle Detection Rate (PDR) sebagai metrik khusus deteksi partikel klitik. Hasil menunjukkan bahwa augmentasi pada rasio 50% menghasilkan peningkatan konsisten pada seluruh metrik dibandingkan baseline, dengan WER turun 3,47 poin persentase dan PDR naik 3,62 poin persentase. Penambahan rasio secara bertahap mengurangi manfaat tersebut dan membentuk pola kurva inverted-U, di mana performa pada rasio 150% kembali mendekati baseline. Analisis akustik mengidentifikasi perbedaan distribusi pitch yang signifikan antara data sintetis dan asli (selisih 58,09 Hz atau 24,8%) sebagai faktor yang berkontribusi terhadap degradasi performa pada rasio tinggi. Temuan ini menunjukkan bahwa augmentasi data sintetis berbasis TTS efektif mendukung ASR dialek low-resource, namun hanya jika diterapkan pada rasio yang terkontrol dan moderat.

Copyrights © 0000






Journal Info

Abbrev

BCSS

Publisher

Subject

Decision Sciences, Operations Research & Management Education Mathematics

Description

Bandung Conference Series: Statistics (BCSS) menerbitkan artikel penelitian akademik tentang kajian teoritis dan terapan serta berfokus pada Statistika dengan ruang lingkup sebagai berikut: Alternating Least Square, Analisis Konjoin, Autoregressive, Auxiliary Variabel, Baby Birth, Block Maxima, ...