Muh Fatwah Fajriansyah Marlang
Prodi Teknik Informatika, Fakultas Ilmu Komputer, Universitas Muslim Indonesia, Indonesia.

Published : 1 Documents Claim Missing Document
Claim Missing Document
Check
Articles

Found 1 Documents
Search

Peningkatan Automatic Speech Recognition Dialek Bugis-Makassar Menggunakan Data Ucapan Sintetis Muh Fatwah Fajriansyah Marlang; Herdianti Darwis; Huzain Azis; Abdul Rachman Manga
Bandung Conference Series: Industrial Engineering Science 597-604
Publisher : UNISBA Press

Show Abstract | Download Original | Original Source | Check in Google Scholar | DOI: 10.29313/bcsies.v6i2.26221

Abstract

Abstract. Speech in the Bugis-Makassar dialect poses a major challenge for Automatic Speech Recognition (ASR) systems, particularly in detecting clitic particles that are essential to utterance meaning but do not exist in standard Indonesian. This study investigates the effect of synthetic speech data augmentation using OpenAI's gpt-4o-mini-tts on ASR performance for this dialect, testing four ratios of synthetic-to-real data (0%, 50%, 100%, and 150%) through fine-tuning of the wav2vec2-large-xlsr-indonesian model. Evaluation was conducted using Word Error Rate (WER), Character Error Rate (CER), and Particle Detection Rate (PDR) as a dedicated metric for clitic particle detection. Results show that augmentation at a 50% ratio produced consistent improvements across all metrics compared to baseline, with WER decreasing by 3.47 percentage points and PDR increasing by 3.62 percentage points. Further increases in ratio progressively reduced these gains, forming an inverted-U pattern, with performance at a 150% ratio returning to near-baseline levels. Acoustic analysis identified a significant pitch distribution gap between synthetic and real speech (a difference of 58.09 Hz, or 24.8%) as a contributing factor to performance degradation at higher ratios. These findings indicate that TTS-based synthetic data augmentation effectively supports low-resource dialectal ASR, but only when applied at a controlled, moderate ratio. Abstrak. Tuturan dialek Bugis-Makassar merupakan tantangan besar bagi sistem Automatic Speech Recognition (ASR), khususnya dalam mendeteksi partikel klitik yang penting bagi makna ujaran namun tidak terdapat dalam Bahasa Indonesia standar. Penelitian ini menginvestigasi pengaruh augmentasi data sintetis menggunakan OpenAI gpt-4o-mini-tts terhadap performa ASR dialek tersebut, dengan menguji empat rasio data sintetis terhadap data asli (0%, 50%, 100%, dan 150%) melalui fine-tuning model wav2vec2-large-xlsr-indonesian. Evaluasi dilakukan menggunakan Word Error Rate (WER), Character Error Rate (CER), dan Particle Detection Rate (PDR) sebagai metrik khusus deteksi partikel klitik. Hasil menunjukkan bahwa augmentasi pada rasio 50% menghasilkan peningkatan konsisten pada seluruh metrik dibandingkan baseline, dengan WER turun 3,47 poin persentase dan PDR naik 3,62 poin persentase. Penambahan rasio secara bertahap mengurangi manfaat tersebut dan membentuk pola kurva inverted-U, di mana performa pada rasio 150% kembali mendekati baseline. Analisis akustik mengidentifikasi perbedaan distribusi pitch yang signifikan antara data sintetis dan asli (selisih 58,09 Hz atau 24,8%) sebagai faktor yang berkontribusi terhadap degradasi performa pada rasio tinggi. Temuan ini menunjukkan bahwa augmentasi data sintetis berbasis TTS efektif mendukung ASR dialek low-resource, namun hanya jika diterapkan pada rasio yang terkontrol dan moderat.