Automatic Speech Recognition (ASR) merupakan teknologi yang memungkinkan suara diubah menjadi teks secara otomatis. Penelitian ini bertujuan menganalisis performa model Wav2Vec2.0 pada transkripsi nama barang berbahasa Indonesia dalam kondisi audio bersih dan bising. Dataset terdiri atas 400 rekaman audio yang dikumpulkan dari empat pembicara dengan kosakata terbatas berupa 20 nama barang. Evaluasi dilakukan menggunakan metrik Word Error Rate (WER) dan Character Error Rate (CER) pada kondisi audio bersih, babble noise, crowd noise, dan vehicle noise. Hasil pengujian menunjukkan bahwa kondisi audio bersih menghasilkan performa terbaik dengan nilai WER sebesar 2,08% dan CER sebesar 0,35%, sedangkan crowd noise menghasilkan tingkat kesalahan tertinggi dengan WER sebesar 22,92% dan CER sebesar 9,44%. Hasil penelitian menunjukkan bahwa peningkatan tingkat kebisingan berpengaruh terhadap penurunan performa transkripsi model Wav2Vec2.0 pada tugas pengenalan kosakata terbatas.
Copyrights © 2026