Rinny Asasunnaja
Universitas Syiah Kuala

Published : 1 Documents Claim Missing Document
Claim Missing Document
Check
Articles

Found 1 Documents
Search

Evaluating Whisper Model on Indonesian Educational Videos Transcription with Varying Audio Conditions Fathia Sabrina; Fitria Nilamsari; Rinny Asasunnaja
Journal of Artificial Intelligence and Software Engineering Vol 6, No 2 (2026): Juni (OnProgress)
Publisher : Politeknik Negeri Lhokseumawe

Show Abstract | Download Original | Original Source | Check in Google Scholar | DOI: 10.30811/jaise.v6i2.9201

Abstract

The increasing use of video-based learning in digital education highlights the importance of accurate automatic speech recognition (ASR) systems to support accessibility, subtitle generation, and inclusive learning environments. This study evaluates the performance of the Whisper base ASR model on Indonesian educational videos with diverse audio characteristics and production conditions. Several categories of educational videos were analyzed, including classroom lectures, podcasts, interviews, and animated educational content. Audio recordings were converted into WAV format and evaluated using Word Error Rate (WER) and Character Error Rate (CER). Long-duration recordings were additionally segmented into approximately 30-minute chunks to analyze transcription consistency over time. The results showed that transcription performance varied across recording conditions, with WER values ranging from 18% to 47% and CER values ranging from 5% to 23%. The analysis also identified recurring substitution patterns influenced by phonetic similarity, conversational expressions, and culturally contextual phrases. The findings indicate that Whisper base provides reasonably effective transcription capability for Indonesian educational multimedia under realistic recording conditions.