Journal Of Artificial Intelligence And Software Engineering
Vol 6, No 2 (2026): Juni (OnProgress)

Evaluating Whisper Model on Indonesian Educational Videos Transcription with Varying Audio Conditions

Fathia Sabrina (Universitas Syiah Kuala)
Fitria Nilamsari (Universitas Syiah Kuala)
Rinny Asasunnaja (Universitas Syiah Kuala)



Article Info

Publish Date
30 Jun 2026

Abstract

The increasing use of video-based learning in digital education highlights the importance of accurate automatic speech recognition (ASR) systems to support accessibility, subtitle generation, and inclusive learning environments. This study evaluates the performance of the Whisper base ASR model on Indonesian educational videos with diverse audio characteristics and production conditions. Several categories of educational videos were analyzed, including classroom lectures, podcasts, interviews, and animated educational content. Audio recordings were converted into WAV format and evaluated using Word Error Rate (WER) and Character Error Rate (CER). Long-duration recordings were additionally segmented into approximately 30-minute chunks to analyze transcription consistency over time. The results showed that transcription performance varied across recording conditions, with WER values ranging from 18% to 47% and CER values ranging from 5% to 23%. The analysis also identified recurring substitution patterns influenced by phonetic similarity, conversational expressions, and culturally contextual phrases. The findings indicate that Whisper base provides reasonably effective transcription capability for Indonesian educational multimedia under realistic recording conditions.

Copyrights © 2026






Journal Info

Abbrev

JAISE

Publisher

Subject

Computer Science & IT

Description

Artificial Intelligence Natural Language Processing Computer Vision Robotics and Navigation Systems Decision Support System Implementation of Algorithms Expert System Data Mining Enterprise Architecture Design & Management Software & Networking Engineering ...