INTECOMS: Journal of Information Technology and Computer Science
Vol. 9 No. 3 (2026): INTECOMS: Journal of Information Technology and Computer Science

PERBANDINGAN KINERJA PRE-TRAINED LANGUAGE MODEL BAHASA INDONESIA BERBASIS TRANSFORMER UNTUK ANALISIS SENTIMEN ULASAN TOKOPEDIA GOOGLE PLAY

Muhammad Kevin (Universitas Amikom Yogyakarta)
Hanafi Hanafi (Universitas Amikom Yogyakarta)



Article Info

Publish Date
30 Jul 2026

Abstract

Analisis sentimen terhadap ulasan aplikasi e-commerce pada Google Play Store merupakan salah satu pendekatan penting untuk memahami persepsi pengguna. Namun, karakteristik data yang tidak terstruktur, penggunaan bahasa informal, singkatan, serta variasi dialek dan bahasa daerah masih menjadi tantangan dalam proses klasifikasi sentimen. Penelitian ini membandingkan performa tiga Pre-trained Language Model (PLM) berbahasa Indonesia, yaitu BERT Indonesia, RoBERTa Indonesia, dan IndoBERT, dalam mengklasifikasikan sentimen ulasan Tokopedia berbahasa Indonesia. Sebagai pembanding terhadap aspek efisiensi komputasi, DistilBERT Indonesia turut dievaluasi untuk menganalisis trade-off antara performa klasifikasi dan kebutuhan sumber daya komputasi. Dataset penelitian terdiri atas 10.000 ulasan Tokopedia yang diperoleh melalui web scraping menggunakan google_play_scraper. Tahapan penelitian meliputi preprocessing (pembersihan data, normalisasi teks, dan tokenisasi subword), pelabelan sentimen (positif, negatif, dan netral), pembagian data, proses fine-tuning menggunakan pustaka Hugging Face Transformers, serta evaluasi menggunakan metrik accuracy, precision, recall, dan F1-score. Hasil eksperimen menunjukkan bahwa IndoBERT memperoleh performa terbaik dengan akurasi pengujian sebesar 92,65%, diikuti oleh BERT Indonesia (92,15%) dan RoBERTa Indonesia (91,78%), yang menunjukkan bahwa ketiga model menghasilkan performa klasifikasi yang relatif kompetitif dan selisih akurasi yang kecil. Meskipun memiliki akurasi yang sedikit lebih rendah, DistilBERT Indonesia mencapai akurasi 91,78% dengan waktu pelatihan tercepat, sehingga menawarkan efisiensi komputasi yang lebih baik dibandingkan model lainnya. Temuan ini menunjukkan bahwa pemilihan pretrained language model tidak hanya dipengaruhi oleh tingkat akurasi, tetapi juga oleh karakteristik arsitektur dan efisiensi komputasi yang diperlukan pada proses analisis sentimen berbahasa Indonesia. Kata Kunci: Analisis Sentimen, Natural Language Processing, BERT Indonesia, IndoBERT, Tokopedia.  

Copyrights © 2026