Jutisi: Jurnal Ilmiah Teknik Informatika dan Sistem Informasi
Vol. 15 No. 4 (2026): Agustus 2026

Perbandingan TF-IDF dan Sentence-IndoBERT untuk Klasifikasi Emosi Ulasan Produk Indonesia

Miko Kastomo Putro (Universitas Amikom Yogyakarta)
Mursyid Ardiansyah (Institut Teknologi Sains dan Bisnis Muhammadiyah Selayar)



Article Info

Publish Date
15 Aug 2026

Abstract

Informal Indonesian product reviews containing lexical variation posed challenges for emotion classification. This study aimed to compare term frequency-inverse document frequency and Sentence-IndoBERT representations using the same logistic regression classifier so that the effect of text representation could be examined under controlled conditions. The PRDECT-ID dataset was audited, cleaned of duplicates and label conflicts, and reduced to 5,261 reviews. The data were stratified into 70% training, 15% validation, and 15% testing sets. Performance was evaluated using accuracy, macro precision, macro recall, macro F1-score, weighted F1-score, and a confusion matrix. The results showed that term frequency-inverse document frequency achieved 64.05% accuracy and a 60.88% macro F1-score, outperforming Sentence-IndoBERT, which achieved 63.67% accuracy and a 59.28% macro F1-score. The novelty lay in a controlled experiment using the same classifier, data partition, and evaluation procedure. The findings indicated that word-based representation was more effective and computationally efficient for the evaluated dataset. Keywords: Emotion Classification; Indonesian Product Reviews; Text Representation; Logistic Regression; Machine Learning    Abstrak Ulasan produk berbahasa Indonesia yang singkat, informal, dan mengandung variasi kata telah menimbulkan kesulitan dalam klasifikasi emosi. Penelitian ini telah membandingkan representasi term frequency-inverse document frequency dan Sentence-IndoBERT menggunakan regresi logistik yang sama agar pengaruh representasi teks dapat diamati secara terkontrol. Dataset PRDECT-ID telah diaudit, dibersihkan dari duplikasi dan konflik label, lalu menghasilkan 5.261 ulasan yang dibagi secara terstratifikasi menjadi 70% data pelatihan, 15% data validasi, dan 15% data pengujian. Kinerja telah dievaluasi menggunakan akurasi, presisi makro, recall makro, skor F1 makro, skor F1 berbobot, dan confusion matrix. Hasil pengujian telah menunjukkan bahwa term frequency-inverse document frequency memperoleh akurasi 64,05% dan skor F1 makro 60,88%, lebih tinggi daripada Sentence-IndoBERT dengan akurasi 63,67% dan skor F1 makro 59,28%. Kebaruan penelitian telah ditunjukkan melalui eksperimen terkontrol dengan pengklasifikasi, pembagian data, dan prosedur evaluasi yang sama. Temuan tersebut telah memperlihatkan bahwa representasi berbasis kata lebih efektif dan efisien untuk dataset yang digunakan. Kata kunci: Klasifikasi Emosi; Ulasan Produk Indonesia; Representasi Teks; Logistic Regression; Machine Learning 

Copyrights © 2026






Journal Info

Abbrev

jutisi

Publisher

Subject

Computer Science & IT

Description

Jutisi: Jurnal Ilmiah Teknik Informatika dan Sistem Informasi adalah Jurnal Ilmiah bidang Teknik Informatika dan Sistem Informasi yang diterbitkan secara periodik tiga nomor dalam satu tahun, yaitu pada bulan April, Agustus dan Desember. Redaksi Jutisi: Jurnal Ilmiah Teknik Informatika dan Sistem ...