Rating bintang pada ulasan aplikasi tidak selalu merepresentasikan polaritas teks. Penelitian ini membandingkan tujuh model machine learning, deep learning, dan Transformer pada 10.071 ulasan Tokopedia berbahasa Indonesia dengan label teks berbasis InSet serta rating sebagai weak-label pembanding. InSet mencakup 9,447 ulasan; label akhir terdiri atas 5,342 negatif, 1,019 netral, dan 3,710 positif. Sebanyak 4,360 label InSet berbeda dari pemetaan rating. Pada lima seed, Linear SVM memperoleh mean macro-F1 tertinggi 0,711 ± 0,000, diikuti Logistic Regression 0,709 ± 0,000. Pada seed 42, bootstrap 95% CI model terbaik adalah [0,680, 0,742], sedangkan perbedaannya dengan runner-up tidak signifikan menurut McNemar-Holm (p=0,5666). Hasil menunjukkan bahwa kesimpulan benchmark sensitif terhadap skema label dan baseline linear tetap kompetitif.
Copyrights © 2026