Karakteristik dataset merupakan salah satu faktor yang memengaruhi keberhasilan klasifikasi teks multi-label. Meskipun berbagai penelitian telah mengembangkan model klasifikasi pada terjemahan Al-Qur'an Bahasa Indonesia, analisis terhadap karakteristik intrinsik dataset masih terbatas. Penelitian ini bertujuan menganalisis karakteristik dataset sebagai dasar pengembangan metode klasifikasi multi-label. Dataset berasal dari terjemahan resmi Al-Qur'an Kementerian Agama Republik Indonesia Tahun 2022 yang terdiri atas 6.236 ayat dari 114 surah, sedangkan analisis multi-label dilakukan pada subset berlabel sebanyak 461 ayat dengan empat label tematik, yaitu Tauhid, Ibadah, Akhlaq, dan Sejarah. Analisis meliputi profil dataset, karakteristik dokumen, distribusi label, Label Cardinality, Label Density, dan Label Correlation menggunakan matriks co-occurrence, heatmap, serta network graph. Hasil penelitian menunjukkan distribusi label yang relatif seimbang, nilai Label Cardinality sebesar 2,02, Label Density sebesar 0,506, serta hubungan antartema pada tingkat sedang hingga kuat. Selain itu, variasi panjang dokumen menunjukkan keragaman representasi teks yang memadai. Temuan ini menunjukkan bahwa dataset memiliki kompleksitas multi-label yang representatif dan layak digunakan sebagai dasar pengembangan serta evaluasi metode klasifikasi multi-label.
Copyrights © 2026