Penentuan dosen pembimbing skripsi yang linear dengan topik penelitian mahasiswa merupakan tahapan krusial dalam penyelesaian tugas akhir. Pemetaan judul ke bidang keahlian dosen secara manual seringkali kurang efisien dan dihadapkan pada tantangan distribusi topik yang tidak merata (imbalanced data). Penelitian ini mengusulkan optimasi model klasifikasi berbasis algoritma K-Nearest Neighbor (K-NN) menggunakan 1.598 data historis judul skripsi dari Universitas AMIKOM Yogyakarta. Untuk mengatasi ketimpangan jumlah sampel antar bidang dosen, teknik Synthetic Minority Over-sampling Technique (SMOTE) diimplementasikan pada fase pelatihan data (data train). Proses ekstraksi Informasi teks melalui tahapan preprocessing komprehensif, meliputi case folding, stopword removal, dan stemming, yang kemudian dibobotkan menggunakan Term Frequency-Inverse Document Frequency (TF-IDF). Pembagian komposisi data latih dan uji ditetapkan sebesar 80:20. Berbeda dengan pendekatan spasial standar, model ini diuji menggunakan metrik jarak Cosine Similarity untuk mengukur kedekatan semantik antar dokumen dengan lebih presisi. Hasil eksperimen menunjukkan bahwa klasifikasi K-NN mencapai performa maksimal pada parameter k=21 dengan tingkat akurasi sebesar 85.94%. Integrasi SMOTE dan metrik Cosine terbukti secara signifikasn menaikkan sensitivitas model, ditandai dengan nilai recall hingga 95% pada pengenalan kategori bidang dosen minoritas yang sebelumnya sulit diklasifikasikan.
Copyrights © 2026