Elisa Wulan Sari
Universitas Halu Oleo

Published : 2 Documents Claim Missing Document
Claim Missing Document
Check
Articles

Found 2 Documents
Search

Analisis Relevansi Judul Skripsi Teknik Informatika Universitas Halu Oleo (UHO) Menggunakan TF-IDF, Cosine Similarity, dan Jaccard Similarity Ramlia Ramadani Sudin; Elisa Wulan Sari; Adha Mashur Sajiah
KETIK : Jurnal Informatika Vol. 3 No. 06 (2026): Juli
Publisher : Faatuatua Media Karya

Show Abstract | Download Original | Original Source | Check in Google Scholar | DOI: 10.70404/ketik.v3i06.693

Abstract

Penelitian ini menganalisis kemiripan teks guna mengukur relevansi judul skripsi mahasiswa Program Studi Teknik Informatika Universitas Halu Oleo (UHO) menggunakan pendekatan information retrieval, yaitu TF-IDF, Cosine Similarity, dan Jaccard Similarity. Data berupa 620 judul skripsi UHO diperoleh dari dataset publik Kaggle, kemudian diproses melalui tahapan Case Folding, Cleaning, tokenisasi, penghapusan stopword (standar dan domain akademik), serta Stemming menggunakan PySastrawi. Tahap prapemrosesan berhasil mereduksi dimensi token sebesar 37,7%, meningkatkan efisiensi representasi dokumen. Representasi vektor dibangun menggunakan TF-IDF dengan kombinasi unigram dan bigram. Topik penelitian dikelompokkan menjadi delapan klaster menggunakan algoritma K-Means yang dikombinasikan dengan reduksi dimensi Latent Semantic Analysis (LSA). Evaluasi sistem temu kembali menggunakan 50 Query acak dengan ground truth berbasis klaster menunjukkan bahwa Jaccard Similarity secara konsisten mengungguli Cosine Similarity pada seluruh metrik pengujian (Precision@K, Recall@K, MAP, dan NDCG@K). Hasil ini mengindikasikan bahwa karakteristik judul skripsi yang ringkas menyebabkan sebaran bobot fitur TF-IDF rentan didominasi secara ekstrem oleh satu Term dominan tunggal yang memicu bias pada Cosine Similarity, sedangkan pendekatan kecocokan biner pada Jaccard Similarity terbukti lebih tangguh dan menghasilkan urutan peringkat dokumen yang jauh lebih akurat.
Perbandingan CNN-BiLSTM dan CNN-BiGRU untuk Klasifikasi Berita Indonesia Menggunakan Fast Text Embedding dan Confidence Based Pseudo Labeling Cindy Rahmayanti; Elisa Wulan Sari; Adha Mashur Sajiah
KETIK : Jurnal Informatika Vol. 3 No. 06 (2026): Juli
Publisher : Faatuatua Media Karya

Show Abstract | Download Original | Original Source | Check in Google Scholar | DOI: 10.70404/ketik.v3i06.697

Abstract

Klasifikasi teks berita Indonesia merupakan tugas penting dalam pemrosesan bahasa alami yang mendukung pengelolaan informasi di era digital. Penelitian ini mengusulkan perbandingan dua arsitektur deep learning, yaitu CNN-BiLSTM dan CNN-BiGRU, yang diintegrasikan dengan word embedding FastText bahasa Indonesia dan strategi semi-supervised learning berbasis Confidence-Based Pseudo-Labeling. Dataset yang digunakan adalah Indonesian News Dataset sebanyak 91.017 artikel dari 9 kategori, yang kemudian diseimbangkan menggunakan undersampling menjadi 21.924 sampel. Sebanyak 20% data digunakan sebagai data berlabel dan 80% sisanya diperlakukan sebagai data tak berlabel yang dimanfaatkan melalui tiga iterasi pseudo-labeling dengan ambang kepercayaan adaptif (0,85; 0,88; 0,90). Hasil evaluasi menunjukkan menunjukkan bahwa penerapan pseudo-labeling secara konsisten meningkatkan performa kedua model. CNN-BiLSTM mencapai akurasi 71,72% dan F1-score 71,60% setelah pseudo-labeling, sedangkan CNN-BiGRU mencapai akurasi 69,42% dan F1-score 69,19%. Temuan ini membuktikan bahwa pendekatan semi-supervised learning efektif digunakan pada kondisi data berlabel yang terbatas.