Penelitian ini menganalisis kemiripan teks guna mengukur relevansi judul skripsi mahasiswa Program Studi Teknik Informatika Universitas Halu Oleo (UHO) menggunakan pendekatan information retrieval, yaitu TF-IDF, Cosine Similarity, dan Jaccard Similarity. Data berupa 620 judul skripsi UHO diperoleh dari dataset publik Kaggle, kemudian diproses melalui tahapan Case Folding, Cleaning, tokenisasi, penghapusan stopword (standar dan domain akademik), serta Stemming menggunakan PySastrawi. Tahap prapemrosesan berhasil mereduksi dimensi token sebesar 37,7%, meningkatkan efisiensi representasi dokumen. Representasi vektor dibangun menggunakan TF-IDF dengan kombinasi unigram dan bigram. Topik penelitian dikelompokkan menjadi delapan klaster menggunakan algoritma K-Means yang dikombinasikan dengan reduksi dimensi Latent Semantic Analysis (LSA). Evaluasi sistem temu kembali menggunakan 50 Query acak dengan ground truth berbasis klaster menunjukkan bahwa Jaccard Similarity secara konsisten mengungguli Cosine Similarity pada seluruh metrik pengujian (Precision@K, Recall@K, MAP, dan NDCG@K). Hasil ini mengindikasikan bahwa karakteristik judul skripsi yang ringkas menyebabkan sebaran bobot fitur TF-IDF rentan didominasi secara ekstrem oleh satu Term dominan tunggal yang memicu bias pada Cosine Similarity, sedangkan pendekatan kecocokan biner pada Jaccard Similarity terbukti lebih tangguh dan menghasilkan urutan peringkat dokumen yang jauh lebih akurat.