Peningkatan pemberitaan digital mengenai Asta Cita menghasilkan beragamnya informasi, sehingga diperlukan proses retrieval untuk menghasilkan dokumen yang relevan sesuai dengan kebutuhan pencarian. Perbedaan karakteristik model representasi teks TF-IDF, Word2Vec, IndoBERT menjadi dasar dari penelitian ini untuk mengevaluasi dan membandingkan performa dari ketiga model tersebut pada korpus berita Asta Cita. Data yang digunakan berasal dari web scraping dengan jumlah 1338 dokumen berita dan rentang tahun 2024-2026. Data dilakukan tahapan preprocessing dan diperoleh 1311 dokumen berita. Dokumen direpresentasikan menggunakan TF-IDF, Word2Vec, dan IndoBERT. Penghitungan kemiripan menggunakan metrik cosine similarity. Evaluasi dilakukan dengan lima skenario yaitu, perbandingan model, variasi jenis kueri, variasi panjang kueri, variasi jumlah hasil pencarian, dan variasi ruang pencarian. Evaluasi diukur dengan metrik precision, recall, dan Mean Average Precision (MAP). Hasil evaluasi menunjukkan Word2Vec memperoleh rata-rata MAP tertinggi sebesar 0,859 dibandingkan dengan TF-IDF sebesar 0,682 dan IndoBERT sebesar 0,646. Berdasarkan hasil tersebut, Word2Vec lebih konsisten dibandingkan kedua model lainnya karena unggul pada sebagian besar skenario. Hasil evaluasi tersebut memberikan gambaran mengenai performa masing-masing model representasi teks pada berbagai kondisi retrieval dan dapat menjadi pertimbangan pemilihan model representasi teks untuk pengembangan sistem informasi retrieval.
Copyrights © 2026