Penelitian ini mengimplementasikan sistem tanya jawab dokumen regulasi berbasis Retrieval-Augmented Generation (RAG) yang memadukan pencarian semantik berbasis cosine similarity dengan normalisasi kesalahan ketik menggunakan Levenshtein distance. Dokumen PDF diekstraksi per halaman, dipotong hingga 3.000 karakter, direpresentasikan menggunakan model gemini-embedding-001 dengan dimensi keluaran 768, dan disimpan sebagai vektor JSON pada MySQL. Kueri pengguna dinormalisasi menggunakan kamus dinamis dari korpus, kemudian kandidat halaman diperingkat berdasarkan cosine similarity, keyword boost 0,25, dan fallback pencarian LIKE ketika skor tertinggi kurang dari 0,2. Konteks terpilih diteruskan ke Gemini API untuk menghasilkan jawaban beserta nama dokumen dan nomor halaman. Pengujian fungsional menunjukkan bahwa autentikasi, unggah dan ekstraksi dokumen, pembentukan embedding, retrieval, generasi jawaban berbasis konteks, dan penyajian rujukan berjalan sesuai rancangan. Simulasi perhitungan memperlihatkan cara keyword boost mengubah urutan kandidat dan Levenshtein distance menormalkan “pasword” menjadi “password”. Temuan ini menunjukkan kelayakan implementasi pipeline, tetapi belum membuktikan peningkatan akurasi retrieval karena belum tersedia dataset pertanyaan berlabel, baseline, ablation, dan evaluasi kuantitatif.
Copyrights © 2026