Abstrak— Plagiarisme antar siswa pada jawaban esai masih menjadi tantangan dalam pembelajaran daring, terutama pada pengumpulan jawaban melalui Google Form. Proses pemeriksaan kemiripan jawaban secara manual memerlukan waktu yang lama dan sulit untuk mengidentifikasi kemiripan semantik antar jawaban siswa. Penelitian ini bertujuan untuk mengembangkan sistem deteksi plagiarisme jawaban antar siswa menggunakan Sentence-BERT (all-MiniLM-L12-v2) dan cosine similarity. Tahapan penelitian meliputi text preprocessing, pembentukan sentence embedding, perhitungan skor kemiripan, penentuan batas ambang (threshold), serta klasifikasi jawaban ke dalam kategori plagiarisme, parafrase, dan tidak plagiarisme. Pelabelan manual dilakukan oleh dua penilai, yaitu peneliti dan guru mata pelajaran, untuk menetapkan ground truth. Tingkat kesepakatan antara kedua penilai kemudian dievaluasi menggunakan Cohen's Kappa yang menghasilkan nilai 0,8954 menunjukkan tingkat kesepakatan hampir sempurna. Berdasarkan evaluasi menggunakan confusion matrix terhadap empat skenario threshold, skenario 2 memberikan performa terbaik dengan akurasi sebesar 94,42%. Skenario tersebut menggunakan batas ambang similarity ≥80% untuk kategori plagiarisme, 60%–79% untuk kategori parafrase, dan <60% untuk kategori tidak plagiarisme. Nilai F1-score yang diperoleh masing-masing sebesar 0,99 pada kategori plagiarisme, 0,93 pada kategori parafrase, dan 0,88 pada kategori tidak plagiarisme. Kata Kunci— Plagiarisme, Sentence-BERT, cosine similarity, Google Form, NLP.
Copyrights © 2026