Knowledge distillation merupakan teknik untuk menyederhanakan model bahasa besar menjadi model yang lebih ringkas dengan tetap mempertahankan akurasi. Bidirectional encoder representations from transformers (BERT) menawarkan kinerja kuat namun memerlukan sumber daya komputasi besar, sedangkan mini language model (MiniLM) memiliki ukuran model lima kali lebih kecil. Penelitian ini bertujuan membandingkan kinerja kedua model tersebut pada dataset quora question pairs dengan fokus pada pengaruh sequence length dan kelangkaan token (token rarity) terhadap akurasi klasifikasi. Kedua model dilatih menggunakan parameter pelatihan yang identik. Hasil pengujian menunjukkan BERT mencapai akurasi 91,22% dan F1-score 88,17%, sedikit lebih unggul dari MiniLM yang mencapai akurasi 90,12% dan F1-score 86,73%. Namun, MiniLM memberikan kecepatan inferensi 5,3 kali lebih cepat. Temuan ini memberikan panduan empiris untuk optimalisasi model untuk lingkungan dengan keterbatasan sumber daya komputasi atau kebutuhan respons real-time, di mana efisiensi MiniLM dapat diterima dengan sedikit penurunan akurasi. Penelitian mendatang disarankan untuk mengeksplorasi sistem hibrida yang mengalihkan tugas kompleks ke model besar dan tugas umum ke model yang lebih kecil.
Copyrights © 2025