Moh. Novil Ma'arij
Universitas Negeri Surabaya

Published : 1 Documents Claim Missing Document
Claim Missing Document
Check
Articles

Found 1 Documents
Search

Studi Ablasi Hyperparameter pada Model Image Captioning dengan Integrasi Fitur Deteksi Objek Moh. Novil Ma'arij; Yuni Yamasari
Journal of Informatics and Computer Science (JINACS) Article In Press
Publisher : Universitas Negeri Surabaya

Show Abstract | Download Original | Original Source | Check in Google Scholar

Abstract

Abstrak—Image captioning berbasis arsitektur encoder-decoder dengan mekanisme Bahdanau Attention umumnya hanya mengandalkan fitur global CNN, yang belum sepenuhnya mampu merepresentasikan detail objek, atribut, lokasi, maupun hubungan antar objek dalam citra. Berbagai penelitian mengatasi keterbatasan ini dengan menambahkan fitur objek dari model object detector, namun bukti empiris mengenai efektivitas perbandingan langsung antar jenis object detector, khususnya YOLOv8, pada tugas ini masih terbatas. Penelitian ini membandingkan kinerja tiga skenario integrasi fitur, yaitu Baseline (fitur global Xception), One-Stage (Xception + YOLOv8), dan Two-Stage (Xception + Faster R-CNN), menggunakan dual projection feature fusion dan decoder GRU dengan Bahdanau Attention. Eksperimen dilakukan pada dataset Flickr8k dengan 18 skenario hasil kombinasi tiga skenario model, tiga konfigurasi hyperparameter, dan dua ukuran batch size, dievaluasi menggunakan metrik BLEU, METEOR, ROUGE-L, CIDEr, dan SPICE. Hasil ANOVA dua arah menunjukkan bahwa konfigurasi hyperparameter merupakan faktor paling dominan terhadap variasi kinerja model (46,0% variansi CIDEr; 80,3% variansi SPICE), diikuti ukuran batch (24,3%; 6,4%), sedangkan pemilihan arsitektur object detector tidak berpengaruh signifikan secara statistik (2,3%; 4,1%; p>0,05). Skenario Two-Stage (Faster R-CNN) memperoleh rata-rata kinerja tertinggi, namun selisihnya relatif kecil terhadap skenario lain. Konfigurasi terbaik diperoleh pada kombinasi batch size 16 dan label smoothing, dengan CIDEr tertinggi 0,4285. Temuan ini mengindikasikan bahwa optimasi strategi pelatihan memberikan dampak lebih besar terhadap kualitas caption dibandingkan pemilihan jenis object detector. Kata Kunci— image captioning, Bahdanau attention, YOLOv8, Faster R-CNN, optimasi hyperparameter.