Claim Missing Document
Check
Articles

Found 1 Documents
Search

PERBANDINGAN KINERJA MODEL CNN EFFICIENTNETB0 DAN VISION TRANSFORMER UNTUK KLASIFIKASI CITRA REAL-FAKE Akhlaqul Muhammad Fadwa; M. Sohibbal; Rachel Ditya Syaharani; Dian Ramadhani; Al Aminuddin
Journal of System & Technology (SYSTEC) Vol. 2 No. 1 (2026): Journal of System & Technology (June Edition)
Publisher : Jurusan Teknik Elektro, Fakultas Teknik, Universitas Riau

Show Abstract | Download Original | Original Source | Check in Google Scholar

Abstract

Model generatif berbasis Generative Adversarial Network (GAN) seperti StyleGAN, Stable Diffusion, DALL·E, dan DeepFaceLab kini mampu menghasilkan citra sintetis yang sulit dibedakan dari citra asli, memicu penyalahgunaan berupa deepfake, manipulasi identitas digital, dan misinformasi visual yang mengancam kepercayaan terhadap konten digital. Penelitian ini mengusulkan pendekatan komparatif antara Convolutional Neural Network (CNN) berbasis EfficientNetB0 dan Vision Transformer (ViT) untuk mengklasifikasikan citra real dan fake guna mengidentifikasi arsitektur paling efektif dalam deteksi konten sintetis. Kedua model dikonfigurasi dengan backbone frozen menggunakan bobot pre-trained dan classifier head identik: Dense(512, ReLU), Dropout(0,4), Dense(256, ReLU), Dropout(0,4), Dense(1, Sigmoid), untuk memastikan perbandingan yang objektif. Dataset CIFAKE terdiri dari 120.000 citra — 60.000 real (CIFAR-10) dan 60.000 fake (Stable Diffusion v1.4) — diproses dengan resizing ke 224×224 piksel, normalisasi, dan augmentasi data, dengan pembagian 80:20 untuk pelatihan-validasi dan 20.000 citra untuk pengujian. Evaluasi dilakukan menggunakan akurasi, precision, recall, F1-score, dan confusion matrix. EfficientNetB0 mencapai akurasi 84,79% dengan waktu pelatihan ±1 jam 12 menit, namun lemah pada deteksi kelas fake dengan recall 72,17% dan false positive 2.783 citra. Sebaliknya, Vision Transformer mencapai akurasi 97,15% dengan precision, recall, dan F1-score seimbang di atas 97% pada kedua kelas, dengan waktu pelatihan ±14 jam 18 menit. Vision Transformer terbukti mengungguli EfficientNetB0 pada seluruh metrik, sementara EfficientNetB0 tetap relevan pada skenario dengan keterbatasan komputasi. Secara khusus, untuk menekan angka false positive pada EfficientNetB0, penelitian selanjutnya dapat menerapkan class-weighted loss atau focal loss guna meningkatkan sensitivitas model terhadap kelas fake, serta threshold tuning pada output sigmoid untuk menyeimbangkan precision dan recall.