Perkembangan model generatif berbasis deep learning membuat manipulasi wajah, suara, dan gerak bibir semakin realistis serta meningkatkan kebutuhan akan sistem deteksi yang dapat ditelusuri. Penelitian perancangan ini bertujuan menyusun spesifikasi sistem deteksi video deepfake multicue end-to-end yang siap diimplementasikan. Metode mengikuti enam tahapan Design Science Research: identifikasi masalah dan motivasi, penetapan tujuan solusi, perancangan dan pengembangan, pengujian melalui skenario penggunaan, evaluasi terhadap kriteria rancangan, serta diseminasi hasil. Capaian utama penelitian meliputi: (1) arsitektur multicue yang mengintegrasikan petunjuk spasial, frekuensi, temporal, dan audio-visual; (2) kontrak API dan alur layanan asinkron; (3) skema data, penyimpanan bukti, dan jejak audit; (4) rancangan deployment, registri model, dan pemantauan; serta (5) protokol evaluasi model, sistem, keamanan, dan manusia beserta kriteria penerimaannya. Spesifikasi juga mengatur pencegahan kebocoran data, kalibrasi dan ketidakpastian, pengujian lintas-dataset dan lintas-generator, serta penundaan keputusan ketika bukti tidak memadai. Implementasi direncanakan secara bertahap, dimulai dari MVP spasial-temporal, kemudian diperluas dengan cabang frekuensi dan audio-visual. Artikel ini tidak menyajikan pengukuran performa empiris karena fokus penelitian berada pada penyusunan spesifikasi sistem yang konsisten, dapat ditelusuri, dan siap divalidasi; pengukuran kinerja dilakukan setelah implementasi selesai dibangun.
Copyrights © 2026