Teknologi pengenalan wajah sangat bergantung pada tahap pra-pemrosesan untuk memisahkan objek wajah dari latar belakang yang kompleks dan tidak relevan. Studi ini mengevaluasi arsitektur hibrida yang menggabungkan detektor YOLOv12 dan model segmentasi tingkat piksel FastSAM sebagai solusi pra-pemrosesan komprehensif. Alur kerja sekuensial dijalankan di lingkungan Google Colab, di mana YOLOv12 berfungsi sebagai detektor utama untuk memberikan petunjuk bounding box kepada FastSAM. Hasilnya menunjukkan bahwa YOLOv12 bertindak sebagai lokalisator yang agresif dan sangat responsif, mencapai Recall 81,96% dan mAP@50 78,95% selama 100 epoch pelatihan. Bounding box yang dihasilkan kemudian digunakan oleh FastSAM untuk memurnikan wilayah yang terdeteksi dan menghilangkan noise latar belakang. Meskipun pengujian kuantitatif awalnya mencatat nilai mIoU anomali sebesar 0,14%, investigasi visual komprehensif membuktikan bahwa ini murni disebabkan oleh kesalahan pembacaan struktural dalam data anotasi ground truth selama eksekusi skrip evaluasi, bukan kegagalan arsitektur. Secara empiris, integrasi jaringan bertingkat ini telah terbukti sangat kuat dan efektif dalam mengisolasi wajah di berbagai skenario visual dunia nyata yang menantang, memberikan dasar masukan yang ideal dan bersih untuk ekstraksi fitur biometrik selanjutnya.
Copyrights © 2026