Dataset klinis sering memuat nilai hilang yang dapat memengaruhi keandalan model prediksi. Penelitian ini membandingkan imputasi mean, median, dan KNN dalam menangani nilai hilang pada dataset Myocardial Infarction Complications. Data awal terdiri atas 1.700 rekam pasien, 111 fitur masukan, dan LET_IS sebagai target prediksi. Setelah simbol nilai hilang dikonversi, kolom dengan nilai hilang tinggi dibersihkan, dan baris yang tidak dapat digunakan pada target penelitian dihapus, data yang diproses pada tahap train-test split menjadi 1.350 rekam, yaitu 1.080 data latih dan 270 data uji. Setiap skenario imputasi dievaluasi menggunakan Decision Tree berbasis Entropi sebagai pendekatan praktis terhadap prinsip pemisahan C4.5. Hasil Google Colab terbaru pada skenario single-split menunjukkan bahwa imputasi median menghasilkan akurasi tertinggi sebesar 89,63%, diikuti KNN sebesar 88,52% dan mean sebesar 88,15%. Rekomendasi utama penelitian ini adalah median karena memberikan akurasi tertinggi pada pengujian utama.
Copyrights © 2026