Stroke merupakan penyebab utama kematian dan kecacatan secara global, menjadikan deteksi dini berbasis rekam medis sebagai tindakan preventif yang krusial. Dalam memodelkan data klinis, algoritma Machine Learning seringkali menghadapi masalah ketimpangan distribusi kelas (class imbalance) yang parah. Pada dataset stroke publik, ketidakseimbangan ini menyebabkan model klasifikasi terjebak pada accuracy paradox, di mana model memperoleh akurasi tinggi dengan cara memprediksi seluruh data sebagai kelas mayoritas (sehat), namun sama sekali gagal mendeteksi kelas minoritas (stroke). Penelitian ini secara komprehensif membandingkan efektivitas dua algoritma penyeimbangan data level sintetis, yaitu Synthetic Minority Over-sampling Technique (SMOTE) dan Adaptive Synthetic (ADASYN), yang diintegrasikan pada arsitektur Random Forest. Dataset yang digunakan adalah Healthcare Stroke Data (Kaggle) dengan komposisi 95,13% pasien sehat dan 4,87% pasien stroke (5.110 observasi). Metodologi penelitian mencakup pra-pemrosesan (imputasi median dan label encoding), penerapan oversampling eksklusif pada data latih, dan pengujian menggunakan data tak terlihat (unseen data). Hasil eksperimen menunjukkan bahwa model Baseline (tanpa oversampling) mencatat akurasi semu sebesar 95,11% namun memiliki metrik Recall yang sangat kritis (2,00%). Sebaliknya, integrasi algoritma SMOTE terbukti paling efektif memecahkan paradoks tersebut dengan mendongkrak Recall hingga 11 kali lipat menjadi 22,00% serta mencapai F1-Score 0,1864, meskipun menurunkan akurasi keseluruhan menjadi 90,61%. ADASYN menghasilkan kinerja yang sedikit lebih rendah dengan Recall 18,00% akibat sintesis data agresif pada wilayah perbatasan (decision boundary) yang menciptakan noise. Kesimpulan dari penelitian ini menegaskan bahwa penyeimbangan data secara merata melalui SMOTE sangat vital dalam sistem diagnostik medis yang memprioritaskan sensitivitas penemuan penyakit (Recall).
Copyrights © 2026