Stroke is a primary cause of mortality globally, making accurate risk classification vital for early intervention. This study aims to evaluate the effectiveness of K-Nearest Neighbor (KNN) compared to Logistic Regression in detecting stroke risk. Utilizing 4,981 medical records from Kaggle, the SMOTE technique was implemented to address data imbalance across 80:20 and 70:30 split scenarios. Results indicate that Logistic Regression outperforms KNN, providing more consistent performance in detecting high-risk classes. The most optimal performance was achieved by Logistic Regression at an 80:20 ratio, reaching 80.00% recall and 74.12% accuracy. This study demonstrates that Logistic Regression is a more effective and sensitive method for identifying clinical stroke risk factors in medical decision support systems. Keywords: Classification; KNN; Logistic Regression; SMOTE; Stroke Abstrak Stroke merupakan penyebab kematian utama secara global, sehingga klasifikasi risiko yang akurat sangat penting untuk intervensi dini. Penelitian ini bertujuan mengevaluasi efektivitas algoritma K-Nearest Neighbor (KNN) dibandingkan Logistic Regression dalam mendeteksi risiko stroke. Dengan menggunakan dataset 4.981 rekam medis dari Kaggle, teknik SMOTE diterapkan untuk menangani ketidakseimbangan data pada skenario pembagian 80:20 dan 70:30. Hasil menunjukkan Logistic Regression mengungguli KNN dengan performa lebih konsisten dalam mendeteksi kelas risiko. Kinerja paling optimal dicapai Logistic Regression pada rasio 80:20 dengan nilai recall 80,00% dan akurasi 74,12%. Penelitian ini membuktikan Logistic Regression adalah metode yang lebih efektif dan sensitif dalam mengidentifikasi faktor risiko klinis stroke untuk mendukung sistem keputusan medis. Kata kunci: Klasifikasi; KNN; Logistic Regression; SMOTE; Stroke
Copyrights © 2026