Prosiding Seminar Nasional Teknologi Informasi dan Bisnis
Prosiding Seminar Nasional Teknologi Informasi dan Bisnis (SENATIB) 2026

Analisis Perbandingan Algoritma Oversampling: Smote Dan Adasyn Pada Random Forest Untuk Prediksi Stroke

Musa Muhammad Isa Al’Azzam (Fakultas Ilmu Komputer, Universitas Duta Bangsa Surakarta)
Afu Ichsan Pradana (Fakultas Ilmu Komputer, Universitas Duta Bangsa Surakarta)
Arif Setiawan (Fakultas Ilmu Komputer, Universitas Duta Bangsa Surakarta)



Article Info

Publish Date
25 Jul 2026

Abstract

Stroke merupakan penyebab utama kematian dan kecacatan secara global, menjadikan deteksi dini berbasis rekam medis sebagai tindakan preventif yang krusial. Dalam memodelkan data klinis, algoritma Machine Learning seringkali menghadapi masalah ketimpangan distribusi kelas (class imbalance) yang parah. Pada dataset stroke publik, ketidakseimbangan ini menyebabkan model klasifikasi terjebak pada accuracy paradox, di mana model memperoleh akurasi tinggi dengan cara memprediksi seluruh data sebagai kelas mayoritas (sehat), namun sama sekali gagal mendeteksi kelas minoritas (stroke). Penelitian ini secara komprehensif membandingkan efektivitas dua algoritma penyeimbangan data level sintetis, yaitu Synthetic Minority Over-sampling Technique (SMOTE) dan Adaptive Synthetic (ADASYN), yang diintegrasikan pada arsitektur Random Forest. Dataset yang digunakan adalah Healthcare Stroke Data (Kaggle) dengan komposisi 95,13% pasien sehat dan 4,87% pasien stroke (5.110 observasi). Metodologi penelitian mencakup pra-pemrosesan (imputasi median dan label encoding), penerapan oversampling eksklusif pada data latih, dan pengujian menggunakan data tak terlihat (unseen data). Hasil eksperimen menunjukkan bahwa model Baseline (tanpa oversampling) mencatat akurasi semu sebesar 95,11% namun memiliki metrik Recall yang sangat kritis (2,00%). Sebaliknya, integrasi algoritma SMOTE terbukti paling efektif memecahkan paradoks tersebut dengan mendongkrak Recall hingga 11 kali lipat menjadi 22,00% serta mencapai F1-Score 0,1864, meskipun menurunkan akurasi keseluruhan menjadi 90,61%. ADASYN menghasilkan kinerja yang sedikit lebih rendah dengan Recall 18,00% akibat sintesis data agresif pada wilayah perbatasan (decision boundary) yang menciptakan noise. Kesimpulan dari penelitian ini menegaskan bahwa penyeimbangan data secara merata melalui SMOTE sangat vital dalam sistem diagnostik medis yang memprioritaskan sensitivitas penemuan penyakit (Recall).

Copyrights © 2026






Journal Info

Abbrev

Senatib

Publisher

Subject

Computer Science & IT Control & Systems Engineering Decision Sciences, Operations Research & Management Economics, Econometrics & Finance Electrical & Electronics Engineering Engineering Industrial & Manufacturing Engineering Mechanical Engineering Physics

Description

Prosiding SENATIB adalah kegiatan seminar berskala nasional yang diselenggarakan oleh Fakultas Ilmu Komputer Universitas Duta Bangsa Surakarta dalam rangka diseminasi hasil penelitian tentang teknologi informasi dan bisnis. Diharapkan pada tahun 2022 melalui penerbitan prosiding ini dapat terwujud ...