Claim Missing Document
Check
Articles

Found 1 Documents
Search

Benchmarking Konfigurasi Apache Spark Single-Node: Studi Format, Partitioning, dan Caching pada Dataset Log Sintetis Syahrur Ro'uf; Bambang Purnomosidi Dwi Putranto
Journal of Computers and Digital Business Vol. 5 No. 3 (2026): Articles in Press
Publisher : PT. Delitekno Media Mandiri

Show Abstract | Download Original | Original Source | Check in Google Scholar | DOI: 10.56427/jcbd.v5i3.1015

Abstract

Studi benchmarking Apache Spark umumnya dilakukan pada klaster multi-node berskala komersial, sehingga panduan konfigurasi untuk mode single-node (local mode) yang lazim dipakai peneliti dengan sumber daya terbatas masih jarang diverifikasi secara empiris dan terbuka. Penelitian ini mengisi kesenjangan tersebut dengan mengevaluasi pipeline data lima tahap (ingest, cleanse, transform, aggregate, dan sink) menggunakan Apache Spark 4.1 pada mesin single-node (4 core, memori driver 4 GB) untuk mengolah dataset log transaksional sintetis 5 juta rekaman (424 MB) yang meniru karakteristik data akses terbuka. Empat eksperimen terkendali dilakukan: (E1) format penyimpanan CSV versus Parquet, (E2) strategi shuffle partitioning, (E3) in-memory caching untuk beban kerja iteratif, dan (E4) profiling waktu eksekusi per tahap. Pada lingkungan uji tersebut, Parquet memberikan percepatan baca 4,03× dengan rasio kompresi 2,92× dibanding CSV; jumlah partisi optimal adalah 4, sesuai jumlah core CPU; in-memory caching menghasilkan percepatan kumulatif 2,22× pada empat kueri berulang; dan pipeline end-to-end mencapai throughput 26.130 rekaman per detik nilai yang spesifik terhadap mesin uji dengan tahap sink Parquet terpartisi sebagai bottleneck dominan (75,1% total waktu). Kontribusi bersifat konfirmatoris-empiris: memverifikasi secara terkendali panduan konfigurasi yang terdokumentasi namun jarang diukur pada konteks single-node, sekaligus menyediakan kode sumber dan generator dataset secara terbuka untuk mendukung reproducibility.