Studi benchmarking Apache Spark umumnya dilakukan pada klaster multi-node berskala komersial, sehingga panduan konfigurasi untuk mode single-node (local mode) yang lazim dipakai peneliti dengan sumber daya terbatas masih jarang diverifikasi secara empiris dan terbuka. Penelitian ini mengisi kesenjangan tersebut dengan mengevaluasi pipeline data lima tahap (ingest, cleanse, transform, aggregate, dan sink) menggunakan Apache Spark 4.1 pada mesin single-node (4 core, memori driver 4 GB) untuk mengolah dataset log transaksional sintetis 5 juta rekaman (424 MB) yang meniru karakteristik data akses terbuka. Empat eksperimen terkendali dilakukan: (E1) format penyimpanan CSV versus Parquet, (E2) strategi shuffle partitioning, (E3) in-memory caching untuk beban kerja iteratif, dan (E4) profiling waktu eksekusi per tahap. Pada lingkungan uji tersebut, Parquet memberikan percepatan baca 4,03× dengan rasio kompresi 2,92× dibanding CSV; jumlah partisi optimal adalah 4, sesuai jumlah core CPU; in-memory caching menghasilkan percepatan kumulatif 2,22× pada empat kueri berulang; dan pipeline end-to-end mencapai throughput 26.130 rekaman per detik nilai yang spesifik terhadap mesin uji dengan tahap sink Parquet terpartisi sebagai bottleneck dominan (75,1% total waktu). Kontribusi bersifat konfirmatoris-empiris: memverifikasi secara terkendali panduan konfigurasi yang terdokumentasi namun jarang diukur pada konteks single-node, sekaligus menyediakan kode sumber dan generator dataset secara terbuka untuk mendukung reproducibility.
Copyrights © 2026