Digital service systems built on event-driven architecture relied on infrastructure-level self-healing, leaving workflow-layer failures handled reactively and processes abandoned mid-execution even when infrastructure remained available. This study designed a failure-aware self-healing workflow that detected, classified, and recovered digital service failures automatically based on event context, treating classification as mandatory before recovery. A prototype was built following the Prototyping Model, integrating n8n as workflow orchestrator and Apache Kafka as event broker inside Docker, with recovery governed by a JavaScript finite state machine, tested on five failure scenarios and two baseline conditions, each run for 30 iterations. The system classified all failures correctly across 150 iterations, reaching 100% recovery accuracy and a 100% success rate where fallback was available. Self-healing lowered Recovery Time by 29.90% against a no-recovery baseline, though a static-recovery baseline reached a lower time with 0% success, showing recovery speed and correctness can move in opposite directions. Keywords: Failure-Aware; Self-Healing; Event-Driven Architecture; Workflow Orchestration; Mean Time to Recovery (MTTR) Abstrak Sistem layanan digital berbasis arsitektur event-driven umumnya mengandalkan self-healing pada tingkat infrastruktur, sementara kegagalan pada lapisan orkestrasi workflow ditangani secara reaktif melalui pemantauan manual sehingga proses bisnis dapat terhenti di tengah eksekusi meskipun infrastrukturnya masih berjalan normal. Penelitian ini merancang failure-aware self-healing workflow yang mendeteksi, mengklasifikasikan, dan memulihkan kegagalan layanan digital secara otomatis berdasarkan konteks event, dengan klasifikasi sebagai tahap wajib sebelum pemulihan dijalankan. Prototipe dibangun mengikuti Prototyping Model, mengintegrasikan n8n sebagai orkestrator workflow dan Apache Kafka sebagai event broker di dalam Docker, dengan keputusan pemulihan dikendalikan finite state machine berbasis JavaScript, diuji pada lima skenario kegagalan dan dua baseline, masing-masing 30 iterasi. Sistem mengklasifikasikan seluruh kegagalan secara tepat pada 150 iterasi, mencapai recovery accuracy 100% dan success rate 100% pada skenario dengan jalur fallback. Self-healing menurunkan MTTR sebesar 29,90% dibandingkan baseline tanpa pemulihan, meskipun baseline pemulihan statis mencatat waktu lebih rendah namun dengan success rate 0%, menunjukkan kecepatan dan ketepatan pemulihan dapat bergerak berlawanan arah.
Copyrights © 2026