Claim Missing Document
Check
Articles

Found 2 Documents
Search

Iterative Query Reformulation Berbasis LLM Untuk Temu Balik Artikel Hukum Indonesia Al Hafiz, Muhammad Abdiel; Wardana, Bayu Kusuma; Wibawa, Surya Harwindu Putra; Ulhaq, Muhammad Zhiya; Ramadhan, Muhami Jauza Alma; Ramdani, Noval Esa; Leksana, Evan Prima Mangku
Journal of Informatics and Interactive Technology Vol. 3 No. 1 (2026): April
Publisher : ACSIT

Show Abstract | Download Original | Original Source | Check in Google Scholar | DOI: 10.63547/jiite.v3i1.113

Abstract

Akses terhadap informasi hukum yang akurat sering kali terkendala oleh kesenjangan semantik antara bahasa awam yang digunakan masyarakat dan terminologi hukum formal. Penelitian terdahulu yang menerapkan Retrieval Augmented Generation (RAG) pada Kitab Undang-Undang Hukum Pidana (KUHP) menghasilkan tingkat keberhasilan (Hit Rate) sebesar 80%, namun masih memiliki keterbatasan dalam menangani variasi gaya bahasa pengguna yang implisit serta konteks hukum yang kompleks. Penelitian ini mengusulkan metode Iterative Query Reformulation berbasis Large Language Model (LLM) untuk mengatasi permasalahan tersebut. Sistem ini menggunakan mekanisme Double Hop Retrieval yang melibatkan pencarian awal (initial retrieval) untuk mendapatkan konteks, diikuti oleh reformulasi pertanyaan menggunakan model Qwen 3 32B menjadi kueri hukum baku, sebelum dilakukan pencarian final ( final retrieval). Menggunakan dataset yang dikumpulkan dari HukumOnline sebanyak 750 artikel, evaluasi dilakukan menggunakan metrik Faithfulness, Answer Relevancy, Hit Rate, dan Mean Reciprocal Rank (MRR). Hasil pengujian menunjukkan peningkatan performa yang signifikan, dengan skor Faithfulness mencapai 98.6%, Answer Relevancy 100%, Hit Rate 100%, dan peningkatan MRR dari 90% (tanpa reformulasi) menjadi 93% (dengan reformulasi). Pendekatan ini terbukti efektif menjembatani kesenjangan bahasa dan meningkatkan presisi temu balik informasi hukum di Indonesia.
MITIGASI BIAS LARGE LANGUAGE MODEL MELALUI HUMAN-IN-THE-LOOP PADA AUTOMATED ESSAY SCORING BERBASIS ESAI IELTS-LIKE Al Hafiz, Muhammad Abdiel; Amin, M. Syaiful
Jurnal Rekayasa Perangkat Lunak dan Sistem Informasi Vol. 6 No. 2 (2026)
Publisher : Department of Information System Muhammadiyah University of Riau

Show Abstract | Download Original | Original Source | Check in Google Scholar | DOI: 10.37859/seis.v6i2.11478

Abstract

This study evaluates the reliability, algorithmic bias, and feasibility of implementing Human-in-the-Loop (HITL) in Large Language Model (LLM)-based Automated Essay Scoring (AES). Two architectures were compared: the Mixture-of-Experts architecture represented by GPT OSS 120B and the Dense architecture represented by Qwen3-32B, using a multiple-run scoring approach on 150 IELTS-like essays written by 50 respondents. Each essay was evaluated five times across four criteria: Grammar, Lexical Resource, Coherence, and Task Achievement. The evaluation employed the Intraclass Correlation Coefficient (ICC), Coefficient of Variation (CV), score range, paired t-test, and confidence-based routing simulation.The results show that GPT OSS 120B achieved higher reliability, with an ICC of 0.94, an average range of 2.40 points, and a CV of 4.69%, while Qwen3-32B obtained an ICC of 0.84, an average range of 5.56 points, and a CV of 9.17%. However, GPT OSS 120B experienced a parsing failure rate of 25.4%, whereas Qwen3-32B demonstrated full format compliance. Comparative analysis also showed that GPT OSS 120B tended to score more strictly, while Qwen3-32B was more lenient. In the Data Report task without visual input, both models exhibited conservatism bias due to contextual limitations. The HITL simulation showed that GPT OSS 120B could automatically approve 55.4% of essays, compared with only 7.8% for Qwen3-32B. These findings highlight the importance of HITL in maintaining the reliability, fairness, and integrity of academic assessment.