Penilaian esai secara manual membutuhkan waktu yang lama dan rentan terhadap inkonsistensi antarpenilai, sementara pengembangan sistem Automated Essay Scoring (AES) untuk Bahasa Indonesia masih terkendala keterbatasan dataset berlabel. Penelitian ini mengimplementasikan model IndoBERT dengan pendekatan regresi untuk menilai jawaban esai siswa dan menerapkan augmentasi data sintetis berbasis Large Language Model (LLM) guna mengatasi ketidakseimbangan kelas pada kategori skor rendah. Dataset primer terdiri atas 556 jawaban esai siswa kelas VII pada empat butir soal mata pelajaran Pendidikan Kewarganegaraan yang dinilai oleh guru, dan menyisakan 551 data setelah pembersihan. Augmentasi menggunakan GPT-4o-mini menghasilkan 160 jawaban sintetis pada kategori skor 0 dan 1 sehingga dataset meningkat menjadi 711 data. Model dievaluasi menggunakan 5-fold cross-validation dengan metrik Quadratic Weighted Kappa (QWK), Mean Absolute Error (MAE), dan korelasi Spearman pada empat kondisi pengujian yang membedakan butir soal terlatih dan tidak terlatih. Hasil menunjukkan model hasil augmentasi memperoleh QWK 0,8942 dan Spearman 0,9063, meningkat dari 0,7884 dan 0,8199 pada model tanpa augmentasi, meskipun MAE sedikit memburuk dari 0,3931 menjadi 0,4113. Namun, ketika model yang sama diuji pada 1.000 jawaban dari 100 butir soal yang belum pernah dilatihkan, QWK turun menjadi 0,4832. Temuan ini menunjukkan bahwa ketersediaan butir soal pada data latih merupakan penentu performa yang lebih dominan dibandingkan sumber maupun jumlah data latih..
Copyrights © 2026