Keterbatasan data beranotasi berkualitas menghambat pengembangan model Named Entity Recognition (NER) medis untuk Bahasa Indonesia. Penelitian ini menyajikan desain evaluasi untuk framework anotasi semi-otomatis berbasis Large Language Models (LLMs) untuk terminologi medis Indonesia. Framework mengintegrasikan pre-anotasi LLM dengan validasi manusia melalui web interface. Tujuan utama penelitian ini adalah mengevaluasi konsistensi dari LLM pada 21 posting forum Alodokter terkait NER dengan lima kategori entitas: penyakit, gejala, anatomi, obat, dan prosedur, menggunakan ensembel tiga varian model Gemini (Gemini-2.5-Flash, Gemini-2.0-Flash, dan Gemini-2.5-Flash-Lite). Evaluasi menggunakan Inter-Annotator Agreement (IAA) Cohen’s Kappa dan F1 score. Hasil menunjukkan konsistensi internal model yang tinggi, dengan Gemini-2.5-Flash-Lite mencapai konsistensi internal tertinggi (strict F1 = 0.970, kappa = 0.977). Kesepakatan antar-model signifikan tetapi lebih rendah (rata-rata F1 ketat = 0.716, kappa = 0.756), dengan deteksi batas sebagai sumber utama ketidaksepakatan. Analisis posting dengan kesepakatan terendah mengidentifikasi tiga faktor: ambiguitas identifikasi entitas pada posting berbentuk pertanyaan, ambiguitas klasifikasi jenis entitas, dan strategi segmentasi batas untuk bahasa medis Indonesia informal.
Copyrights © 2026