Uncovering latent trends in academic metadata is critical for under-standing research dynamics in information systems. This study em-ploys Latent Dirichlet Allocation (LDA), a probabilistic machine learning algorithm in artificial intelligence, to analyze metadata from 180 undergraduate theses (2020–2024) at Universitas Negeri Malang, using Library and Information Science (LIS) as a case study. The da-taset, comprising titles and abstracts, underwent preprocessing (tokeni-zation, lowercasing, stopword removal, and domain-specific term fil-tering) to create a clean text corpus. Using Gensim’s variational Bayes, LDA models with K=5–15 topics were tested, selecting K=8 based on optimal C_v coherence (0.65) and perplexity (~150). Topics, labeled via top keywords, include Digital Libraries, User Behavior, and Ar-chive Management. Annual topic distributions, visualized via stacked bar charts, revealed a surge in digital topics during 2021–2022 (pan-demic-driven) and rising user behavior focus in 2022–2023. This LDA framework demonstrates scalability for text mining in academic data-bases, offering a replicable pipeline for trend analysis across domains like education or social media. Findings complement global studies, providing insights for curriculum alignment. Limitations include small dataset size and metadata-only analysis. Future work could integrate full-text data or advanced models like BERTopic for enhanced seman-tic discovery.
Copyrights © 2025