Bandung Conference Series: Statistics
Bandung Conference Series: Statistics (BCSS) menerbitkan artikel penelitian akademik tentang kajian teoritis dan terapan serta berfokus pada Statistika dengan ruang lingkup sebagai berikut: Alternating Least Square, Analisis Konjoin, Autoregressive, Auxiliary Variabel, Baby Birth, Block Maxima, Churn Distribusi Skellam, Cox Regression, Data spasial, DBD Ordinal Logistic Regression, Diagram kendali, Discrete Choice Experiment Method, Discrete Time Logistic, empirical likelihood, Fisher Scoring, Generalized Structured Component Analysis, Geographically Weighted Regression, GEV, GJR GARCH, Infant Mortality Preferensi, Insurance Claim, Kaplan-Meier, Kernel Bi-Square, Gaussian, Logistic Regression, Maternal Mortality, Mixed Geographically Weighted Regression Model GSTAR, MLE, Model ARIMAX, MSE. Multiple linear regression analysis, Nadaraya Watson, Newton Raphson Method, Nonparametrik Spline Confidence Interval, Optimasi Multi-Objek, orde Spasial, Outlier, Pareto Optimal, Partial Proportional Odds Model, Pemodelan Indeks Pembangunan Manusia. Penduga Rasio dan Produk Tipe Eksponensial, Peramalan, Poisson Bivariate Regression, Poisson Regression, Rata-rata Populasi berhingga, Regresi, Return Period Exogenous Variable, RMSE, Structural Equation Modeling, Survival Analysis, Threshold, Vibrasi Bearing, zero-inflated. Prosiding ini diterbitkan oleh UPT Publikasi Ilmiah Unisba. Artikel yang dikirimkan ke prosiding ini akan diproses secara online dan menggunakan double blind review minimal oleh dua orang mitra bebestari.
Articles
1 Documents
Search results for
, issue
"329-336"
:
1 Documents
clear
Pemodelan Topik Skripsi Statistika Universitas Islam Bandung Tahun 2020–2025 Menggunakan BERTopic KernelPCA–K-Means
Muhammad Rivaldi Yusuf;
Ilham Faishal Mahdy
Bandung Conference Series: Statistics 329-336
Publisher : UNISBA Press
Show Abstract
|
Download Original
|
Original Source
|
Check in Google Scholar
|
DOI: 10.29313/bcss.v6i2.26152
Abstract. This study models and examines the development of undergraduate thesis topics in the Statistics Study Program at Universitas Islam Bandung during 2020–2025 using a modular BERTopic architecture with IndoBERT, Kernel Principal Component Analysis (KernelPCA), and K-Means. The initial corpus contained 491 title-and-abstract documents. After data preparation and text preprocessing, 481 complete documents were retained for analysis. IndoBERT converted each document into a 768-dimensional contextual embedding, which was reduced to five components using KernelPCA with a radial basis function kernel. The number of clusters was determined through the Elbow Method, and K-Means produced six clusters with a within-cluster sum of squares of 8.974795. Topic representation using class-based TF-IDF indicated themes related to process and quality control; insurance, claims, and risk; regional and population data; relationship testing and intervariable modelling; time series and forecasting; and regression, parameter estimation, and probability distributions. The overall coherence score was 0.546040. Annual distributions fluctuated across the observation period: Cluster 5 had the largest overall membership, while Clusters 2 and 4 gained relative prominence toward the end of the period. The 2025 pattern must be interpreted cautiously because fewer documents were available. The approach provides an interpretable overview of the thematic development of statistics theses. Abstrak. Penelitian ini memodelkan dan menganalisis perkembangan topik skripsi mahasiswa Program Studi Statistika Universitas Islam Bandung tahun 2020–2025 menggunakan arsitektur BERTopic yang mengintegrasikan IndoBERT, Kernel Principal Component Analysis (KernelPCA), dan K-Means. Korpus awal terdiri atas 491 dokumen judul dan abstrak. Setelah tahap data preparation dan text preprocessing, sebanyak 481 dokumen lengkap dipertahankan untuk analisis. IndoBERT mengubah setiap dokumen menjadi embedding kontekstual berdimensi 768, kemudian KernelPCA dengan kernel radial basis function mereduksinya menjadi lima komponen. Jumlah klaster ditetapkan melalui Elbow Method dan K-Means menghasilkan enam klaster dengan nilai within-cluster sum of squares sebesar 8,974795. Representasi topik menggunakan class-based TF-IDF menunjukkan tema pengendalian proses dan kualitas; asuransi, klaim, dan risiko; data kewilayahan dan kependudukan; pengujian hubungan dan pemodelan antarvariabel; deret waktu dan peramalan; serta regresi, estimasi parameter, dan distribusi probabilitas. Nilai coherence keseluruhan sebesar 0,546040. Perkembangan tahunan keenam klaster bersifat fluktuatif. Klaster 5 memiliki anggota terbanyak secara keseluruhan, sedangkan Klaster 2 dan Klaster 4 mengalami peningkatan dominasi relatif pada akhir periode. Pola tahun 2025 perlu ditafsirkan secara hati-hati karena jumlah dokumennya lebih sedikit. Pendekatan ini menghasilkan pemetaan tematik yang dapat diinterpretasikan dan menggambarkan perkembangan topik skripsi Statistika Universitas Islam Bandung.