PPKIAPPKIA

Journal of Big Data Analytic and Artificial IntelligenceJournal of Big Data Analytic and Artificial Intelligence

Penggunaan metrik-metrik validasi internal secara bersamaan untuk menentukan jumlah klaster optimal pada algoritma K-Means Clustering berpotensi memberikan nilai K yang berbeda-beda dan membingungkan bagi pengguna data untuk mengekstraksi informasi seperti untuk identifikasi karakteristik pelanggan. Penelitian ini bertujuan mengembangkan framework evaluasi untuk mengatasi ambiguitas nilai K dari beberapa metrik validasi internal. Framework evaluasi nilai K terdiri dari 2 tahap, dengan tahap pertama menggunakan lima metrik validasi, DBI, Silhouette Score, Elbow Method, Dunn Index dan Calinski-Harabasz Index sebagai filter untuk menghasilkan maksimal 5 nilai K terbaik. Evaluasi tahap kedua menggunakan analisis boxplot, inter quartile range dan elbow untuk mengeksplorasi tingkat kohesifitas dan stabilitas klaster yang terbentuk. Hasil yang diperoleh dari evaluasi tahap 1 terdapat 4 opsi jumlah klaster, K=2, 5, 7 dan 10. Evaluasi tahap kedua menunjukkan dari grafik elbow nilai rata-rata inter quartile range, K=5 menjadi jumlah klaster yang optimal dibanding 3 nilai K lainnya. Hasil ini menunjukkan bahwa semakin banyak metrik validasi internal yang digunakan, berpotensi menghasilkan banyak nilai K. Semakin banyak jumlah klaster tidak menjamin semakin baik kualitasnya. Implikasi dari penelitian ini menunjukkan pentingnya pendekatan evaluasi berlapis dalam menentukan jumlah klaster optimal, terutama saat menggunakan banyak metrik validasi internal secara bersamaan. Framework yang dikembangkan dapat membantu praktisi data dalam membuat keputusan yang lebih terinformasi dan mengurangi ambiguitas dalam proses klasterisasi. Ke depan, framework ini dapat dikembangkan lebih lanjut dengan mengintegrasikan metrik eksternal atau diadaptasi untuk algoritma klasterisasi lainnya.

Penelitian ini berhasil mengembangkan framework evaluasi dua tahap untuk menentukan jumlah klaster optimal pada K-Means Clustering.Hasil menunjukkan bahwa K=5 merupakan jumlah klaster terbaik berdasarkan analisis boxplot dan inter quartile range.Penelitian ini menegaskan bahwa penggunaan metrik validasi internal yang lebih banyak tidak selalu meningkatkan kualitas klaster, sehingga diperlukan pendekatan evaluasi berlapis untuk memastikan stabilitas dan kohesivitas klaster.Framework yang diusulkan dapat menjadi panduan bagi praktisi data dalam mengurangi ambiguitas hasil klasterisasi.

1. Penelitian lanjutan dapat mengintegrasikan metrik validasi eksternal untuk membandingkan hasil klasterisasi dengan data referensi. 2. Pengembangan framework ini untuk algoritma klasterisasi lain seperti DBSCAN atau Hierarchical Clustering agar lebih fleksibel. 3. Studi eksperimental untuk mengevaluasi dampak perubahan dataset terhadap optimalisasi jumlah klaster, terutama pada data yang lebih kompleks atau berukuran besar.

  1. Comparison of K-Means and K-Medoids Algorithms for Grouping Cocoa Production Areas | Jurnal Teknik Informatika... doi.org/10.28932/jutisi.v8i2.4897Comparison of K Means and K Medoids Algorithms for Grouping Cocoa Production Areas Jurnal Teknik Informatika doi 10 28932 jutisi v8i2 4897
  2. Comparison of Agglomerative Hierarchical and K-Means in Grouping Provinces Based on Maternal Health Services... sistemasi.ftik.unisi.ac.id/index.php/stmsi/article/view/1829Comparison of Agglomerative Hierarchical and K Means in Grouping Provinces Based on Maternal Health Services sistemasi ftik unisi ac index php stmsi article view 1829
  3. Metode Elbow dalam Optimasi Jumlah Cluster pada K-Means Clustering | Simetris: Jurnal Teknik Mesin, Industri,... doi.org/10.24176/simet.v14i2.9630Metode Elbow dalam Optimasi Jumlah Cluster pada K Means Clustering Simetris Jurnal Teknik Mesin Industri doi 10 24176 simet v14i2 9630
Read online
File size511.77 KB
Pages6
DMCAReport

Related /

ads-block-test