NINETYJOURNALNINETYJOURNAL

Journal Computer and TechnologyJournal Computer and Technology

Prediksi pemodelan pada data tabel yang tidak seimbang sering kali terganggu oleh kebocoran target dan resampling yang tidak tepat, yang menyebabkan metrik kinerja yang membengkak. Meskipun metode ensembel berbasis pohon seperti Random Forest (RF) dan XGBoost banyak digunakan, divergensi arsitektur mereka dalam menangani anomali perilaku kompleks di bawah ketidakseimbangan kelas yang ketat masih belum banyak dijelajahi. Studi ini mengusulkan kerangka kerja ensembel yang sadar kebocoran untuk mengurangi kontaminasi SMOTE dan kebocoran target dalam prediksi pembatalan hotel. Menggunakan jalur pipa CRISP-DM yang ketat pada 119.390 catatan, kami menerapkan SMOTE secara eksklusif pada set pelatihan dan merancang ulang enam fitur perilaku untuk menangkap kontradiksi non-linear, seperti tingkat pembatalan 99,36% pada deposit non-refund. Kami membandingkan secara sistematis RF (bagging) terhadap XGBoost (boosting) menggunakan validasi silang 5-lipat yang terstratifikasi, optimasi hiperparameter, dan pemantauan kurva kerugian. Hasilnya menunjukkan bahwa XGBoost secara struktural lebih unggul dari RF dalam mendeteksi kelas minoritas, mencapai Recall yang lebih baik (0,6659), F1-Score (0,6607), dan AUC-ROC (0,8657), dengan varians yang signifikan lebih rendah (0,0035). Sebaliknya, RF menunjukkan Presisi yang lebih tinggi (0,6588) dan stabilitas validasi silang yang lebih baik selama pencarian hiperparameter. Pentingnya analisis fitur mengungkapkan divergensi struktural: RF memprioritaskan variabel temporal (lead_time), sedangkan XGBoost menekankan sinyal komitmen perilaku (parkir, permintaan khusus). Temuan ini mengonfirmasi bahwa mekanisme koreksi residual sekuensial boosting gradien secara inheren lebih tangguh daripada bagging pengurangan varians untuk data tabel yang tidak seimbang yang mengandung anomali kompleks, non-linear.

Studi ini membangun dan membandingkan Random Forest dan XGBoost untuk prediksi pembatalan reservasi hotel di bawah kondisi eksperimental terkendali pada dataset Hotel Booking Demand (119.994 catatan, rekayasa fitur enam variabel, dan penyeimbangan kelas berbasis SMOTE pada set pelatihan, model XGBoost yang disetel memberikan kinerja agregat terbaik.Akurasi 0,8133, Recall 0,6659, F1-Score 0,6607, dan AUC-ROC 0,8657.Hasil ini mengalahkan Random Forest yang disetel pada empat dari lima metrik, dengan celah Recall ( 0,0110) mewakili ~110 pembatalan tambahan yang terdeteksi per 10.rata-rata F1-Score 5-Fold 0,6351 dengan standar deviasi 0,0035, dibandingkan dengan 0,6290 dan 0,0065 untuk Random Forest.Variansi yang lebih rendah membuat XGBoost lebih andal untuk penerapan di berbagai pola pemesanan.Analisis kurva kerugian menunjukkan tidak ada overfitting, kerugian validasi stabil tanpa naik sepanjang 200 iterasi boosting.Presisi yang lebih tinggi (0,6588) dan F1-Score validasi silang yang lebih baik selama pencarian hiperparameter (0,8273), menjadikannya pilihan yang lebih baik ketika alarm palsu membawa biaya operasional yang signifikan.Empat fitur terbukti konsisten prediktif di kedua algoritma, has_special_request, market_segment, total_of_special_requests, dan required_car_parking_spaces, mengonfirmasi bahwa sinyal komitmen tamu lebih unggul daripada variabel temporal sebagai indikator pembatalan universal.Jenis deposit Non Refund, meskipun memiliki insentif finansial untuk pembatalan, menunjukkan tingkat pembatalan 99,36% dalam EDA, sebuah temuan yang menantang logika kebijakan deposit konvensional dan layak untuk penelitian lanjutan yang didedikasikan.Secara praktis, model XGBoost siap untuk terintegrasi ke infrastruktur PMS hotel sebagai alat dukungan keputusan proaktif, menandai pemesanan berisiko tinggi untuk intervensi yang ditargetkan.Pekerjaan masa depan harus mengeksplorasi LightGBM dan CatBoost sebagai kandidat ensembel tambahan, mengintegrasikan sinyal eksternal (harga pesaing, cuaca, acara lokal), dan menguji pada dataset dari hotel domestik Indonesia untuk menilai generalisasi geografis.Teknik AI yang dapat dijelaskan (nilai SHAP) juga akan memperkuat kepercayaan manajer dalam keputusan yang didorong oleh model.

Untuk penelitian lanjutan, disarankan untuk mengeksplorasi algoritma ensembel tambahan seperti LightGBM dan CatBoost, yang dapat memberikan kinerja yang lebih baik dalam menangani data tabel yang tidak seimbang. Selain itu, mengintegrasikan sinyal eksternal seperti harga pesaing, cuaca, dan acara lokal dapat meningkatkan akurasi prediksi pembatalan hotel. Penelitian ini juga dapat diperluas dengan menguji model pada dataset dari hotel domestik Indonesia untuk menilai generalisasi geografis. Selain itu, penerapan teknik AI yang dapat dijelaskan seperti nilai SHAP dapat membantu memahami kontribusi fitur dan meningkatkan kepercayaan manajer dalam keputusan yang didorong oleh model. Secara keseluruhan, penelitian ini memberikan kontribusi yang signifikan dalam meningkatkan akurasi prediksi pembatalan hotel dan menyediakan dasar yang andal untuk integrasi sistem dukungan keputusan real-time dalam lingkungan produksi.

  1. Perbandingan Teknik Resample pada Algoritma K-NN dan SVM untuk Prediksi Pembatalan Pemesanan Kamar Hotel... doi.org/10.25047/jtit.v10i2.333Perbandingan Teknik Resample pada Algoritma K NN dan SVM untuk Prediksi Pembatalan Pemesanan Kamar Hotel doi 10 25047 jtit v10i2 333
  2. A Leakage-Aware Ensemble Framework for Imbalanced Tabular Data: Mitigating SMOTE Contamination in Hotel... ojs.ninetyjournal.com/index.php/COMTECHNO/article/view/514A Leakage Aware Ensemble Framework for Imbalanced Tabular Data Mitigating SMOTE Contamination in Hotel ojs ninetyjournal index php COMTECHNO article view 514
  3. Hybrid model for detection of brain tumor using convolution neural networks | Computer Science and Information... doi.org/10.11591/csit.v5i1.pp84-90Hybrid model for detection of brain tumor using convolution neural networks Computer Science and Information doi 10 11591 csit v5i1 pp84 90
  4. Hotel Cancellation Rate Prediction: A Machine Learning Based Prediction Model | Atlantis Press. hotel... doi.org/10.2991/978-94-6463-823-3_31Hotel Cancellation Rate Prediction A Machine Learning Based Prediction Model Atlantis Press hotel doi 10 2991 978 94 6463 823 3 31
Read online
File size1.19 MB
Pages19
DMCAReport

Related /

ads-block-test