ITATSITATS
KERNEL: Jurnal Riset Inovasi Bidang Informatika dan Pendidikan InformatikaKERNEL: Jurnal Riset Inovasi Bidang Informatika dan Pendidikan InformatikaIMDb dengan lebih dari 83 juta pengguna aktif menghasilkan jutaan ulasan film setiap tahun. Menganalisis data sebanyak ini secara manual tentu tidak praktis, sehingga diperlukan pendekatan otomatis untuk klasifikasi sentimen biner. Penelitian ini menguji tiga algoritma machine learning tradisional yaitu Logistic Regression, Naive Bayes, dan Random Forest pada 50.000 ulasan film berbahasa Inggris dengan distribusi seimbang antara sentimen positif dan negatif. Ekstraksi fitur dilakukan menggunakan CountVectorizer dan TF-IDF, setelah melalui tahap preprocessing berupa pembersihan tag HTML, ekspansi kontraksi, dan normalisasi teks. Dari seluruh kombinasi yang diuji, Logistic Regression dengan TF-IDF mencapai hasil terbaik dengan akurasi 87,29%, F1-score 87,32%, dan AUC-ROC 0,9481. Konsistensi performa dikonfirmasi melalui 5-fold cross-validation dengan coefficient of variation rendah di seluruh fold. Analisis feature importance mengungkap kata excellent, perfect, dan amazing sebagai penanda sentimen positif, sedangkan worst, awful, dan terrible menandai sentimen negatif. Naive Bayes unggul dalam kecepatan dengan waktu pelatihan 11,5 detik namun akurasi lebih rendah, sementara Logistic Regression menawarkan keseimbangan terbaik antara akurasi dan efisiensi dalam 17,2 detik. Selain akurasi, Logistic Regression juga menyediakan koefisien yang dapat diinterpretasi untuk menjelaskan kata mana yang mempengaruhi prediksi. Temuan ini menunjukkan bahwa algoritma tradisional pada konfigurasi yang dievaluasi tetap layak digunakan untuk tugas analisis sentimen yang mengutamakan efisiensi komputasi dan interpretabilitas.
Penelitian ini melakukan analisis komparatif terhadap algoritma machine learning tradisional untuk klasifikasi sentimen pada 50.Logistic Regression dengan TF-IDF mencapai performa terbaik dengan akurasi 87,29% dan F1-score 87,32%.Analisis feature importance mengungkap pola linguistik yang konsisten, di mana kata seperti excellent dan perfect menandai sentimen positif, sedangkan worst dan awful mengindikasikan sentimen negatif, memvalidasi intuisi manusia sekaligus meningkatkan transparansi model.Evaluasi efisiensi komputasi menunjukkan trade-off antara akurasi dan kecepatan.Naive Bayes menawarkan waktu pelatihan tercepat (11,5 detik) dengan akurasi 83,32%, sementara Logistic Regression memberikan keseimbangan optimal antara akurasi tinggi dan waktu moderat (17,2 detik).Analisis kesalahan mengidentifikasi tantangan dalam menangani sarkasme dan sentimen campuran dengan tingkat kesalahan 12,71%, di mana ulasan yang salah diklasifikasi cenderung lebih panjang, menunjukkan keterbatasan pendekatan bag-of-words.Analisis calibration curve menunjukkan bahwa Logistic Regression memiliki pola probabilitas prediksi yang relatif lebih dekat dengan kondisi aktual dibandingkan Naive Bayes pada beberapa rentang probabilitas.Meskipun demikian, hasil penelitian dibatasi oleh penggunaan klasifikasi biner, satu dataset berbahasa Inggris, dan representasi bag-of-words yang belum menangkap hubungan kontekstual antarkata secara menyeluruh.Penelitian ini juga tidak menyertakan baseline transformer secara langsung, tidak melakukan ablation study terhadap penghapusan stopwords, dan menggunakan konfigurasi Random Forest yang dibatasi untuk efisiensi komputasi.Oleh karena itu, kesimpulan penelitian hanya berlaku pada model dan konfigurasi yang dievaluasi.Penelitian selanjutnya dapat membandingkan model tradisional dengan transformer dalam lingkungan eksperimen yang sama, mengevaluasi pengaruh stopword removal, melakukan optimasi hyperparameter yang lebih luas, dan mengembangkan teknik untuk menangani sarkasme serta sentimen campuran.
Penelitian lanjutan dapat fokus pada pengembangan model yang mampu mengenali sarkasme dan sentimen campuran dalam ulasan film, misalnya dengan mengintegrasikan teknik contextual embeddings atau model transformer yang lebih canggih. Selain itu, perlu dilakukan studi komparatif antara algoritma tradisional dan model berbasis deep learning dalam konteks klasifikasi sentimen, dengan mempertimbangkan faktor interpretabilitas dan efisiensi komputasi. Terakhir, peneliti dapat mengeksplorasi dampak penghapusan stopwords pada akurasi model, serta mengoptimalkan parameter hyperparameter untuk meningkatkan performa klasifikasi dalam skenario nyata yang lebih kompleks.
- Comparison of Naïve Bayes and Logistic Regression in Sentiment Analysis on Marketplace Reviews Using... doi.org/10.51519/journalisi.v5i3.539Comparison of Nayve Bayes and Logistic Regression in Sentiment Analysis on Marketplace Reviews Using doi 10 51519 journalisi v5i3 539
- Evaluasi Performa Algoritma Machine Learning untuk Klasifikasi Sentimen Ulasan Film IMDb | Waladi | KERNEL:... doi.org/10.31284/j.kernel.2026.v7i1.8567Evaluasi Performa Algoritma Machine Learning untuk Klasifikasi Sentimen Ulasan Film IMDb Waladi KERNEL doi 10 31284 j kernel 2026 v7i1 8567
| File size | 783.95 KB |
| Pages | 14 |
| DMCA | Report |
Related /
ITATSITATS Peningkatan tersebut ditunjukkan oleh perbedaan nilai pretest dan posttest yang signifikan berdasarkan hasil uji Paired Sample t-Test. Selain itu, nilaiPeningkatan tersebut ditunjukkan oleh perbedaan nilai pretest dan posttest yang signifikan berdasarkan hasil uji Paired Sample t-Test. Selain itu, nilai
ITATSITATS Namun demikian, keputusan produksi tetap perlu mempertimbangkan kondisi pasar, tingkat permintaan pelanggan, serta faktor operasional lainnya yang tidakNamun demikian, keputusan produksi tetap perlu mempertimbangkan kondisi pasar, tingkat permintaan pelanggan, serta faktor operasional lainnya yang tidak
ITATSITATS Sistem klasifikasi kemudian dibangun dalam bentuk aplikasi berbasis website menggunakan metode Naïve Bayes untuk menentukan kelayakan penerima bantuan.Sistem klasifikasi kemudian dibangun dalam bentuk aplikasi berbasis website menggunakan metode Naïve Bayes untuk menentukan kelayakan penerima bantuan.
ITATSITATS Penerapan Business Continuity Management (BCM) berdasarkan ISO 22301 sangat penting untuk menjaga keberlangsungan layanan informasi publik di KabupatenPenerapan Business Continuity Management (BCM) berdasarkan ISO 22301 sangat penting untuk menjaga keberlangsungan layanan informasi publik di Kabupaten
UMLAUMLA Peningkatan massa TMD melebihi titik optimal menyebabkan penurunan efisiensi penyerapan getaran. TMD regeneratif mampu menghasilkan energi listrik yangPeningkatan massa TMD melebihi titik optimal menyebabkan penurunan efisiensi penyerapan getaran. TMD regeneratif mampu menghasilkan energi listrik yang
4141 Berdasarkan pola sedimentasi dan pertimbangan perubahan elevasi dasar, bangunan pengaman yang paling sesuai adalah jetty tipe panjang. Sebelum pemasanganBerdasarkan pola sedimentasi dan pertimbangan perubahan elevasi dasar, bangunan pengaman yang paling sesuai adalah jetty tipe panjang. Sebelum pemasangan
UMIUMI Setelah penerapan optimasi grid search cross-validation dengan kernel radial basis function (RBF), akurasi meningkat menjadi 85,71%. Hasil ini menunjukkanSetelah penerapan optimasi grid search cross-validation dengan kernel radial basis function (RBF), akurasi meningkat menjadi 85,71%. Hasil ini menunjukkan
UNTARUNTAR Penelitian ini menyimpulkan bahwa kinerja keuangan jangka panjang dan efisiensi aset lebih krusial dalam memprediksi financial distress dibandingkan likuiditasPenelitian ini menyimpulkan bahwa kinerja keuangan jangka panjang dan efisiensi aset lebih krusial dalam memprediksi financial distress dibandingkan likuiditas
Useful /
ITATSITATS Hasil Blackbox Testing terhadap 21 skenario uji untuk delapan modul utama menghasilkan tingkat keberhasilan 100%. Sistem yang dikembangkan berhasil mendigitalisasiHasil Blackbox Testing terhadap 21 skenario uji untuk delapan modul utama menghasilkan tingkat keberhasilan 100%. Sistem yang dikembangkan berhasil mendigitalisasi
ITATSITATS (4) Seluruh 9 skenario uji pada Black-Box Testing dinyatakan Valid, mencakup pengujian Soft Deletes, Pessimistic Locking, dan validasi kalkulasi stok masuk.(4) Seluruh 9 skenario uji pada Black-Box Testing dinyatakan Valid, mencakup pengujian Soft Deletes, Pessimistic Locking, dan validasi kalkulasi stok masuk.
UMIUMI Penelitian ini berhasil mengimplementasikan metode Deep Learning untuk mendeteksi dini potensi bencana cuaca ekstrem berbasis analisis citra awan satelit.Penelitian ini berhasil mengimplementasikan metode Deep Learning untuk mendeteksi dini potensi bencana cuaca ekstrem berbasis analisis citra awan satelit.
UMIUMI Sistem ini mengklasifikasikan daging ayam ke dalam tiga kategori: segar, kurang segar, dan busuk. Model CNN menggunakan 32 filter untuk meningkatkan ekstraksiSistem ini mengklasifikasikan daging ayam ke dalam tiga kategori: segar, kurang segar, dan busuk. Model CNN menggunakan 32 filter untuk meningkatkan ekstraksi