NINETYJOURNALNINETYJOURNAL

Jurnal Kecerdasan Buatan dan Teknologi InformasiJurnal Kecerdasan Buatan dan Teknologi Informasi

Klasifikasi citra medis merupakan komponen penting dalam sistem diagnosis berbasis komputer, namun kinerjanya sering terhambat oleh kekurangan data teranotasi. Situasi ini umum terjadi di bidang medis karena keterbatasan etis, biaya, dan konstruksi label. Jaringan Saraf Konvolusi (CNN) efektif dalam mengekstrak fitur lokal tetapi suboptimal dalam menangkap konteks global. Sebaliknya, Vision Transformers (ViTs) unggul dalam memodelkan ketergantungan jangka panjang tetapi membutuhkan jumlah besar data pelatihan. Untuk mengatasi keterbatasan ini, studi ini mengusulkan model hibrida CNN-Vision Transformer yang mengintegrasikan kekuatan keduanya untuk meningkatkan kinerja klasifikasi dalam kondisi anotasi terbatas. Model ini diuji menggunakan dataset OrganAMNIST yang terdiri dari 53.339 gambar CT abdomen dua dimensi dengan 11 kelas organ. Hasil eksperimen menunjukkan bahwa model mencapai akurasi 92,3%, F1-score 91,8%, dan AUC 99,5%, dengan hanya 3,67 juta parameter. Dibandingkan dengan ResNet50, model ini mengurangi jumlah parameter sebesar 84% dan meningkatkan kecepatan inferensi hingga 2,4 kali. Selain itu, model menunjukkan stabilitas pelatihan yang lebih baik dibandingkan model dasar seperti ResNet50 dan ViT-Small. Hasil studi menunjukkan bahwa integrasi fitur lokal dan global dalam arsitektur hibrida dapat meningkatkan akurasi dan efisiensi secara bersamaan. Pendekatan ini berpotensi diterapkan pada sistem diagnosis medis dengan data dan sumber daya komputasi terbatas.

Studi ini mengusulkan model hibrida CNN-Vision Transformer yang efisien untuk klasifikasi citra medis dalam kondisi anotasi terbatas.Model ini dirancang dengan menggabungkan kemampuan CNN dalam ekstraksi fitur lokal dan ViT dalam pemodelan konteks global, sekaligus mempertahankan efisiensi komputasi dan kemampuan generalisasi pada data terbatas.Berdasarkan hasil eksperimen pada dataset OrganAMNIST, model hibrida menunjukkan kinerja kompetitif dengan akurasi 92,3%, F1-score 91,8%, dan AUC 99,5%.Meskipun nilai ini sedikit lebih rendah dibandingkan model dasar seperti ResNet50 dan ViT-Small, model hibrida menawarkan keunggulan signifikan dalam efisiensi komputasi dengan jumlah parameter sekitar 3,67 juta dan kecepatan inferensi 41,121 ms per batch.Integrasi fitur lokal dan global dalam arsitektur ringan memungkinkan model mempertahankan kemampuan klasifikasi yang baik meskipun kompleksitasnya lebih rendah.Hal ini menjadikan model hibrida lebih sesuai untuk implementasi dalam lingkungan dengan sumber daya terbatas, seperti sistem diagnostik berbasis AI di bidang medis.

Penelitian lanjutan dapat fokus pada pengembangan model yang mampu meminimalkan kebutuhan data teranotasi melalui pendekatan pembelajaran mandiri (self-supervised learning) yang lebih inovatif. Selain itu, penting untuk merancang arsitektur yang lebih ringan dan efisien agar dapat diimplementasikan pada perangkat berbasis mobile atau edge computing dengan sumber daya terbatas. Penelitian juga dapat mengeksplorasi metode kombinasi fitur lokal dan global secara lebih optimal tanpa meningkatkan kompleksitas model, misalnya dengan menggunakan teknik pemrosesan adaptif berbasis konteks. Dengan pendekatan ini, diharapkan dapat dicapai keseimbangan yang lebih baik antara akurasi, efisiensi komputasi, dan kebutuhan data dalam aplikasi klasifikasi citra medis.

  1. [1905.11946] EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks. efficientnet rethinking... arxiv.org/abs/1905.119461905 11946 EfficientNet Rethinking Model Scaling for Convolutional Neural Networks efficientnet rethinking arxiv abs 1905 11946
  2. [2102.04306] TransUNet: Transformers Make Strong Encoders for Medical Image Segmentation. transunet transformers... arxiv.org/abs/2102.043062102 04306 TransUNet Transformers Make Strong Encoders for Medical Image Segmentation transunet transformers arxiv abs 2102 04306
Read online
File size568.34 KB
Pages8
DMCAReport

Related /

ads-block-test