Dergiler / El-Cezerî Journal of Science and Engineering / 2021 / Cilt: 8 - Sayı: 3

Zararlı Yazılım Tespiti Amacıyla Kullanılan Makine Öğrenmesi Algoritmalarının Büyük Veri Platformlarındaki Performanslarının İncelenmesi

Analyzing Performance of Machine Learning Algorithms for Malware Detection in Big Data Platforms

Sayfa
1536–1549
DOI
—

Özet

Bilgi teknolojileri varlıklarının hem bireylerin günlük hayatlarındaki hem de kurum ve kuruluşların işleyişindeki yeri son çeyrek asırda hızlı bir artış göstermiş, bu artışa paralel olarak bilgi varlıklarına yönelik tehditler de artmıştır. Zararlı yazılımlar, bilgi varlıklarına yönelik başlıca tehditlerden biridir. Sürekli olarak kendini yenileyen zararlı yazılımlara karşı geleneksel tespit yaklaşımlarının yetersiz kalması sebebiyle, makine öğrenmesi modelleri kullanan tespit yaklaşımları geliştirilmiştir. Bu çalışmada, zararlı yazılım tespiti maksadıyla kullanılan farklı makine öğrenme algoritmalarının çeşitli büyük veri teknolojileri ve platformları üzerinde ortaya koydukları performanslar incelendi. Modeller, Kaggle Zararlı Yazılım Tespiti veri seti kullanılarak eğitildi. En iyi doğruluk (%98.8), kesinlik (%98.5), f1 skoru (%98.2) ve yanlış pozitif oranı (%2) performansları Google Colaboratory ortamında Sci-Kit Learn kütüphanesi ile çalıştırılan rastgele orman modeli ile elde edildi.

Abstract

The place of information technology assets in both the daily lives of individuals and the functioning of institutions and organizations has increased rapidly in the last quarter century and in parallel, threats to information assets have also increased. One of the main threats to these assets is malware. Detection approaches using machine learning models have been developed due to the inadequacy of traditional detection approaches against constantly regenerating malware. In this study, the performances of different machine learning algorithms used for malware detection on various big data technologies and platforms were examined. Models were trained using the Kaggle Malware Detection dataset. The best accuracy (98.8%), precision (98.5%), f1 score (98.2%) and false positive rate (2%) performances were obtained with the random forest model run with the Sci-Kit Learn library in the Google Colaboratory environment.