Dergiler / Mühendislik bilimleri ve araştırmaları dergisi (Online) / 2022 / Cilt: 4 - Sayı: 2
Twitter Platformundan Elde Edilen Türkçe Saldırgan Dil Derlemi
- Sayfa
- 304–316
- DOI
- —
Özet
Sosyal medya platformlarında kullanıcıların paylaşımlar arasında saldırgan dil barındıran içeriklerin önemli oranda arttığı gözlemlenmiştir. Çalışma Türkçe dilinde bu sorunun çözümüne katkı sağlamayı amaçlamaktadır. Bu çalışmada Twitter platformundan elde edilen bir veri seti oluşturulmuştur. 14752 Türkçe tweet metninden oluşan bu veri seti etiketleyiciler tarafından manuel olarak etiketlenmiştir. Buna ek olarak oluşturulan veri seti kullanılarak LSTM (Long ShortTerm Memory) ve GRU (Gated Recurrent Units) modellerinin sınıflandırma performansları karşılaştırılmıştır. Çalışmada ikili ve çoklu sınıflandırma yapılmıştır. Saldırgan dil ile ilgili Türkçe için çoklu sınıflandırma yapılan ilk çalışmadır. Bunlara ek olarak Twitter platformundan 1 milyon 860 bin tweet metninden oluşan genişletilmiş derlem elde edilmiştir. Burada word2vec yöntemi ile kelime temsilleri elde edilmiştir. Böylelikle genişletilmiş derlem kullanımının sınıflandırma performanslarına katkısı karşılaştırılmıştır. Çalışmada yapılan ikili sınıflandırma da genişletilmiş derlem kullanımıyla en yüksek performans GRU modeli F1-skor değeri %94,49’dur. Bu sebeple çoklu sınıflandırma yapılırken GRU modeli kullanılmıştır. Çoklu sınıflandırmada elde edilen sınıflandırma performans değerleri genişletilmiş derlemin katkısıyla GRU F1-makro değeri %71,97 ve %54,10’dur. Bu alanda Türk dili literatürüne katkı sağlamak amacıyla mevcut çalışmanın veri setleri ve genişletilmiş derlem kelime vektörleri paylaşılacaktır.
Abstract
It has been observed that content with offensive language among users' posts on social media platforms has increased significantly. The study aims to contribute to the solution of this problem in Turkish language. In this study, a data set obtained from the Twitter platform was created. This data set, consisting of 14752 Turkish tweet texts, was annotate manually by the annotator and the classification performances of LSTM (Long ShortTerm Memory) and GRU (Gated Recurrent Units) models were compared. It is the first study in which multi-classification was made for Turkish on offensive language. Here, word representations were obtained with the word2vec method. Thus, the contribution of the use of extended corpus to the classification performances was compared. The highest performance GRU model F1-score value is 94.49% with the use of extended corpus in the binary classification made in the study. The classification performance values obtained in multiclassification are 71.97% and 54.10% of the GRU F1-macro value with the contribution of the expanded corpus. The datasets and expanded corpus word vectors of the current study will be shared in order to contribute to the Turkish language literature in this field.