TÜRKÇE METİNLERDE DUYGU ANALİZİ YAPILARAK SALDIRGAN İÇERİKLERİN TESPİT EDİLMESİ


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Gazi Üniversitesi, Bilişim Enstitüsü, Yönetim Bilişim Sistemleri, Türkiye

Tezin Onay Tarihi: 2022

Tezin Dili: Türkçe

Öğrenci: ŞEYMA ŞAHİNER YILMAZ

Danışman: Hadi Gökçen

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Sosyal medya mecralarının hızlı büyümesiyle birlikte daha fazla kullanıcı, görüşlerini ve fikirlerini çevrimiçi olarak paylaşmaktadır. Bu büyümenin ardından insanların varlıklara yönelik fikirlerini, duygularını, değerlendirmelerini, tutumlarını ve bunların yazılı metinde ifade edilen niteliklerini analiz eden duygu analizi çalışmaları popüler bir çalışma alanı haline gelmiştir. Bununla birlikte popüler sosyal medya platformlarından biri olan Twitter, sunduğu konu çeşitliliği sebebiyle duygu analizi çalışmalarında yaygın olarak kullanılmaktadır. Çeşitli içerik formlarını kullanarak fikirlerin kolayca paylaşılmasını sağlayan bu sosyal medya platformunda kullanıcıların paylaşımları arasında saldırgan dil barındıran içeriklerin önemli oranda arttığı gözlemlenmiştir. Bu durum saldırgan dile maruz kalan kullanıcıların psikolojik iyi oluşlarını olumsuz yönde etkiler. Bununla birlikte sadece insanlar değil kurumsal firmalar da bu saldırgan dile maruz kalmaktadırlar. Bu şiddetin tekrarlanması, bu durumun normalleşme ve daha da artması sonucunu doğurmaktadır. Çalışma Türkçe dilinde bu sorunun otomatik çözümüne katkı sağlamayı amaçlamaktadır. Bu çalışmada Twitter platformundan elde edilen veri seti oluşturulmuştur. 14752 Türkçe tweet metninden oluşan bu veri seti etiketleyiciler tarafından manuel olarak etiketlenmiştir. Etiketlenen verileri sınıflandırma da en popüler derin öğrenme yöntemleri kullanılmıştır. Bu derin öğrenme yöntemleri CNN, LSTM, BiLSTM, GRU, BiGRU ve CNN-LSTM' dir. Bu modellerin sınıflandırma performansları karşılaştırılmıştır. Bununla birlikte makine öğrenmesi yöntemi olan SVM modelinin sınıflandırma performansı da karşılaştırılmıştır. Çalışmada ikili ve çoklu sınıflandırma yapılmıştır. Çalışma saldırgan dil tanımlama ile ilgili Türkçe için çoklu sınıflandırma yapılan ilk çalışmadır. Bunlara ek olarak Twitter platformundan elde edilen 1 milyon 860 bin tweet metninden oluşan genişletilmiş derlem elde edilmiştir. Burada Word2vec yöntemi ile kelime temsilleri elde edilmiştir. Böylelikle genişletilmiş derlem kullanımının sınıflandırma performanslarına katkısı karşılaştırılmıştır. Çalışmada yapılan ikili sınıflandırma da genişletilmiş derlem kullanımıyla en yüksek performans GRU modeli F1-skor değeri %96,65'tir. Bu sebeple çoklu sınıflandırma yapılırken GRU modeli kullanılmıştır. Çoklu sınıflandırmada elde edilen sınıflandırma performans değerleri genişletilmiş derlemin katkısıyla GRU F1-makro değeri %71,97 ve %54,10'dur.