Sosyal medyadaki Türkçe sahte haberlerin derin öğrenme yaklaşımıyla tespiti ve sınıflandırılması


Tezin Türü: Doktora

Tezin Yürütüldüğü Kurum: Gazi Üniversitesi, Bilişim Enstitüsü, Adli Bilişim, Türkiye

Tezin Onay Tarihi: 2024

Tezin Dili: Türkçe

Öğrenci: GÜLSÜM KAYABAŞI KORU

Danışman: Çelebi Uluyol

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Sosyal ağları kullanan kişi sayısının artmasıyla daha fazla kişinin haber ihtiyacını karşılamak maksadıyla sosyal medya platformları kullanılmaktadır. Kullanıcılar gazete haber sayfaları yerine özellikle Twitter üzerinden haberlere ulaşarak gündemi takip etmenin daha kolay olduğunu düşünmektedir. Ancak sahte haberler sosyal medyada giderek daha fazla yer almakta ve insanların kısmi haber sayfalarından ya da kısa Twitter paylaşımlarından doğru haberlere ulaşabilmesi her zaman mümkün olmamaktadır. Twitter'da paylaşılan haberlerin doğru olup olmadığının anlaşılması önemli bir problemdir. Sahte tivitlerin tespit edilmesi her dilde olduğu gibi Türkçe'de de büyük önem taşımaktadır. Bu çalışmada, Twitter'daki doğrulama platformlarından elde edilen sahte haberler ve ana akım gazetelerin Twitter hesaplarından elde edilen gerçek haberler etiketlenerek, Türkçe için geliştirilen Zemberek doğal dil işleme aracı kullanılarak ön işleme tabi tutulmuş ve TR_FaRe_News isimli bir veri kümesi oluşturulmuştur. Ardından, TR_FaRe_News veri kümesi, sahte haber tespiti için topluluk yöntemleri ve BoW, TF-IDF ve Word2Vec vektörleştirme yöntemleri kullanılarak araştırılmıştır. Ayrıca, fastText ile kelime yerleştirme işlemi yapılarak fastText dil modelimiz içerisinde bulunan sk-learn kütüphaneleri kullanılarak haberlerin sınıflandırma başarısı farklı parametreler ile analiz edilmiştir. Ardından, önceden eğitilmiş bir BERT derin öğrenme modeline ince ayar yapılmış ve Bi-LSTM ve Evrişimsel Sinir Ağı katmanları ile genişletilen modelin dondurulmuş ve dondurulmamış parametreler yöntemleriyle varyasyonları araştırılmıştır. Performans değerlendirmesi BuzzFeedNews, GossipCop, ISOT, LIAR, Twitter15, Twitter16 ve LLM tarafından üretilen bir sahte haber veri kümesi olmak üzere yedi karşılaştırılabilir veri kümesi kullanılarak gerçekleştirilmiştir. Türkçe tweetlerin analiz edilmesi ve LLM tarafından üretilen sahte haber veri kümlerinin kullanılması önemli bir katkı olarak değerlendirilmektedir. BERT modelleriyle %90 ile %94 arasında, BERTurk+CNN modeliyle %94 oranında doğruluk elde edilmiştir.