Sentiment analysis in Iraqi Arabic dialects based on ‎distributed ‎representations of sentences and machine learning approach


Tezin Türü: Doktora

Tezin Yürütüldüğü Kurum: Gazi Üniversitesi, Fen Bilimleri Enstitüsü, -, Türkiye

Tezin Onay Tarihi: 2019

Tezin Dili: İngilizce

Öğrenci: ANWAR ADNAN MZHER ALNAWAS

Asıl Danışman (Eş Danışmanlı Tezler İçin): Nursal Arıcı

Eş Danışman: Mehmet Hakkı Suçin

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Duygu Analizi, hesaplamalı dilbilimi ve veri madenciliği içinde yer alan bilgisayar ‎bilimlerinin bir alt disiplindir. Duygu analizinin amacı, kişilerin veya toplulukların bir ‎konu hakkındaki duygu ve düşüncelerinin metinsel dökümanlardan çıkarılmasıdır. Son ‎yıllarda araştırmacılar için ilginç bir araştırma konusu haline gelen duygu analizi alanında ‎bilimsel literatürde İngilizce için birçok çalışma bulunmaktadır. Bununla birlikte, Arapça ‎için henüz çok fazla çalışma yayınlanmamıştır. Arapça; konuşmacıların sayısı, tarihi ve ‎dini miras açısından önemli bir dildir. Arapçada resmi dil, klasik ve modern standart ‎Arapçadan oluşur. Klasik Arapça, Kuran dilini temsil eder. Modern Standart Arapça, ‎haber bültenlerinde ve eğitimde kullanır. İnternette Arapça kullanımı giderek artmakla ‎birlikte, sosyal ağ ortamlarında bu iki tür kullanılmaz. Günlük pratik hayatta kullanılan ‎yerel lehçeler daha çok tercih edilir. Bu nedenle, lehçelere dayalı Arapça içerikli ‎metinlerden Duygu Analizi çalışmaları gittikçe önem kazanan araştırma konularından ‎biridir. Bu doktora tezinde, Arap Irak lehçesinde Duygu Analizi çalışması ‎gerçekleştirilmektedir. Çalışmanın ilk aşamasında üç tür veri kümesini toplanmıştır. ‎Bunlar: önceki çalışmalardan sınıflandırılmış veri setleri, sınıflandırılmamış Irak Arapça ‎lehçesi ve sınıflandırılmış Irak Arapça lehçesidir. İkinci aşama ön işleme aşamasıdır. Bu ‎aşamada, karmaşıklığı en aza indirmek ve metin biçimini standartlaştırmak için veri ‎kümelerinden gereksiz terimler ortadan kaldırılmıştır. Üçüncü aşamada, özelliklerin ‎çıkarılması ve bir kelimeyi Doc2Vec modelini kullanarak vektör olarak temsil edilmesi ‎sağlanmıştır. Dördüncü aşamada, bir duygu tahmin modeli oluşturmak için oluşturulan ‎vektörler dört makine öğrenme algoritmasıyla eğitilmiştir. Beşinci aşamada, duygu ‎tahmin modeli değerlendirilmiştir. Ayrıca deneysel çalışmada, değişken parametrelerin ‎külliyat (derlem) sınıflandırma performansına etkisi de incelenmiştir. ‎