Derin öğrenmeye dayalı videolarda şiddet tespiti


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Gazi Üniversitesi, Fen Bilimleri Enstitüsü, -, Türkiye

Tezin Onay Tarihi: 2025

Tezin Dili: Türkçe

Öğrenci: AHMET SİVRİDAŞLI

Danışman: Ayşe Demirhan

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Bu çalışmada, video tabanlı insan davranışlarının analizi için zaman serisi temelli bir derin öğrenme mimarisi geliştirilerek şiddet içeren eylemlerin otomatik tespiti amaçlanmıştır. İnsan vücuduna ait poz verileri kullanılarak hareket örüntüleri sayısal olarak modellenmiş ve bu veriler ardışık karelerden oluşan sabit uzunluklu zaman serileri halinde yapay sinir ağına girdi olarak sunulmuştur. Önerilen sistem, insan poz verilerini YOLOv8-Pose algoritması ile tespit ederek her bir birey için 17 eklem noktasının koordinatlarını çıkarmakta; ardından bu koordinatlar tez kapsamında geliştirilen ve VioNet-CBA (Violence Network with Convolution, BiLSTM, and Attention) adı verilen Conv1D–BiLSTM ve dikkat mekanizmasına sahip bir derin öğrenme modeliyle işlenerek şiddet ya da normal davranış olarak sınıflandırılmaktadır. Veri setlerinin ön işleme sürecinde normalizasyon ve veri artırma teknikleri uygulanarak modelin genelleme yeteneği güçlendirilmiştir. Eğitim sürecinde sınıf dengesizliği problemi, sınıf ağırlıklandırması yöntemiyle giderilmiş ve modelin azınlık sınıfa (şiddet) karşı duyarlılığı artırılmıştır. Ayrıca, aşırı öğrenmeyi engellemek adına eğitim sırasında erken durdurma stratejisi kullanılmıştır. Eğitim, doğrulama ve test aşamalarında doğruluk, F1 skoru, ROC AUC, hassaslık ve duyarlılık gibi performans metrikleriyle modelin başarımı sistematik olarak değerlendirilmiştir. Modelin etkinliği, gerçek dünyadan derlenmiş Gerçek Hayat Şiddet Durumları Veri Seti (RLVS), Akıllı Şehir CCTV Şiddet Tespiti Veri Seti (SCVD) ve Gerçek Dünya Kavga Veri Seti (RWF-2000) olmak üç farklı video veri seti üzerinde test edilmiştir. Farklı sahne koşullarını içeren bu veri setleri sayesinde, modelin gerek bireysel gerekse grup halinde gerçekleşen şiddet davranışlarını başarıyla tanıyabildiği gözlemlenmiştir. Elde edilen test sonuçlarında, modelin doğruluk oranı yaklaşık %97 olarak ölçülmüş; F1 skoru ve ROC AUC değeri ise 0,97'nin üzerinde gerçekleşmiştir. Bu sonuçlara göre önerilen VioNet-CBA mimarisi, sade fakat etkili yapısıyla literatürdeki birçok yaklaşımdan daha yüksek doğruluk ve genelleme performansı sergilemektedir. Özellikle dikkat mekanizmasının kritik hareket anlarını ön plana çıkarması, şiddet içeren eylemlerin daha doğru sınıflandırılmasına katkı sağlamıştır. Sonuç olarak, insan poz verilerinin zaman serisi formatında işlenmesiyle ham video yerine daha hafif bir mimari kullanılarak şiddet algılama için etkin ve ölçeklenebilir bir sistem geliştirilmiştir. Önerilen VioNet-CBA modeli, yüksek doğruluk oranları ve gerçek zamanlı çalışmaya uygun yapısıyla gözetim sistemleri gibi güvenlik uygulamaları başta olmak üzere çeşitli video analiz senaryolarında başarılı bir şekilde uygulanabilir.