İnternet'te heterojen veri kaynaklarından veri toplanması, entegrasyonu ve güncellenmesi


Tezin Türü: Doktora

Tezin Yürütüldüğü Kurum: Gazi Üniversitesi, Bilişim Enstitüsü, Bilgisayar Eğitimi, Türkiye

Tezin Onay Tarihi: 2024

Tezin Dili: Türkçe

Öğrenci: ZÜLFÜ ALANOĞLU

Danışman: Muhammet Ali Akcayol

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Günümüzde Web hızla büyüyen ve çok çeşitli verinin bulunduğu en büyük veri kaynağıdır. Kullanıcılar bu veri kaynağından istedikleri veriyi almak için genellikle arama motorlarını kullanmaktadırlar. Arama motorları bu verileri Web tarayıcıları aracılığı ile elde ederler. Web tarayıcıları Web sayfalarındaki verileri toplar, ayrıştırır ve indeksleyip saklarlar. Web tarama sürecindeki en önemli konular; hangi URL'lerden başlanacağı, taramanın kapsamı ve veri deposunun güncel tutulması için kullanılan güncelleme algoritmasıdır. Bu tez çalışmasında ilk olarak kapsamı tüm Web olan genel bir tarayıcının tohum URL seçim ve kapsam genişletme yöntemleri sunulmuştur. Tohum URL seçiminde bazı ölçütlere dayanarak üç farklı tohum URL veri kümesi oluşturulmuş ve performansları detaylı bir şekilde analiz edilmiştir. Ayrıca kapsamı hızlı bir şekilde genişletmek için link skoruna dayalı yeni bir tarama algoritması önerilmiştir. Tohum URL kümelerinden başlanarak taramalar yapılmış, sonuçlar karşılaştırılmış ve detaylı analizleri yapılmıştır. İkinci olarak arama motorlarının performanslarını etkileyen en önemli özellik olan tekrar ziyaret sürelerinin belirlenmesi amacıyla EMA yöntemi önerilmiştir. EMA yöntemi kullanılarak geliştirilen EMACrawler'ın kesinlik, toplam kapsama alanı ve verimlilik ölçütleri kullanılarak test ve analiz işlemleri gerçekleştirilmiştir. Yapılan deneysel çalışmaların sonucunda, EMACrawler'ın güncel verilerin elde edilmesi ve veri ambarlarının tazeliğinin korunmasında başarılı olduğu görülmüştür.