Comparative Analysis of Deep Learning Models for Speech Enhancement in Noisy Environments Gürültülü Ortamlarda Konusma Iyilestirme için Derin Ögrenme Modellerinin Karsilastirmali Analizi
34th Signal Processing and Communications Applications Conference, SIU 2026, İstanbul, Türkiye, 7 - 10 Temmuz 2026, (Tam Metin Bildiri)
- Yayın Türü: Bildiri / Tam Metin Bildiri
- Doi Numarası: 10.1109/siu71813.2026.11636421
- Basıldığı Şehir: İstanbul
- Basıldığı Ülke: Türkiye
- Anahtar Kelimeler: CMGAN, DCCRN, deep learning, noise suppression, Speech enhancement
- Gazi Üniversitesi Adresli: Evet
Özet
Speech enhancement (SE) is a fundamental signal processing task aimed at recovering clean speech components from signals corrupted by environmental noise. While various architectures operating in time and time-frequency domains have been proposed in recent deep learning literature, the generalization capability of these models under acoustic conditions differing from the training data remains a critical area of investigation. In this study, the performances of four pioneering architectures-DCCRN, CMGAN, Attention U-Net, and Demucsare comparatively analyzed in a cross-corpus scenario using an extensive training set and the standard VoiceBank-DEMAND test suite. The evaluation is conducted through objective metrics, including Short-Time Objective Intelligibility (STOI) for speech intelligibility, Scale-Invariant Signal-to-Distortion Ratio (SI-SDR) for noise suppression capacity, and Log-Spectral Distance (LSD) for spectral fidelity and provides technical framework for model selection.