Journals / Savunma Bilimleri Dergisi / 2013 / Cilt: 12 - Sayı: 1
A Nonparametric multidimensional modeling approach for speech signals
- Journal
- Savunma Bilimleri Dergisi
- Pages
- 1–19
- DOI
- —
Abstract
In this study, a nonparametric technique is developed to model speech signals. The technique is based on a non-integer dimension calculation method. Speech signals were divided into segments/windows having appropriate lengths. Then, a non-integer dimension value was calculated for each segment. The multidimensional model for the entire signal was obtained using appropriately shifted successive windows. To evaluate the performance of the proposed technique, recorded speech signals and their altered versions (e.g. noise addition, filtering and compression) were used within the framework of a classification problem based on the nearest-neighbor algorithm. The modeling technique was optimized using a learning set formed by a subset of all signals; the remaining signals were used as a test set to measure the performance of the classification. Experimental results show that the developed modeling technique can be used in various speech processing applications such as speech recognition, speaker recognition, speaker diarization, content identification, multimedia indexing and language recognition.
Özet
Bu çalışmada, ses işaretleri için parametrik olmayan bir modelleme tekniği geliştirilmiştir. Geliştirilen teknik, bir kesirli/ondalıklı boyut hesaplama yöntemine dayanmaktadır. Ses işaretleri uygun uzunluktaki parçalara/pencerelere bölünerek, her parça için bir kesirli boyut değeri hesaplanmış; müteakiben uygun sıçramalar yapmak suretiyle işaretin tamamına ait çok boyutlu bir model elde edilmiştir. Önerilen yöntemin başarımını ölçmek maksadıyla tasarlanan ve en yakın komşu algoritmasını esas alan sınıflandırma probleminde, kaydedilen ses işaretlerinin orijinalleri ve bu işaretlerin gürültü ekleme, süzme ve sıkıştırma gibi çeşitli işlemlere/saldırılara uğramış halleri kullanılmıştır. Modelleme tekniği, bu işaretlerin bir bölümünden oluşan bir eğitim kümesi yardımıyla optimize edilmiş; geriye kalan işaretlerden oluşan test kümesi yardımıyla sınıflandırmanın başarımı ölçülmüştür. Deneysel sonuçlar, geliştirilen tekniğin, konuşma tanıma, konuşmacı tanıma, konuşmacı ayrıştırma, içerik belirleme, çoklu ortam indeksleme ve dil tanıma gibi çeşitli ses işleme/tanıma uygulamalarında kullanılabileceğini göstermektedir.