Journals / Süleyman Demirel Üniversitesi Fen Bilimleri Enstitüsü Dergisi / 2018 / Cilt: 22 - Sayı: Özel
Turkish Speech Recognition Based On Deep Neural Networks
- Pages
- 319–329
- DOI
- —
Abstract
In this paper we develop a Turkish speech recognition (SR) system usingdeep neural networks and compare it with the previous state-of-the-art traditionalGaussian mixture model-hidden Markov model (GMM-HMM) method using the sameTurkish speech dataset and the same large vocabulary Turkish corpus. Nowadays mostSR systems deployed worldwide and particularly in Turkey use Hidden Markov Modelsto deal with the speech temporal variations. Gaussian mixture models are used toestimate the amount at which each state of each HMM fits a short frame of coefficientswhich is the representation of an acoustic input. A deep neural network consisting offeed-forward neural network is another way to estimate the fit; this neural networktakes as input several frames of coefficients and gives as output posterior probabilitiesover HMM states. It has been shown that the use of deep neural networks canoutperform the traditional GMM-HMM in other languages such as English and German.The fact that Turkish language is an agglutinative language and the lack of a hugeamount of speech data complicate the design of a performant SR system. By making useof deep neural networks we will obviously improve the performance but still we willnot achieve better result than English language due to the difference in the availabilityof speech data. We present various architectural and training techniques for theTurkish DNN-based models. The models are tested using a Turkish database collectedfrom mobile devices. In the experiments, we observe that the Turkish DNN-HMMsystem have decreased the word error rate approximately 2.5% when compared to theGMM-HMM traditional system.
Özet
Bu çalışmada derin sinir ağları (DSA) kullanılarak Türkçe konuşma tanıma sistemi geliştirilmiş ve bu sistemle elde edilen sonuçlar geleneksel Gauss karışım model-saklı Markov modeli (GKM-SMM) yöntemi ile aynı ses ve geniş dağarcıklı metin veri tabanı kullanılarak karşılaştırılmıştır. Günümüzde dünyanın birçok bölgesinde ve özellikle Türkiye’de kullanılan konuşma tanıma sistemlerinde konuşmadaki zamansal değişimleri modellemek için saklı Markov modelleri tercih edilmektedir. Akustik verinin gösterimi olan öznitelik katsayılarına her bir SMM durumunun hizalama olasılıklarını tahmin etmek için Gauss karışım modeli kullanılmaktadır. Hizalama olasılıklarını tahmin etmek için kullanılabilecek bir diğer yöntem de ileri-beslemeli derin sinir ağlarıdır; bu DSA birkaç pencereden oluşan öznitelik katsayılarını girdi olarak alıp, HMM durum sonsal olasılıklarını çıktı olarak vermektedir. Özellikle İngilizce, Almanca gibi dillerde DSA’ların geleneksel GKM-SMM yöntemine göre daha başarılı sonuçlar verdiği gösterilmiştir. Türkçe’nin eklemeli bir dil olması ve Türkçe için hazırlanmış geniş ses veri tabanlarının bulunmaması DSA ile yüksek performanslı konuşma tanıma sistemlerinin gerçekleştirilmesini güçleştirmektedir. Bu çalışmada, İngilizce gibi geniş veri tabanlarının bulunduğu dillerdeki kadar olmasa da Türkçe bir ses tanıma sisteminin performansının DSA ile arttırılabileceği gösterilmiştir. Çalışmamızda, Türkçe için farklı DSA mimarileri ve eğitim yöntemleri ile sonuçlar sunulmuştur. Testler mobil akıllı telefonlardan alınmış kayıtlardan oluşan Türkçe bir veri tabanında gerçekleştirilmiştir. Deneylerde, önerilen DNN-HMM sisteminin kelime hata oranını geleneksel GMM-HMM yöntemine göre yaklaşık %2.5 oranında azalttığı gözlenmiştir.