DSpace DSpace UPC
 Català   Castellano   English  

E-prints UPC >
Altres >
Enviament des de DRAC >

Empreu aquest identificador per citar o enllaçar aquest ítem: http://hdl.handle.net/2117/15468

Ítem no disponible en accés obert per política de l'editorial

Arxiu Descripció MidaFormat
HSCMA2011.pdfArticle283.8 kBAdobe PDF Accés restringit

Citació: Maas, R. [et al.]. Extension of the remos concept to frequency-filtering-based features for reverberation-robust speech recognition. A: Workshop on Hands-free Speech Communication and Microphone Arrays (HSCMA),. "2011 Joint Workshop on Hands-free Speech Communication and Microphone Arrays". Edinburgh: 2011, p. 13-18.
Títol: Extension of the remos concept to frequency-filtering-based features for reverberation-robust speech recognition
Autor: Maas, Roland; Wolf, Martin Veure Producció científica UPC; Sehr, Armin; Nadeu Camprubí, Climent Veure Producció científica UPC; Kellermann, Walter
Data: 2011
Tipus de document: Conference report
Resum: The introduction of partly decorrelated features into the REMOS (REverberationMOdeling for Speech recognition) concept for distant-talking speech recognition [1] is discussed. REMOS combines a hidden Markov model (HMM), trained on clean speech, with a reverberation model capturing certain room characteristics. The most likely contributions of both models to a reverberant observation are determined by an inner optimization problem. In HMM frameworks, decorrelated features are assumed when diagonal covariance matrices are used in the output densities. However, in REMOS, only highly correlated logmelspec (logarithmic mel-spectral) features have been used so far, which has been limiting the recognition performance. In this work, we extend the RE-MOS concept and introduce a new set of partly decorrelated features derived from the frequency filtering [2]. Recognition experiments with connected digits show a consistent relative reduction in word error rate of up to 29% compared to the former logmelspec implementation.
URI: http://hdl.handle.net/2117/15468
DOI: 10.1109/HSCMA.2011.5942381
Versió de l'editor: http://ieeexplore.ieee.org/xpls/abs_all.jsp?arnumber=5942381&tag=1
Apareix a les col·leccions:Altres. Enviament des de DRAC
VEU - Grup de Tractament de la Parla. Ponències/Comunicacions de congressos
Departament de Teoria del Senyal i Comunicacions. Ponències/Comunicacions de congressos
Comparteix:


Stats Mostra les estadístiques d'aquest ítem

SFX Query

Tots els drets reservats. Aquesta obra està protegida pels drets de propietat intel·lectual i industrial corresponents. Sense perjudici de les exempcions legals existents, queda prohibida la seva reproducció, distribució, comunicació pública o transformació sense l'autorització del titular dels drets.

Per a qualsevol ús que se'n vulgui fer no previst a la llei, dirigiu-vos a: sepi.bupc@upc.edu

 

Valid XHTML 1.0! Programari DSpace Copyright © 2002-2004 MIT and Hewlett-Packard Comentaris
Universitat Politècnica de Catalunya. Servei de Biblioteques, Publicacions i Arxius