Please use this identifier to cite or link to this item: https://dspace.sti.ufcg.edu.br/handle/riufcg/46697
Title: Análise da relevância das faixas de frequência na detecção de distúrbios vocais por meio de redes neurais convolucionais em espectrogramas.
Other Titles: Analysis of the relevance of frequency ranges in the detection of vocal disorders using convolutional neural networks in spectrograms.
???metadata.dc.creator???: PAULINO, José Alberto Souza.
???metadata.dc.contributor.advisor1???: GOMES, Herman Martins.
???metadata.dc.contributor.advisor2???: BATISTA, Leonardo Vidal.
???metadata.dc.contributor.referee1???: PEREIRA, Eanes Torres.
???metadata.dc.contributor.referee2???: ARAÚJO, Joseana Macedo Fechine Régis de.
???metadata.dc.contributor.referee3???: ARAÚJO, Tiago Maritan Ugulino de.
???metadata.dc.contributor.referee4???: LOPES, Leonardo Wanderley.
Keywords: Redes Neurais Convolucionais;Frequência;Espectrograma;Distúrbios vocais;Voz;Convolutional Neural Networks;Frequency;Spectrogram;Disorder;Voice
Issue Date: 16-Dec-2024
Publisher: Universidade Federal de Campina Grande
Citation: PAULINO, José Alberto Souza. Análise da relevância das faixas de frequência na detecção de distúrbios vocais por meio de redes neurais convolucionais em espectrogramas. 2024. 77 f. Tese (Doutorado em Ciência da Computação) – Programa de Pós Graduação em Ciência da Computação, Centro de Engenharia Elétrica e Informática, Universidade Federal de Campina Grande, Paraíba, Brasil, 2024.
???metadata.dc.description.resumo???: O uso de técnicas não invasivas para a avaliação da qualidade vocal tem se tornado cada vez mais recorrente devido aos avanços recentes em processamento de sinais e aprendizado de máquina (ML), especialmente no contexto da detecção de distúrbios vocais. Entre essas técnicas, é comum a utilização de espectrogramas para avaliação do traçado espectrográfico, que tipicamente não avaliam padrões em regiões acima de 5.000 Hz, seja por inspeção visual ou pelo uso de algoritmos de ML. Assim, neste estudo, buscou-se avaliar a relevância de diferentes faixas de frequência na classificação de vozes saudáveis e com distúrbios, usando redes neurais convolucionais (CNN). Além disso, investigou-se se a combinação dos resultados obtidos em diferentes faixas de frequência poderia melhorar os resultados de classificação. Para alcançar esse objetivo, foram gerados subconjuntos de dados contendo espectrogramas de 16 faixas de frequência, obtidos através de um banco de filtros passa-faixa. Esse processo foi realizado em dois bancos de dados de voz. Os subconjuntos de dados de espectrogramas foram utilizados para treinar 16 modelos de CNN pré-treinados, um para cada faixa de frequência. O estudo foi conduzido inicialmente avaliando a relevância de cada faixa de frequência individualmente. Em seguida, foram analisados os resultados das 65.536 combinações possíveis das 16 faixas de frequência. Essa análise revelou que é possível caracterizar padrões de patologias vocais em regiões de frequência acima de 5.000 Hz nos espectrogramas, ao avaliar o intervalo entre 1 e 12.427 Hz; contudo, o intervalo entre 1 e 1.462 Hz apresenta uma capacidade descritiva substancialmente maior. Adicionalmente, observou-se que combinações de resultados com modelos treinados em diferentes faixas de frequência, produzem melhores resultados de classificação, aumentando a capacidade descritiva do modelo, medida pelo Coeficiente de Correlação de Matthews, de 0,6182 para 0,6514 no conjunto de dados SVD, e de 0,5683 para 0,6423 no conjunto de dados AVFAD.
Abstract: The use of non-invasive techniques for assessing vocal quality has become increasingly common due to recent advances in signal processing and machine learning (ML), particularly in the context of detecting vocal disorders. Among these techniques, spectrogram analysis is widely used to assess spectral patterns, typically limiting analysis to regions below 5.000 Hz, whether through visual inspection or ML algorithms. In this study, we sought to evaluate the relevance of different frequency bands in classifying healthy and disordered voices using convolutional neural networks (CNNs). Additionally, we investigated whether combining results across different frequency bands could enhance classification performance. To achieve this objective, data subsets containing spectrograms from 16 frequency bands were generated through a bank of band-pass filters. This process was applied to two voice datasets. The spectrogram data subsets were used to train 16 pre-trained CNN models, one for each frequency band. The study initially evaluated the relevance of each frequency band individually, followed by an analysis of the results across the 65,536 possible combinations of the 16 frequency bands. This analysis revealed that it is possible to identify patterns of vocal pathologies in frequency regions above 5.000 Hz within the assessed range from 1 to 12,427 Hz. However, the interval between 1 and 1,462 Hz demonstrated substantially higher descriptive capacity. Furthermore, it was observed that combining results from models trained on different frequency bands yields improved classification outcomes, increasing the descriptive capacity of the model, as measured by the Matthews Correlation Coefficient, from 0.6182 to 0.6514 on the SVD dataset, and from 0.5683 to 0.6423 on the AVFAD dataset.
Keywords: Redes Neurais Convolucionais
Frequência
Espectrograma
Distúrbios vocais
Voz
Convolutional Neural Networks
Frequency
Spectrogram
Disorder
Voice
???metadata.dc.subject.cnpq???: Ciência da Computação
URI: https://dspace.sti.ufcg.edu.br/handle/riufcg/46697
Appears in Collections:Doutorado em Ciência da Computação.

Files in This Item:
File Description SizeFormat 
JOSÉ ALBERTO SOUZA PAULINO - TESE - (PPFGCC) 2024.pdf4.13 MBAdobe PDFView/Open


Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.