UAEH Biblioteca Digital

Reconocimiento de hablantes mediante representaciones unidimensionales y bidimensionales de señales de voz usando aprendizaje automático.

Mostrar el registro sencillo del ítem

dc.contributor.author Frausto Cadena, José Isac
dc.date.accessioned 2026-09-30T20:01:03Z
dc.date.available 2026-09-30T20:01:03Z
dc.date.issued 2026-07-30
dc.identifier.govdoc LSC .17330 2026
dc.identifier.other ATD2126
dc.identifier.uri http://dgsa.uaeh.edu.mx:8080/bibliotecadigital/handle/231104/8465
dc.description El presente trabajo tiene como objetivo evaluar y comparar distintas representaciones de la señal de voz para la tarea de reconocimiento de hablantes, considerando tanto un enfoque tradicional unidimensional basado en los coeficientes cepstrales en la escala de Mel (MFCC), como una representación bidimensional derivada de los mismos coeficientes en forma de imágenes. En el estudio se realizaron diversos experimentos orientados a analizar los factores que influyen en el desempeño del modelo y en la estabilidad de los resultados. Se evaluaron diferentes configuraciones que incluyeron el impacto de las técnicas de normalización y estandarización, la variación del numero de coeficientes MFCC, la incorporación de coeficientes delta, la reducción dimensional del espacio de atributos mediante ganancia de información y la influencia del contenido verbal. En la etapa final se estableció una comparación entre representaciones unidimensionales y bidimensionales bajo un marco experimental común, considerando la misma tarea de clasificación, características base y métricas de evaluación. Se evaluó el desempeño de clasificadores tradicionales basados en vectores, como máquinas de vectores de soporte, k-vecinos mas cercanos y bosques aleatorios, contrastándose frente a una arquitectura profunda VGG16 entrenada sobre las representaciones bidimensionales de los mismos coeficientes acústicos transformados en imágenes. Los resultados mostraron la estabilidad y consistencia que mantiene el enfoque unidimensional en conjuntos de datos mas reducidos, mientras que la representación bidimensional permitió explorar la sensibilidad de la red convolucional a los datos, presentando un incremento considerable en su capacidad discriminativa conforme se dispone de mayor cantidad de información. De esta forma, la experimentación evidencia tanto la eficiencia del enfoque vectorial como el potencial del enfoque visual en escenarios de mayor complejidad multiclase. En conclusión, la comparación entre representaciones unidimensionales y bidimensionales indica que los MFCC en formato vectorial de dimensión fija continúan siendo una alternativa solida y eficiente para las tareas de reconocimiento de hablantes, especialmente en contextos con conjuntos de datos moderados. No obstante, las representaciones bidimensionales ofrecen un camino prometedor para capturar estructuras espaciales complejas de la señal de voz, siempre que se disponga de un volumen de datos suficiente para el aprendizaje de las capas convolucionales y una adecuada optimización de hiperparámetros. Esta diferencia indica la importancia de seleccionar la representación en función del escenario experimental y abre la posibilidad de integrar ambos enfoques en futuros desarrollos multimodales. es_ES
dc.language.iso es es_ES
dc.publisher ICBI-BD-UAEH es_ES
dc.subject Reconocimiento de hablantes es_ES
dc.subject Coeficientes cepstrales en la escala de Mel es_ES
dc.subject Representación de características es_ES
dc.subject Máquinas de vectores de soporte es_ES
dc.subject Redes neuronales convolucionales es_ES
dc.subject Ciencias Computacionales. es_ES
dc.title Reconocimiento de hablantes mediante representaciones unidimensionales y bidimensionales de señales de voz usando aprendizaje automático. es_ES
dc.title.alternative Ciencias Computacionales. es_ES
dc.type Tesis es_ES


Ficheros en el ítem

Este ítem aparece en la(s) siguiente(s) colección(ones)

Mostrar el registro sencillo del ítem

Buscar en Biblioteca Digital


Búsqueda avanzada

Listar

Mi cuenta