Por favor, use este identificador para citar o enlazar este ítem: http://dgsa.uaeh.edu.mx:8080/handle/231104/8465
Título : Reconocimiento de hablantes mediante representaciones unidimensionales y bidimensionales de señales de voz usando aprendizaje automático.
Otros títulos : Ciencias Computacionales.
Autor : Frausto Cadena, José Isac
Palabras clave : Reconocimiento de hablantes
Coeficientes cepstrales en la escala de Mel
Representación de características
Máquinas de vectores de soporte
Redes neuronales convolucionales
Ciencias Computacionales.
Fecha de publicación : 30-jul-2026
Editorial : ICBI-BD-UAEH
Descripción : El presente trabajo tiene como objetivo evaluar y comparar distintas representaciones de la señal de voz para la tarea de reconocimiento de hablantes, considerando tanto un enfoque tradicional unidimensional basado en los coeficientes cepstrales en la escala de Mel (MFCC), como una representación bidimensional derivada de los mismos coeficientes en forma de imágenes. En el estudio se realizaron diversos experimentos orientados a analizar los factores que influyen en el desempeño del modelo y en la estabilidad de los resultados. Se evaluaron diferentes configuraciones que incluyeron el impacto de las técnicas de normalización y estandarización, la variación del numero de coeficientes MFCC, la incorporación de coeficientes delta, la reducción dimensional del espacio de atributos mediante ganancia de información y la influencia del contenido verbal. En la etapa final se estableció una comparación entre representaciones unidimensionales y bidimensionales bajo un marco experimental común, considerando la misma tarea de clasificación, características base y métricas de evaluación. Se evaluó el desempeño de clasificadores tradicionales basados en vectores, como máquinas de vectores de soporte, k-vecinos mas cercanos y bosques aleatorios, contrastándose frente a una arquitectura profunda VGG16 entrenada sobre las representaciones bidimensionales de los mismos coeficientes acústicos transformados en imágenes. Los resultados mostraron la estabilidad y consistencia que mantiene el enfoque unidimensional en conjuntos de datos mas reducidos, mientras que la representación bidimensional permitió explorar la sensibilidad de la red convolucional a los datos, presentando un incremento considerable en su capacidad discriminativa conforme se dispone de mayor cantidad de información. De esta forma, la experimentación evidencia tanto la eficiencia del enfoque vectorial como el potencial del enfoque visual en escenarios de mayor complejidad multiclase. En conclusión, la comparación entre representaciones unidimensionales y bidimensionales indica que los MFCC en formato vectorial de dimensión fija continúan siendo una alternativa solida y eficiente para las tareas de reconocimiento de hablantes, especialmente en contextos con conjuntos de datos moderados. No obstante, las representaciones bidimensionales ofrecen un camino prometedor para capturar estructuras espaciales complejas de la señal de voz, siempre que se disponga de un volumen de datos suficiente para el aprendizaje de las capas convolucionales y una adecuada optimización de hiperparámetros. Esta diferencia indica la importancia de seleccionar la representación en función del escenario experimental y abre la posibilidad de integrar ambos enfoques en futuros desarrollos multimodales.
Documento del Gobiberno : LSC .17330 2026
URI : http://dgsa.uaeh.edu.mx:8080/bibliotecadigital/handle/231104/8465
Aparece en las colecciones: Tesis de Licenciatura

Ficheros en este ítem:
Fichero Descripción Tamaño Formato  
ATD2126.pdf1.47 MBAdobe PDFVisualizar/Abrir


Los ítems de DSpace están protegidos por copyright, con todos los derechos reservados, a menos que se indique lo contrario.