Mostrar el registro sencillo del ítem
| dc.contributor.author | Frausto Cadena, José Isac | |
| dc.date.accessioned | 2026-09-30T20:01:03Z | |
| dc.date.available | 2026-09-30T20:01:03Z | |
| dc.date.issued | 2026-07-30 | |
| dc.identifier.govdoc | LSC .17330 2026 | |
| dc.identifier.other | ATD2126 | |
| dc.identifier.uri | http://dgsa.uaeh.edu.mx:8080/bibliotecadigital/handle/231104/8465 | |
| dc.description | El presente trabajo tiene como objetivo evaluar y comparar distintas representaciones de la señal de voz para la tarea de reconocimiento de hablantes, considerando tanto un enfoque tradicional unidimensional basado en los coeficientes cepstrales en la escala de Mel (MFCC), como una representación bidimensional derivada de los mismos coeficientes en forma de imágenes. En el estudio se realizaron diversos experimentos orientados a analizar los factores que influyen en el desempeño del modelo y en la estabilidad de los resultados. Se evaluaron diferentes configuraciones que incluyeron el impacto de las técnicas de normalización y estandarización, la variación del numero de coeficientes MFCC, la incorporación de coeficientes delta, la reducción dimensional del espacio de atributos mediante ganancia de información y la influencia del contenido verbal. En la etapa final se estableció una comparación entre representaciones unidimensionales y bidimensionales bajo un marco experimental común, considerando la misma tarea de clasificación, características base y métricas de evaluación. Se evaluó el desempeño de clasificadores tradicionales basados en vectores, como máquinas de vectores de soporte, k-vecinos mas cercanos y bosques aleatorios, contrastándose frente a una arquitectura profunda VGG16 entrenada sobre las representaciones bidimensionales de los mismos coeficientes acústicos transformados en imágenes. Los resultados mostraron la estabilidad y consistencia que mantiene el enfoque unidimensional en conjuntos de datos mas reducidos, mientras que la representación bidimensional permitió explorar la sensibilidad de la red convolucional a los datos, presentando un incremento considerable en su capacidad discriminativa conforme se dispone de mayor cantidad de información. De esta forma, la experimentación evidencia tanto la eficiencia del enfoque vectorial como el potencial del enfoque visual en escenarios de mayor complejidad multiclase. En conclusión, la comparación entre representaciones unidimensionales y bidimensionales indica que los MFCC en formato vectorial de dimensión fija continúan siendo una alternativa solida y eficiente para las tareas de reconocimiento de hablantes, especialmente en contextos con conjuntos de datos moderados. No obstante, las representaciones bidimensionales ofrecen un camino prometedor para capturar estructuras espaciales complejas de la señal de voz, siempre que se disponga de un volumen de datos suficiente para el aprendizaje de las capas convolucionales y una adecuada optimización de hiperparámetros. Esta diferencia indica la importancia de seleccionar la representación en función del escenario experimental y abre la posibilidad de integrar ambos enfoques en futuros desarrollos multimodales. | es_ES |
| dc.language.iso | es | es_ES |
| dc.publisher | ICBI-BD-UAEH | es_ES |
| dc.subject | Reconocimiento de hablantes | es_ES |
| dc.subject | Coeficientes cepstrales en la escala de Mel | es_ES |
| dc.subject | Representación de características | es_ES |
| dc.subject | Máquinas de vectores de soporte | es_ES |
| dc.subject | Redes neuronales convolucionales | es_ES |
| dc.subject | Ciencias Computacionales. | es_ES |
| dc.title | Reconocimiento de hablantes mediante representaciones unidimensionales y bidimensionales de señales de voz usando aprendizaje automático. | es_ES |
| dc.title.alternative | Ciencias Computacionales. | es_ES |
| dc.type | Tesis | es_ES |