Por favor, use este identificador para citar o enlazar este ítem: http://dgsa.uaeh.edu.mx:8080/handle/231104/7906
Registro completo de metadatos
Campo DC Valor Lengua/Idioma
dc.contributor.authorCenteno García, Diana Denhy-
dc.date.accessioned2026-07-09T15:34:42Z-
dc.date.available2026-07-09T15:34:42Z-
dc.date.issued2026-05-04-
dc.identifier.govdocLSC .17040 2026-
dc.identifier.otherATD1836-
dc.identifier.urihttp://dgsa.uaeh.edu.mx:8080/bibliotecadigital/handle/231104/7906-
dc.descriptionLa expansión del entorno digital ha provocado un aumento masivo en la generación de documentos digitales, lo que ha planteado diversos retos en su organización. Este escenario resulta especialmente complejo en repositorios de documentos personales, donde suelen presentar una gran diversidad temática y se organizan y clasifican según criterios propios de cada usuario. Para afrontar este desafío, se han desarrollado diversas estrategias orientadas a la organización de documentos según su contenido. En este contexto, las disciplinas del procesamiento del lenguaje natural y el aprendizaje automático ofrecen enfoques de clasificación tanto supervisada como no supervisada. En la práctica también se emplean herramientas comerciales de clasificación automática de documentos; sin embargo, estas no suelen adaptarse a las características de los archivos personales, además de implicar costos económicos y, en muchos casos, depender de servidores externos. El presente estudio propone evaluar y comparar distintas técnicas de representación textual, desde métodos tradicionales como TF-IDF hasta modelos avanzados basados en transformadores, combinados con algoritmos de clasificación no supervisada (K-medias, HDBSCAN y modelado de tópicos) y supervisada (bosques aleatorios, máquinas de vectores de soporte y perceptrón multicapa). La evaluación se realizó utilizando colecciones de texto de referencia y documentos personales con el objetivo de simular un entorno real, empleando métricas como exactitud, F1-macro y coeficiente de silueta. A partir de los experimentos realizados, se observó que BERTopic destacó por su capacidad para modelar tópicos, mientras que la combinación de TF-IDF con máquinas de vectores de soporte obtuvo el mejor desempeño en la clasificación de documentos. Estos modelos se integraron en una interfaz gráfica de usuario que automatiza la organización documental, permitiendo clasificar nuevos documentos, agrupar aquellos sin categoría y entrenar modelos de clasificación personalizados, manteniendo la estructura del repositorio del usuario. Finalmente, al probar la interfaz gráfica se obtuvieron resultados favorables. En el caso del agrupamiento con BERTopic, se lograron identificar seis de los siete grupos originales del conjunto de datos personales, generando temáticas coherentes. Por otra parte, en la clasificación de documentos, se alcanzaron valores de exactitud superiores a 0.9. En conjunto, estos resultados respaldan el potencial de las técnicas seleccionadas para la organización de documentos personales en un ambiente local.es_ES
dc.language.isoeses_ES
dc.publisherICBI-BD-UAEHes_ES
dc.subjectRepositorio de documentos personaleses_ES
dc.subjectAprendizaje automático supervisadoes_ES
dc.subjectAprendizaje automático no supervisadoes_ES
dc.subjectClasificación de documentoses_ES
dc.subjectCiencias Computacionales.es_ES
dc.titleClasificación de documentos digitales mediante técnicas de procesamiento del lenguaje natural y aprendizaje automático.es_ES
dc.title.alternativeCiencias Computacionales.es_ES
dc.typeTesises_ES
Aparece en las colecciones: Tesis de Licenciatura

Ficheros en este ítem:
Fichero Descripción Tamaño Formato  
ATD1836.pdf1.33 MBAdobe PDFVisualizar/Abrir


Los ítems de DSpace están protegidos por copyright, con todos los derechos reservados, a menos que se indique lo contrario.