Análisis comparativo de la aplicación de los algoritmos de aprendizaje automático random forest y regresión logística en la clasificación de conjuntos de textos

Autores/as

DOI:

https://doi.org/10.26439/interfases2026.n023.8710

Palabras clave:

aprendizaje automático, procesamiento del lenguaje natural, clasificación de textos clínicos, regresión logística, random forest

Resumen

Gestionar la inmensa cantidad de datos no estructurados que generamos hoy sería impensable sin la clasificación automática de textos. Esta herramienta se ha vuelto indispensable para tareas tan variadas como el análisis de sentimientos o la detección de noticias falsas. Sin embargo, surge un dilema técnico importante: a pesar de la enorme oferta de algoritmos diseñados para estos fines, todavía no hay un consenso claro sobre cuál es el más efectivo para cada conjunto de datos específico. Para aliviar este problema, la presente investigación evalúa la robustez de dos modelos. Estos modelos son random forest, que funciona con conjuntos de árboles, y la regresión logística, un modelo lineal. El corpus empleado es Symptom2Disease, un conjunto de 1200 registros textuales con descripciones de síntomas en lenguaje natural distribuidos equitativamente entre 24 categorías diagnósticas que abarca patologías como psoriasis, diabetes, dengue y malaria. Para este propósito, se ha adoptado un diseño experimental factorial con preprocesamiento estándar, la adición de aumento de datos para reducir la limitación de muestras y análisis de representación a través de N-gramas. Los resultados muestran que la regresión logística funciona mejor que random forest, pues alcanza un máximo de F1-Score de 0,9797 cuando se utiliza junto con el aumento de datos y los unigramas. Para textos médicos cortos, la linealidad del modelo y el enriquecimiento sintético del corpus constituyen una solución más eficiente y precisa en comparación con los conjuntos no lineales.

Descargas

Los datos de descarga aún no están disponibles.

Biografía del autor/a

  • Stalin Francisco Calva Vicente, Universidad Técnica de Machala, Ecuador

    Es estudiante de pregrado de Tecnologías de la Información de la Facultad de Ingeniería Civil de la Universidad Técnica de Machala, Ecuador. Su vinculación académica con una facultad orientada a la ingeniería y la tecnología refleja su interés por las ciencias aplicadas y por la búsqueda de soluciones para el desarrollo tecnológico y estructural de la región.

  • Ángel Ricardo Vera Santos, Universidad Técnica de Machala, Ecuador

    Es un estudiante de pregrado de Tecnologías de la Información en Civil de la Universidad Técnica de Machala, Ecuador. Su pertenencia a una facultad enfocada en la ingeniería y la tecnología refleja un claro interés por las ciencias aplicadas y por la búsqueda de soluciones en el ámbito del ecosistema laboral y tecnológico del país.

  • Freddy Aníbal Jumbo Castillo, Universidad Técnica de Machala, Ecuador

    Posee un máster universitario en Inteligencia Artificial, un máster en Ciencia de Datos Aplicada, un master of science en Geographical Information Science & Systems (SIG) y una maestría en Educación Superior. Es ingeniero de sistemas. En el ámbito laboral, se desempeña actualmente como docente e investigador en la carrera profesional de Tecnologías de la Información en la Universidad Técnica de Machala, Ecuador. Cuenta con una amplia experiencia en el desarrollo de proyectos de investigación y vinculación con la sociedad para fortalecer el ecosistema tecnológico regional. A nivel de reconocimientos y aportes, destaca por sus múltiples publicaciones de libros y artículos científicos en revistas indexadas, en los que aborda temáticas innovadoras como el desarrollo de chatbots para orientación vocacional, el impacto de los sesgos y la equidad algorítmica en el aprendizaje automático, y la aplicación de los SIG para la delimitación de cuencas hidrográficas. Sus intereses principales se centran en la intersección de la educación y la tecnología, promoviendo el uso ético de la inteligencia artificial, la analítica de datos para el bienestar social y la formación de profesionales íntegros y comprometidos con su entorno.

  • Johnny Paul Novillo Vicuña, Universidad Técnica de Machala, Ecuador

    Posee una maestría en Educación Superior. Es ingeniero eléctrico y candidato a doctor (Ph. D.) en Tecnologías de la Información y Comunicación por la Universidad de La Coruña, España. En el ámbito laboral, cuenta con una sólida experiencia en el sector privado dedicada a la consultoría y construcción de obras eléctricas, mientras que en el sector educativo se desempeña como docente titular e investigador en la Universidad Técnica de Machala, institución en la que también ha ejercido como coordinador de las carreras profesionales de Ingeniería de Sistemas y de Tecnologías de la Información. Su destacada producción académica incluye la publicación de libros de texto fundamentales para la formación universitaria, como la serie de volúmenes de Fundamentos de los sistemas microprocesados y Arduino y el internet de las cosas, además de diversos artículos científicos en revistas indexadas. Sus principales líneas de investigación y áreas de interés abarcan el desarrollo de sistemas con internet de las cosas aplicados a la automatización agrícola y acuícola, la criptografía homomórfica para la seguridad de datos en la nube de las pymes, y la aplicación de redes neuronales y visión artificial para la interpretación en tiempo real del lenguaje de señas ecuatoriano.

Referencias

Aggarwal, C. C., & Zhai, C. (2012). A Survey of Text Classification Algorithms. En C. C. Aggarwal & C. Zhai (Eds.), Mining Text Data (pp. 163-222). Springer US. https://doi.org/10.1007/978-1-4614-3223-4_6

Alsaeedi, A. (2020). A survey of term weighting schemes for text classification. International Journal of Data Mining, Modelling and Management, 12(2), 237. https://doi.org/10.1504/IJDMMM.2020.10028060

Báez, P., Arancibia, A. P., Chaparro, M. I., Bucarey, T., Núñez, F., & Dunstan, J. (2022). Procesamiento de lenguaje natural para texto clínico en español: el caso de las listas de espera en Chile. Revista Médica Clínica Las Condes, 33(6), 576-582. https://doi.org/10.1016/J.RMCLC.2022.10.002

Barman, N., Karim, F., & Sharma, K. (2023). Symptom2Disease: Diseases and Natural Language Symptom Descriptions. https://www.kaggle.com/datasets/niyarrbarman/symptom2disease?resource=download

Calero Sánchez, M., González González, J. C., Sánchez Berriel, I., Burillo-Putze, G., & Roda García, J. L. (2024). Natural language processing for reviewing search results from PubMed. Revista Española de Urgencias y Emergencias. https://doi.org/10.55633/S3ME/REUE030.2024

Cardoso, F. E., Ferneda, E., & Botega, L. (2023). Clasificación de textos: un enfoque con uso de machine learning. Revista EDICIC, 3(3), 1–17. https://doi.org/10.62758/re.v3i3.212

Chapman, P., Clinton, J., Kerber, R., Khabaza, T., Reinartz, T., Shearer, C., & Wirth, R. (2000). CRISP-DM 1.0: Step-by-step data mining guide. SPSS Inc. DaimlerChrysler. https://public.dhe.ibm.com/software/analytics/spss/documentation/modeler/14.2/es/CRISP-DM.pdf

Genkin, A., Lewis, D. D., & Madigan, D. (2007). Large-Scale Bayesian Logistic Regression for Text Categorization. Technometrics, 49(3), 291-304. https://doi.org/10.1198/004017007000000245

Kowsari, K., Jafari Meimandi, K., Heidarysafa, M., Mendu, S., Barnes, L., & Brown, D. (2019). Text Classification Algorithms: A Survey. Information, 10(4). https://doi.org/10.3390/info10040150

Li, Q., Peng, H., Li, J., Xia, C., Yang, R., Sun, L., Yu, P. S., & He, L. (2022). A Survey on Text Classification: From Traditional to Deep Learning. ACM Trans. Intell. Syst. Technol., 13(2). https://doi.org/10.1145/3495162

Manning, C. D., Raghavan, P., & Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. https://doi.org/10.1017/CBO9780511809071

Pal, M. (2005). Random forest classifier for remote sensing classification. International Journal of Remote Sensing - INT J REMOTE SENS, 26, 217-222. https://doi.org/10.1080/01431160412331269698

Powers, D. (2008). Evaluation: From Precision, Recall and F-Factor to ROC, Informedness, Markedness & Correlation. Mach. Learn. Technol., 2. https://doi.org/10.48550/arXiv.2010.16061

Pranckevičius, T., & Marcinkevičius, V. (2017). Comparison of Naive Bayes, Random Forest, Decision Tree, Support Vector Machines, and Logistic Regression Classifiers for Text Reviews Classification. Baltic Journal of Modern Computing, 5(2). https://doi.org/10.22364/bjmc.2017.5.2.05

Sun, Y., Li, Y., Qingtao, Z., & Bian, Y. (2020). Application Research of Text Classification Based on Random Forest Algorithm. 370-374. https://doi.org/10.1109/AEMCSE50948.2020.00086

Vabalas, A., Gowen, E., Poliakoff, E., & Casson, A. (2019). Machine learning algorithm validation with a limited sample size. PLOS ONE, 14(11), 1-20. https://doi.org/10.1371/journal.pone.0224365

Wei, J., & Zou, K. (2019). EDA: Easy Data Augmentation Techniques for Boosting Performance on Text Classification Tasks. En K. Inui, J. Jiang, V. Ng, & X. Wan (Eds.), Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP) (pp. 6382-6388). Association for Computational Linguistics. https://doi.org/10.18653/v1/D19-1670

Descargas

Publicado

2026-07-30

Número

Sección

Artículos de investigación

Cómo citar

Calva Vicente, S. F., Vera Santos, Ángel R., Jumbo Castillo, F. A., & Novillo Vicuña, J. P. (2026). Análisis comparativo de la aplicación de los algoritmos de aprendizaje automático random forest y regresión logística en la clasificación de conjuntos de textos. Interfases, 023, 13-36. https://doi.org/10.26439/interfases2026.n023.8710