Análisis de datos de covid-19: imputación y rendimiento de modelos de aprendizaje supervisado
Este estudio investiga la eficacia de métodos de aprendizaje supervisado en la predicción del COVID-19 utilizando registros hospitalarios del departamento de Concepción durante el periodo 2020-2022. Se analiza el impacto de la imputación de datos faltantes en métricas de evaluación para varios modelos, incluyendo Máquinas de Vectores Soporte, Redes Neuronales Artificiales, Regresión Logística, Árbol de Decisión y Bosque Aleatorio. El preprocesamiento incluye la creación de dos conjuntos de datos: uno sin registros vacíos y otro con un 20% de datos faltantes por filas. La imputación se realiza mediante las técnicas de imputación por moda y bosque aleatorio en el conjunto con datos faltantes. La variable dependiente evaluada es la clasificación final de la enfermedad, confirmada o descartada por criterios laboratoriales. El modelo de Bosque Aleatorio destaca por su eficiencia superior en el conjunto de datos sin registros vacíos y muestra robustez ante la imputación de datos. Este estudio contribuye significativamente al proporcionar información sobre los efectos de la imputación de datos faltantes en el ámbito de la salud pública y su aplicación en la generación de modelos predictivos.
Estadísticas
Últimos 10 meses: visualizaciones y descargas.