$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Diseño y presentación de informes del estudio
Esta revisión sistemática y metaanálisis se llevó a cabo para evaluar la eficacia del aprendizaje basado en simulación (SBL) para la preparación y respuesta ante emergencias en la educación en enfermería, con especial atención a escenarios de emergencia relacionados con la gastroenterología (GI). El objetivo era sintetizar tamaños de efecto estandarizados en seis dominios de aprendizaje predefinidos: adquisición de conocimientos, rendimiento de habilidades, capacidad de trabajo en equipo, pensamiento clínico, responsabilidad profesional y autoconfianza. La revisión se realizó y se informó conforme a las directrices PRISMA 2020 de Preferred Reporting Items for Systematic Reviews andMeta-Analyses (PRISMA) 10.
Fuentes de datos y estrategia de búsqueda
La búsqueda bibliográfica implicó una búsqueda sistemática en PubMed, Scopus, Web of Science y Embase. Se utilizó una combinación de términos de vocabulario controlado y palabras clave de texto libre, incluyendo enfermería, aprendizaje basado en simulación, atención de urgencias o agudas y condiciones gastrointestinales. Se aplicaron operadores booleanos para mejorar la precisión (por ejemplo, "enfermería" Y "simulación" Y "emergencia" Y ("gastrointestinal" O "sangrado gastrointestinal" O "dolor abdominal")). Además, se realizó un filtro manual de listas de referencias de estudios elegibles para identificar cualquier artículo relevante adicional.
La búsqueda abarcó todos los registros disponibles en las bases de datos seleccionadas desde su inicio hasta marzo de 2026. Las estrategias de búsqueda completas específicas para la base de datos, incluyendo palabras clave, operadores booleanos y filtros de búsqueda, se proporcionan en la Tabla Suplementaria 1.
La búsqueda inicial en la base de datos identificó 540 registros. Tras eliminar 180 registros duplicados, se filtraron 360 artículos según el título y el resumen. De estos, 300 discos fueron excluidos por su irrelevancia. Se evaluaron sesenta artículos en texto completo para determinar la elegibilidad, de los cuales 52 fueron excluidos (28 por datos cuantitativos insuficientes y 24 por falta de disponibilidad del texto completo o por no ser en inglés). Un total de ocho estudios cumplieron todos los criterios de elegibilidad y fueron incluidos en la revisión sistemática final y en la síntesis cuantitativa exploratoria. Dos revisores revisaron de forma independiente los títulos y resúmenes, seguidos de una evaluación en texto completo de los estudios potencialmente elegibles. Los desacuerdos sobre la elegibilidad de los estudios se resolvieron mediante discusión y consenso.
Criterios de elegibilidad
Se incluyeron estudios si se inscribieron estudiantes de enfermería o enfermeros en ejercicio y evaluaron intervenciones de aprendizaje basadas en simulación dirigidas a la respuesta a emergencias. Los estudios elegibles involucraron escenarios de simulación centrados en la gastroentería o programas más amplios de simulación de enfermería de urgencias relevantes para la evaluación, manejo, procedimientos o atención al paciente gastrointestinal. Los grupos comparadores incluían instrucción teórica, enseñanza estándar o formación clínica rutinaria. Se requirió que los estudios reportaran datos extractables de resultados posteriores a la intervención para al menos un dominio predefinido, incluyendo conocimiento, rendimiento de habilidades, capacidad de trabajo en equipo, pensamiento clínico, responsabilidad profesional o autoconfianza. Ensayos controlados aleatorizados, estudios cuasi-experimentales y otros diseños comparativos controlados fueron elegibles para su inclusión.
Extracción de datos y armonización de resultados
Dos revisores extrajeron los datos de forma independiente utilizando un formulario de extracción estandarizado. La información extraída incluyó nombre del autor, año de publicación, país, diseño del estudio, tamaño de la muestra, características de los participantes, detalles de la intervención y comparador de simulación, y medidas de resultado reportadas. Los datos cuantitativos incluyeron medias post-intervención, desviaciones estándar y tamaños de muestra para cada grupo de estudio.
Las medidas de resultado se categorizaron en seis dominios predefinidos: adquisición de conocimientos, rendimiento de habilidades, capacidad de trabajo en equipo, pensamiento clínico, responsabilidad profesional y autoconfianza. La mayoría de los resultados se asignaron directamente según las definiciones reportadas en los estudios originales. En un pequeño número de casos, los resultados reportados bajo etiquetas alternativas fueron reclasificados según su construcción educativa primaria para mejorar la comparabilidad entre estudios. Las decisiones de clasificación fueron revisadas de forma independiente por dos investigadores y resueltas por consenso. Este procedimiento de armonización se basó en marcos establecidos para la síntesis metaanalítica de resultadoseducativos 11. Aunque este enfoque mejoró la consistencia entre estudios, no se puede excluir completamente cierto grado de solapamiento conceptual o mala clasificación de resultados. La justificación de todos los resultados reclasificados se presenta en la Tabla Suplementaria 2.
Cálculo del tamaño del efecto
Las diferencias medias estandarizadas se calcularon como la g de Hedges con intervalos de confianza (IC) del 95% correspondientes para cada resultado. La g de Hedges fue seleccionada para corregir el sesgo de muestras pequeñas y es adecuada para sintetizar resultados continuos medidos con diferentes instrumentos12. Cuando era necesario, las estadísticas reportadas se convertían en diferencias medias estandarizadas utilizando fórmulas estándar.
Análisis estadístico y síntesis de datos
Se utilizaron modelos de efectos aleatorios para calcular efectos agrupados y tener en cuenta tanto la variación dentro del estudio como entre estudios. Para obtener intervalos de confianza más conservadores y fiables, especialmente cuando el metaanálisis se realiza basándose en un pequeño número de estudios, se utilizó la estimación de máxima verosimilitud restringida (REML) con ajuste de Knapp–Hartung. Para determinar la heterogeneidad estadística, se utilizó la estadística Cochran Q, τ2 (varianza entre estudios) e I2 , que mide el grado de variación total debida a la heterogeneidad y no al error muestral. Se consideraronque dos valores superiores al 75% implicaban un gran grado de heterogeneidad.
Se generaron parcelas forestales para mostrar visualmente los tamaños de efecto individuales de los estudios y estimaciones agrupadas entre dominios de resultado. La robustez de los resultados agrupados fue investigada mediante análisis de sensibilidad para omitir estudios con características metodológicas poco claras. Se realizaron análisis de subgrupos basándose en el diseño del estudio (aleatorizado vs cuasi-experimental) y la fidelidad de la simulación (alta vs baja), cuando los datos lo permitían. Todos los análisis estadísticos se realizaron utilizando el software R (versión 4.3.1) con el paquete metafor. Se consideró estadísticamente significativo un valor p bilateral < 0,05.
Evaluación del sesgo de publicación
Se utilizaron diagramas de embudo para evaluar la evidencia visual de sesgo de publicación y efectos en estudios pequeños, y la prueba de regresión de Egger se empleó para evaluar la evidencia estadística de este efecto. La prueba de Egger se utilizó para evaluar la asimetría del diagrama embudo, en la que el tamaño del efecto estandarizado se retrocedió respecto a su error estándar; Una interceptación significativa indicó la presencia del sesgo de publicación13. La asimetría del diagrama embudo se observó con cautela, ya que también puede deberse a una heterogeneidad sustancial o fluctuaciones metodológicas en lugar de una publicaciónselectiva 14.
Riesgo de sesgo y certeza de la evidencia
Cada estudio incluido fue evaluado para detectar el riesgo de sesgo utilizando un marco modificado de ROBINS-I. Se aplicó un marco ROBINS-I modificado para acomodar estudios de intervención educativa. La evaluación evaluó el sesgo derivado de la selección de participantes, la clasificación de intervenciones, la ausencia de datos de resultados, la medición de resultados y la notificación selectiva. Los dominios relacionados con desviaciones respecto a las intervenciones previstas se simplificaron porque los estudios incluidos involucraban principalmente intervenciones educativas en lugar de clínicas. Las evaluaciones de riesgo de sesgo variaron según los dominios metodológicos (Tabla 1). La mayoría de los estudios demostraron bajo riesgo de datos incompletos y reportes selectivos; Sin embargo, con frecuencia se identificaron preocupaciones moderadas respecto a la selección de participantes, los procedimientos de asignación y el ceguero debido al carácter educativo de las intervenciones. En general, la mayoría de los estudios se consideró que tenían un riesgo moderado de sesgo, mientras que el estudio prospectivo de validación de Nielsen et al. demostró un perfil de riesgo global más bajo. La confianza en toda la evidencia para cada dominio de resultado se evaluó utilizando el enfoque GRADE of Recommendations Assessment, Development and Evaluation (GRADE), que considera las limitaciones de los estudios, la inconsistencia, la imprecisión y la indirectidad (Tabla 2).