Artículo de método

Un marco dinámico de retroalimentación correctiva escrita que integra la entrega de agentes con IA para soporte estructurado e iterativo de ensayos

DOI:

10.3791/71992

24 de julio de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio compara el STEP-DWCF-R (Proceso estructurado, escalonado, basado en evidencia para retroalimentación correctiva escrita dinámica con agente robótico de IA) para mejorar el rendimiento en redacción del IELTS mediante IA en varias rondas y revisiones apoyadas por el profesor.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los sistemas automatizados de retroalimentación por escritura son frecuentes, pero la mayoría emite comentarios estáticos y fragmentados que proporcionan un apoyo limitado para la revisión. Este estudio evalúa el marco STEP-DWCF-R (Proceso Estructurado, Escalonado, Basado en Evidencia para Retroalimentación Correctiva Escrita Dinámica con Agente de IA Robótico), en el que la retroalimentación generada por IA, moderada por un profesor, se entrega mediante un agente robótico de IA a lo largo de varias rondas iterativas en un ciclo de tareas de una semana. En un ensayo cuasi-experimental de ocho semanas, 32 estudiantes de EFL fueron aleatorizados a recibir retroalimentación correctiva tradicional por escrito (una ronda por tarea) o STEP-DWCF-R. Ambos grupos completaron ensayos de la Tarea 2 del IELTS tanto al inicio como después del examen, que fueron anonimizados, aleatorizados y puntuados por dos evaluadores independientes (ICC = 0,86–0,93). Los modelos lineales de efectos mixtos demostraron que el grupo STEP-DWCF-R mostró mejoras significativamente mayores en la puntuación global de bandas (Δ = 1,03 frente a 0,31 bandas) y en las cuatro dimensiones analíticas, con la mayor mejora observada en Coherencia y Cohesión. Los datos de proceso indicaron que los alumnos de STEP-DWCF-R completaron una media de 2,26 rondas de revisión por tarea, con un número de errores que disminuyó linealmente entre rondas. Estos hallazgos sugieren que el marco integrado STEP-DWCF-R, que abarca la retroalimentación generada por IA, la moderación del profesorado y la entrega iterativa de agentes robóticos de IA, está asociado a una mayor mejora en la redacción del IELTS que la retroalimentación tradicional de ronda única, apuntando a aplicaciones prácticas para la retroalimentación dinámica mejorada por IA en contextos de EFL.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La retroalimentación correctiva escrita (WCF) sigue siendo central en la pedagogía de la escritura de nivel 2. La evidencia muestra que la WCF integral mejora la precisión de los alumnos con el tiempo y, cuando se alinea con la práctica en el aula, puede coexistir con enfoques enfocados que son factibles en contextosauténticos 1,2,3. Estudios recientes en el aula muestran mejoras duraderas en precisión y fluidez gracias a una WCF sostenida y completa. La investigación sobre el alcance de la retroalimentación advierte que los profesores deben enfocar las formas de forma estratégica en lugar de calificartodo como 4,5,6,7,8,9. Paralelamente, la evaluación automática de escritura (AWE) y la retroalimentación correctiva automática por escrito (AWCF) han crecido rápidamente. Los resultados son mixtos: algunos estudios muestran mejoras en el rendimiento de tareas y en el rango gramatical con programas de tipo AWCF o Criterion, mientras que otros no encuentran ninguna ventaja significativa sobre la retroalimentación exclusiva del profesor o toman nota de revisiones mayormente locales y superficiales. Para reflejar esta heterogeneidad, triangulamos deliberadamente entre múltiples estudios de AWCF en lugar de basarnos en una única fuente 10,11,12,13.

También importan las creencias de los alumnos sobre quién proporciona retroalimentación: el trabajo cuasi-experimental sobre la fuente percibida indica que el rendimiento y la confianza pueden cambiar cuando la retroalimentación idéntica se presenta como "profesor" frente a "automatizada", subrayando la necesidad de tener en cuenta los efectos de percepción en los diseños AWCF14,15. Ampliando esta línea, estudios emergentes sugieren que los robots educativos, debido a su presencia incorporada, también pueden actuar como proveedores de retroalimentación, influyendo potencialmente en la implicación y confianza del aprendiz de formasdistintivas 16.

Una línea complementaria de investigación, la retroalimentación correctiva escrita dinámica (DWCF), enfatiza ciclos de retroalimentación frecuentes, manejables y completos con codificación y revisión rápida. La evidencia de múltiples entornos sugiere que el DWCF mejora de forma fiable la precisión (con efectos en la frecuencia sobre la fluidez), aunque los resultados pueden variar según los objetivos del curso y la poblaciónde estudiantes 17, 18, 19, 20. Finalmente, los primeros estudios sobre la retroalimentación mediada por IA generativa reportan paridad con la retroalimentación del profesor sobre los resultados de escritura y los posibles beneficios cuando se combinan con una orientación metalingüística explícita, motivando una integración más estrecha de la retroalimentación humana y de IA en contextos de L221,22.

Para abordar estos desafíos, proponemos el marco STEP-DWCF-R (Proceso estructurado, escalonado, basado en evidencia para retroalimentación correctiva escrita dinámica con agente de IA robótica), un novedoso sistema de retroalimentación DWCF de varias etapas diseñado para proporcionar soporte de escritura estructurado, iterativo y orientado al proceso. Nuestro sistema aprovecha el poder predictivo y generativo de los Grandes Modelos de Lenguaje (LLMs), con la entrega a través de una interfaz robótica de agente de IA y moderación del profesor, para segmentar problemas complejos de escritura en categorías manejables, ofrecer retroalimentación a través de múltiples rondas de interacción y evaluar su efectividad utilizando métricas tanto basadas en resultados como en procesos. Al transformar la retroalimentación en un proceso estructurado e interactivo, STEP-DWCF-R impulsa el soporte automatizado de escritura desde la corrección de errores estática hacia un sistema más atractivo, integrado y orientado al aprendizaje.

Nuestras contribuciones se centran en tres avances integrados. En primer lugar, proponemos un esquema estructurado de representación por retroalimentación que categoriza los errores (por ejemplo, gramática, coherencia) para que la retroalimentación de LLM entregada por agentes de IA robótica sea tanto accionable como pedagógicamente interpretable. En segundo lugar, introducimos un proceso iterativo de varias etapas que secuencia la retroalimentación a través del lenguaje, la estructura y el razonamiento a lo largo de varias rondas para reducir la carga cognitiva y profundizar la implicación. En tercer lugar, ampliamos la evaluación más allá de las puntuaciones posteriores para incluir métricas orientadas a procesos como la reducción de errores y la adopción de retroalimentación, ofreciendo una visión más amplia del impacto en el aprendizaje. Los marcos WCF representan los primeros intentos de sistematizar la retroalimentación correctiva escrita dentro de la tecnología educativa. Originarios de la Evaluación Automatizada de Escritura (AWE) y la Calificación Automatizada de Ensayos (AES), estos sistemas enfatizaban la detección de errores y la puntuación de competencia13,14. Su contribución radica en la escalabilidad: miles de estudiantes podrían recibir retroalimentación sin el cuello de botella de la calificación humana. Sin embargo, estos marcos suelen proporcionar comentarios estáticos y fragmentados, como revisiones gramaticales, sugerencias léxicas o puntuaciones globales que los estudiantes tuvieron dificultades para transformar en revisionessignificativas 23,24,25,26.

Con el tiempo, la investigación en la WCF evolucionó para incluir enfoques más mediados por la tecnología. Estos sistemas más recientes buscaron captar aspectos más amplios de la escritura aprovechando métodoscomputacionales 13,21. Más recientemente, el alcance se ha ampliado aún más con tecnologías incorporadas, donde los robots educativos han empezado a actuar como proveedores de retroalimentación en contextos de escritura o tutoría. Su presencia física y sus posibilidades interactivas introducen nuevas dinámicas de confianza, compromiso y motivación del alumno. Sin embargo, a pesar de estos desarrollos, la orientación dominante de la WCF se ha mantenido centrada enresultados 8,27: producir puntuaciones o comentarios aislados de forma puntual. Pedagogógicamente, esta orientación está desalineada con la evaluación formativa, donde la retroalimentación debe respaldar la revisión en los borradores y apoyar el compromisometacognitivo 16,28,29,30,31. Así, el límite conceptual de la WCF revela una brecha duradera: se proporciona retroalimentación, pero no se estructura ni secuencia para guiar los procesos de aprendizaje.

En respuesta a estas limitaciones, los estudiantes han comenzado a explorar enfoques más dinámicos para redactar feedback. Las primeras investigaciones destacaron la importancia de los ciclos iterativos de retroalimentación, donde los estudiantes revisan varias veces bajo directricesestructuradas 17,32. También se ha propuesto la categorización estructurada de errores para mejorar la interpretabilidad de la retroalimentación y alinearla con los objetivospedagógicos 33,34. La noción de marco DWCF consolida estas direcciones al incorporar tres principios de diseño: esquemas de error explícitos, entrega escalonada e iterativa, y métricas de evaluación orientadas aprocesos 19,35. En lugar de abrumar a los estudiantes con una gran cantidad de correcciones a la vez, DWCF distribuye la atención a través de capas de escritura—precisión superficial, coherencia estructural y profundidad argumentativa—a lo largo de rondassucesivas 17,33. La evaluación va más allá de las puntuaciones finales para incluir indicadores de proceso como tasas de reducción de errores, adopción de retroalimentación y profundidad de revisión10, 19 y 25. A pesar de su potencial, las aplicaciones prácticas de la DWCF siguen siendo escasas, y la mayoría de los estudios no llegan a operacionalizarla en contextos a gran escala mediados porla tecnología 10,36,37. Esta carencia pone de manifiesto la necesidad de marcos que no solo teoricen la DWCF, sino que también demuestren su viabilidad en entornos educativos reales. La Figura 1 muestra el marco teórico más amplio de DWCF propuesto en la literatura. La figura ofrece una justificación general de cómo la retroalimentación correctiva escrita dinámica puede operar en múltiples niveles, incluyendo tanto los resultados medidos (por ejemplo, precisión, coherencia) como los constructos teorizados pero no medidos en el presente estudio (por ejemplo, reducción de la ansiedad en la escritura, fluidez y complejidad). Se incluye para orientación teórica más que como un modelo directo de este ensayo. Los elementos correspondientes a los resultados y métricas de proceso analizados aquí se indican en la figura; Otras vías son ilustrativas y no fueron evaluadas en este estudio.

La aparición de los LLMs y los sistemas multimodales ofrece un medio poderoso para operacionalizar DWCF a gran escala. Los LLM, con sus capacidades de disparo cero y poco, pueden generar retroalimentación sensible al contexto sin entrenamiento específico de tarea21,22. Experimentos recientes sugieren su potencial para la segmentación directiva, el refinamiento escalonado y la generación de explicaciones, que se alinean estrechamente con los principios de DWCF 13,37,38,39. La investigación complementaria en colaboración humano-IA ha demostrado que los bucles iterativos de interacción, adaptación y adopción selectiva de retroalimentación de IA pueden mejorar tanto la calidad de la adopción como de la revisión25,30. Cuando estos procesos se incorporan a través de robots, la interacción tiene el potencial teórico de volverse multimodal —combinando gesto, voz y presencia— lo que puede mejorar aún más la percepción y motivación delaprendiz 40.

Basado en la Zona de Desarrollo Proximal (ZPD)41, la Hipótesis de Entrada42 y la Teoría de Adquisición de Habilidades43, posicionamos STEP-DWCF-R como un controlador que vincula el apoyo al aprendiz, el procesamiento de entradas y el desarrollo de habilidades. Concretamente, la enumeración vinculada a rúbricas, las listas consolidadas a tiempo y los ciclos de IA, humanos y robots moderados por profesores en varias rondas operan en una capa de integración que media la revisión y produce los puntos finales observables analizados aquí (IELTS Overall y TR/CC/LR/GRA; rondas, adopción, errores persistentes, tiempo). Constructos como la reducción de la ansiedad por escribir están teorizados pero no medidos en este ensayo.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo fue aprobado por el Comité de Ética de la Escuela de Educación Primaria del Shangrao Preschool Education College. Todos los participantes eran adultos (≥18 años) y proporcionaron su consentimiento informado por escrito antes del estudio.

1. Diseño del estudio

NOTA: Debido a las limitaciones del aula de EFL disponible (matrícula total N = 32), los participantes fueron asignados aleatoriamente en dos grupos de 16 cada uno. Este tamaño de muestra, aunque modesto, se determinó suficiente para una investigación piloto dado el diseño pre-post dentro del sujeto y los tamaños de efecto grandes esperados basándose en estudios previos delDWCF 17,18,19,20.

  1. Aleatoriza a los participantes en dos grupos (n = 16 cada uno) usando aleatorización simple. Genera la secuencia de asignación usando una lista de números aleatorios generada por ordenador. Ocultar la asignación al instructor hasta que se complete la evaluación inicial.
  2. Asegúrate de que ambos grupos sean impartidos por el mismo instructor usando materiales y horas de contacto idénticos.
  3. Proporciona retroalimentación ya sea mediante corrección humana directa (WCF) o mediante el flujo de trabajo STEP-DWCF-R, donde la IA y el feedback del profesor se presentan mediante un agente robótico de IA.

2. Tareas de escritura

  1. Administrar un ensayo base de la Tarea 2 del IELTS en la Semana 1 bajo condiciones de examen (≥250 palabras, 40 min).
  2. Realiza seis tareas semanales de escritura (Semanas 2–7). Para cada tarea:
    1. En WCF, proporciona una ronda de comentarios humanos sobre el ensayo.
    2. En STEP-DWCF-R, genera retroalimentación de IA, modérala con un profesor humano e instruye al agente robótico de IA para que presente la retroalimentación de forma interactiva al alumno.
    3. En STEP-DWCF-R, repite el ciclo de retroalimentación STEP-DWCF-R durante 2–3 rondas hasta que la revisión esté completa.
  3. Administrar un ensayo de la tarea 2 del IELTS post-examen en la semana 8 bajo las mismas condiciones del examen. Sigue el mismo calendario semanal para cada tarea en ambos grupos. Entrega la retroalimentación de la Ronda 1 en un plazo de 24 horas desde la entrega del borrador en STEP-DWCF-R. Exigir a los alumnos que revisen y vuelvan a enviar en un plazo de 48 horas. Sigue el mismo horario para las rondas siguientes y completa todos los ciclos dentro de la ventana semanal.

3. Flujo de trabajo de retroalimentación

  1. Procesa cada borrador del aprendiz con la API GPT-5 (modelo = "gpt-5", temperatura = 0,7, max_output_tokens = 2048) para generar retroalimentación detallada en cuatro categorías fijas: Gramática, Vocabulario, Organización y Razonamiento. El prompt exacto del sistema y el esquema de salida JSON se proporcionan en el repositorio de código abierto (https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback/blob/main/evaluate.py, función build_prompt() y normalize_reasoning()).
  2. Moderar la retroalimentación generada por IA según los siguientes criterios: eliminar falsos positivos o comentarios inexactos; añadir cuestiones críticas que se han pasado por alto alineadas con la rúbrica del IELTS; Asegúrate de que los comentarios sean accionables y alentadores; y mantener la consistencia con el esquema de cuatro categorías. Registra manualmente las decisiones de moderación.
  3. Guarda el feedback moderado en formato JSON y súbelo a la interfaz de agente de IA robótica (una aplicación web ligera de Flask).
  4. Presenta tus comentarios a través de la interfaz web. Muestra tablas estructuradas para cada categoría (resumen, números y consejos para revisiones). Registra los acuses de recibo y las solicitudes de aclaración de los alumnos a través de registros del sistema. Instruye a los alumnos a revisar y volver a enviar sus borradores. Repite el ciclo hasta tres veces por tarea.
  5. Verificación y resolución de problemas.
    1. Verifica la generación exitosa de retroalimentación por IA confirmando que la salida es JSON válida que contiene las cuatro categorías requeridas: Gramática, Vocabulario, Organización y Razonamiento. Confirma la finalización de la moderación del profesor asegurándote de que se hayan eliminado los falsos positivos, que se hayan añadido los problemas faltantes y que el archivo JSON moderado se haya guardado.
    2. Sube el archivo JSON moderado a la interfaz de agente robótico de IA basada en Flask a través del endpoint de subida. Confirma la subida exitosa a través del mensaje de confirmación de la interfaz y la entrada del registro de la base de datos. Registra automáticamente las reenvíos de los alumnos a través de los registros de envío de formularios.
    3. Procesar salidas de IA no conformes (por ejemplo, JSON mal formado, categorías faltantes o retroalimentación inexacta) utilizando las funciones ensure_json() y normalize_reasoning(). Regenera la salida de la API ajustando los parámetros del prompt según sea necesario. Corrige manualmente el JSON durante la moderación del profesor, si es necesario, para asegurarse de que las cuatro categorías estén presentes antes de subir.
      NOTA: Ejemplos de feedback en bruto de IA, versiones moderadas por profesores y la salida de la interfaz entregada están disponibles en el repositorio (datos/carpeta y cuadernos/).

4. Medición de resultados

  1. Define el resultado principal como el cambio en la puntuación global de la banda IELTS (de la semana 1 a la semana 8).
  2. Define los resultados secundarios como cambios en la Respuesta a la Tarea, Coherencia y Cohesión, Recursos Léxicos y Rango y Precisión Gramatical.
  3. Asigna a dos evaluadores independientes con experiencia en la calificación de la tarea 2 del IELTS para que evalúen todos los ensayos. Elimina nombres e identificadores de grupos de todos los ensayos. Aleatoriza el orden de los ensayos y los evaluadores a ciegas según la tarea grupal y el momento de tiempo. Usa el mismo prompt de la Tarea 2 del IELTS tanto para la línea de base de la Semana 1 como para la Semana 8 después del examen. Resolver los desacuerdos de puntuación superiores a 0,5 bandas mediante la discusión hasta alcanzar el consenso. Evalúa la fiabilidad entre evaluadores utilizando el coeficiente de correlación intraclase de medidas medias (ICC[2,2]).

5. Medición de procesos

  1. Registra el número de rondas de repaso por tarea.
  2. Recoger la captación de retroalimentación (adoptada, modificada, rechazada) por parte de los alumnos.
  3. Registra los errores persistentes entre ciclos.
  4. Registra el tiempo de feedback del profesor, el tiempo de entrega del robot y el tiempo de repaso del alumno.

6. Análisis de datos

  1. Ajustar modelos lineales de efectos mixtos con interacción de grupo, tiempo y grupo × tiempo.
  2. Aplicar modelos generalizados de efectos mixtos para las medidas de proceso.
  3. Informa sobre tamaños de efecto, intervalos de confianza del 95% y valores p ajustados.
  4. Realizar comprobaciones de robustez con ANCOVA, modelos específicos para evaluadores y SE robustos.

7. Disponibilidad de código

Todo el código, prompts, esquemas JSON y archivos de implementación de ejemplo necesarios para reproducir el sistema STEP-DWCF-R están disponibles abiertamente en https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Experimentos y análisis

Los 32 alumnos proporcionaron datos de referencia. Los datos posteriores a la prueba estaban disponibles para 16 estudiantes de cada grupo (WCF y STEP-DWCF-R; Figura 2). La cronología y las medidas del estudio se presentan en la Figura 3, y el flujo de trabajo de retroalimentación de extremo a extremo se ilustra en la Figura 4. Los...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio comparó STEP-DWCF-R, un marco dinámico de retroalimentación correctiva escrita multicomponente con un agente robótico de IA, con WCF de ronda única en un curso de redacción IELTS de ocho semanas. El paso DWCF-R produjo mayores ganancias antes del post en la banda total y en TR, CC, LR y GRA. Los estudiantes bajo STEP-DWCF-R también completaron más rondas de revisión y mostraron una reducción de errores más rápida, con modelos que estimaron una disminución de aproximadamente ...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen intereses en competencia.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabajo fue financiado por una subvención puente de la Universidad Sains de Malasia, Proyecto Nº: R501-LR-RND003-0000001342-0000.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Flask (Web Framework)Pallets Projectshttps://flask.palletsprojects.comVersión 2.1; usado para la interfaz web del agente de IA robótica
API GPT-5OpenAIhttps://platform.openai.comModelo gpt-5, temperatura=0.7; para la generación de retroalimentación JSON estructurada
Jinja2Pallets Projectshttps://jinja.palletsprojects.comPlantillas renderizadas en el servidor para la interfaz web
PythonPython Software Foundationhttps://www.python.orgVersión 3.10; scripts de backend
Windows 11Microsofthttps://www.microsoft.com/windowsSistema operativo para el sistema de retroalimentación de IA

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Ingenier aN mero 233N mero 233Valor vac oN meroEscritura en ingl sretroalimentaci n correctiva escrita WCFretroalimentaci n correctiva escrita din mica DWCFcolaboraci n humano IAasimilaci n de la retroalimentaci nmodelos de efectos mixtos

Artículos relacionados