Article de méthode

Un cadre dynamique de retour correctionif écrit intégrant la livraison par agent IA pour un support structuré et itératif des essais

DOI :

10.3791/71992

24 juillet 2026

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude évalue le STEP-DWCF-R (Structured, Tiers, Evidence-driven Process for Dynamic Written Corrective Feedback with Robotic AI Agent) afin d’améliorer la performance en rédaction de l’IELTS grâce à l’IA en plusieurs tours et à des révisions soutenues par l’enseignant.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les systèmes automatisés de retour d’écriture sont courants, mais la plupart livrent des commentaires statiques et fragmentés qui offrent un support limité pour la révision. Cette étude évalue le cadre STEP-DWCF-R (Processus structuré, à niveaux, guidé par des preuves pour un retour correctionif écrit dynamique avec agent IA robotique), dans lequel un retour généré par l’IA, modéré par un enseignant, est délivré via un agent IA robotique à travers plusieurs cycles itératifs au cours d’un cycle de tâche d’une semaine. Dans un essai quasi-expérimental de huit semaines, 32 apprenants EFL ont été randomisés soit pour un retour correctionnel écrit traditionnel (un cycle par tâche), soit pour STEP-DWCF-R. Les deux groupes ont réalisé les essais de la tâche 2 de l’IELTS au départ et après le test, qui ont été anonymisés, randomisés et notés par deux évaluateurs indépendants (ICC = 0,86–0,93). Des modèles linéaires à effets mixtes ont démontré que le groupe STEP-DWCF-R présentait des gains significativement plus importants dans le score global de bande (Δ = 1,03 contre 0,31 bande) et sur les quatre dimensions analytiques, avec la plus grande amélioration observée en Cohérence et Cohésion. Les données de processus ont indiqué que les apprenants STEP-DWCF-R ont effectué en moyenne 2,26 tours de révision par tâche, avec une diminution linéaire du nombre d’erreurs sur chaque tour. Ces résultats suggèrent que le cadre intégré STEP-DWCF-R, englobant le retour généré par l’IA, la modération des enseignants et la livraison d’agents robotiques itératifs par IA, est associé à une amélioration accrue de la rédaction IELTS que le retour traditionnel à un seul tour, pointant vers des applications pratiques pour le retour dynamique amélioré par IA dans les contextes EFL.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le retour d’information correctif écrit (WCF) reste central dans la pédagogie de l’écriture de niveau 2. Les preuves montrent que la WCF globale améliore la précision des apprenants au fil du temps et, lorsqu’elle est alignée avec la pratique en classe, peut coexister avec des approches ciblées réalisables dans des contextes authentiques 1,2,3. Des études récentes en classe montrent des gains durables en précision et fluidité grâce à une WCF soutenue et complète. Les recherches sur le périmètre de rétroaction avertissent que les enseignants devraient cibler les formulaires de manière stratégique plutôt que de tout noter 4,5,6,7,8,9. Parallèlement, l’évaluation automatisée de l’écriture (AWE) et le retour d’information écrit automatisé (AWCF) ont connu une croissance rapide. Les résultats sont mitigés : certaines études montrent des progrès en réussite des tâches et en amplitude grammaticale avec des programmes de type AWCF ou Criterion, tandis que d’autres ne trouvent aucun avantage significatif par rapport aux retours réservés à l’enseignant ou notent des révisions principalement locales et superficielles. Pour refléter cette hétérogénéité, nous triangulons délibérément entre plusieurs études AWCF plutôt que de nous appuyer sur une seule source10, 11, 12, 13.

Les croyances des apprenants sur qui fournit un retour d’information sont également importantes : des travaux quasi-expérimentaux sur la source perçue indiquent que la performance et la confiance peuvent changer lorsque des retours identiques sont présentés comme « enseignant » versus « automatisé », soulignant la nécessité de prendre en compte les effets de perception dans les conceptions AWCF14,15. Pour élargir cette ligne, des études émergentes suggèrent que les robots éducatifs, en raison de leur présence incarnée, peuvent également agir comme fournisseurs de retours, influençant potentiellement l’engagement et la confiance des apprenants de manièredistinctive 16.

Une ligne de recherche complémentaire, le retour correctionnel écrit dynamique (DWCF), met l’accent sur des cycles de rétroaction fréquents, gérables et complets avec codage et révision rapide. Les preuves issues de plusieurs milieux suggèrent que le DWCF améliore de manière fiable la précision (avec des effets fréquents sur la fluidité), bien que les résultats puissent varier selon les objectifs du cours et la populationd’apprenants 17, 18, 19, 20. Enfin, les premières études sur le retour d’information médié par l’IA générative rapportent une parité avec les retours des enseignants sur les résultats d’écriture et les bénéfices potentiels lorsqu’elles sont associées à des orientations métalinguistiques explicites, ce qui encourage une intégration plus étroite du retour humain et du retour IA dans les contextes L221,22.

Pour relever ces défis, nous proposons le cadre STEP-DWCF-R (Structured, Tiers, Evidence-driven Process for Dynamic Written Corrective Feedback with Robotic AI Agent), un système de rétroaction DWCF à plusieurs étapes novateur, conçu pour fournir un support d’écriture structuré, itératif et orienté processus. Notre système exploite la puissance prédictive et générative des grands modèles de langage (LLM), avec une diffusion via une interface d’agent IA robotique et la modération des enseignants, pour segmenter les problèmes d’écriture complexes en catégories gérables, fournir des retours via plusieurs phases d’interaction, et évaluer son efficacité à l’aide de métriques basées sur les résultats et les processus. En transformant le retour en un processus structuré et interactif, STEP-DWCF-R fait progresser le support automatisé de l’écriture, passant de la correction d’erreurs statique à un système plus engageant, intégré et orienté vers l’apprentissage.

Nos contributions reposent sur trois avancées intégrées. Tout d’abord, nous proposons un schéma structuré de représentation par rétroaction qui catégorise les erreurs (par exemple, grammaire, cohérence) afin que la rétroaction LLM fournie par l’IA robotique soit à la fois exploitable et pédagogiquement interprétable. Deuxièmement, nous introduisons un processus itératif en plusieurs étapes qui séquence les retours à travers le langage, la structure et le raisonnement à travers plusieurs cycles afin de réduire la charge cognitive et d’approfondir l’engagement. Troisièmement, nous étendons l’évaluation au-delà des scores post-scores pour inclure des indicateurs orientés processus tels que la réduction des erreurs et l’adoption des retours, offrant une vision plus riche de l’impact de l’apprentissage. Les cadres WCF représentent les premières tentatives de systématisation du retour correctionnel écrit dans la technologie éducative. Issus de l’Évaluation Automatisée de la Rédaction (AWE) et de la Correction Automatisée des Essais (AES), ces systèmes mettaient l’accent sur la détection d’erreurs et la maîtrise avecun score de 13,14. Leur contribution réside dans la scalabilité : des milliers d’apprenants pourraient recevoir des retours sans le goulot d’étranglement de la notation humaine. Cependant, ces cadres fournissaient généralement des commentaires statiques et fragmentés, tels que des corrections grammaticales, des suggestions lexicales ou des scores globaux que les apprenants peinaient à transformer en révisionssignificatives 23,24,25,26.

Au fil du temps, la recherche sur la WCF a évolué pour inclure davantage d’approches médiatisées par la technologie. Ces systèmes plus récents cherchaient à saisir des aspects plus larges de l’écriture en tirant parti des méthodes de calcul13,21. Plus récemment, le champ d’action s’est encore élargi avec les technologies intégrées, où les robots éducatifs ont commencé à agir comme des sources de retour dans des contextes d’écriture ou de tutorat. Leur présence physique et leurs possibilités interactives introduisent de nouvelles dynamiques de confiance, d’engagement et de motivation des apprenants. Pourtant, malgré ces évolutions, l’orientation dominante de la WCF est restée axée sur les résultats 8,27 : produire des scores ou des commentaires isolés de manière one-shot. Sur le plan pédagogique, cette orientation est en désaccord avec l’évaluation formative, où le retour d’information doit accompagner la révision à travers les brouillons et soutenir l’engagementmétacognitif 16,28,29,30,31. Ainsi, la frontière conceptuelle de la WCF révèle un vide durable : le retour est fourni, mais non structuré ou séquencé pour guider les processus d’apprentissage.

En réponse à ces limites, les chercheurs ont commencé à explorer des approches plus dynamiques pour rédiger des retours. Les premières recherches ont mis en avant l’importance des cycles de rétroaction itératifs, où les apprenants révisent plusieurs fois sous des directivesstructurées 17,32. La catégorisation structurée des erreurs a également été proposée pour améliorer l’interprétabilité des retours et l’aligner sur les objectifs pédagogiques33,34. La notion de cadre DWCF consolide ces orientations en intégrant trois principes de conception : des schémas d’erreur explicites, une livraison progressive et itérative, et des métriques d’évaluation orientéesprocessus 19,35. Plutôt que de submerger les étudiants avec une masse de corrections à la fois, le DWCF répartit l’attention sur plusieurs niveaux d’écriture — précision superficielle, cohérence structurelle et profondeur argumentative — à travers des tourssuccessifs 17,33. L’évaluation s’étend au-delà des scores finaux pour inclure des indicateurs de processus tels que les taux de réduction des erreurs, l’adoption de rétroaction et la profondeur de révision10, 19, 25. Malgré ses promesses, les applications pratiques du DWCF restent rares, et la plupart des études ne la mettent en œuvre pas dans des contextes à grande échelle, médiés par la technologie 10,36,37. Cette lacune met en lumière la nécessité de cadres qui non seulement théorisent la DWCF, mais démontrent également sa faisabilité dans des contextes éducatifs réels. La figure 1 montre le cadre théorique plus large de la DWCF proposé dans la littérature. La figure fournit une justification générale de la manière dont le retour correctionif écrit dynamique peut fonctionner à plusieurs niveaux, incluant à la fois les résultats mesurés (par exemple, précision, cohérence) et les concepts théorisés mais non mesurés dans la présente étude (par exemple, réduction de l’anxiété écrite, fluidité et complexité). Il est inclus pour une orientation théorique plutôt que comme modèle direct de cet essai. Les éléments correspondant aux résultats et aux métriques de processus analysés ici sont indiqués dans la figure ; D’autres voies sont illustratives et n’ont pas été évaluées dans cette étude.

L’émergence des LLM et des systèmes multimodaux offre un moyen puissant d’opérationnaliser le DWCF à grande échelle. Les LLM, avec leurs capacités zero-shot et few-shot, peuvent générer des retours contextuels sans formation spécifique à latâche 21,22. Des expériences récentes suggèrent leur potentiel pour la segmentation directive, le raffinement par étapes et la génération d’explications, qui s’alignent étroitement avec les principes du DWCF 13,37,38,39. Des recherches complémentaires sur la collaboration humain–IA ont montré que les boucles itératives d’engagement, d’adaptation et d’adoption sélective des retours IA peuvent améliorer à la fois la qualité de l’adoption et de la révision25,30. Lorsque ces processus sont incarnés par des robots, l’interaction a le potentiel théorique de devenir multimodale — combinant geste, voix et présence — ce qui peut renforcer la perception et la motivation de l’apprenant40.

Ancrés dans la Zone de Développement Proximal (ZPD)41, l’Hypothèse d’Entrée42 et la Théorie de l’Acquisitionde Compétences 43, nous positionnons STEP-DWCF-R comme un contrôleur qui relie le soutien à l’apprenant, le traitement des entrées et le développement des compétences. Concrètement, la listation liée à des rubriques, les listes consolidées en temps opportun et les cycles d’IA, humains et robots modérés par plusieurs tours par les enseignants fonctionnent à une couche d’intégration qui médiatise la révision et produit les points observables analysés ici (IELTS Overall et TR/CC/LR/GRA ; rondes, prise d’envoi, erreurs persistantes, temps). Des concepts tels que la réduction de l’anxiété liée à l’écriture sont théorisés mais pas mesurés dans cet essai.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce protocole a été approuvé par le Comité d’éthique de l’École d’éducation primaire, Shangrao Preschool Education College. Tous les participants étaient des adultes (≥18 ans) et avaient donné un consentement éclairé écrit avant l’étude.

1. Conception de l’étude

REMARQUE : En raison des contraintes de la classe d’EFL disponible (nombre total d’inscriptions N = 32), les participants ont été répartis en deux groupes de 16 chacun. Cette taille d’échantillon, bien que modeste, a été jugée suffisante pour une étude pilote compte tenu de la conception pré-post-sujet interne et des tailles d’effet élevées attendues selon les études antérieures duDWCF 17,18,19,20.

  1. Randomisez les participants en deux groupes (n = 16 chacun) en utilisant une randomisation simple. Générez la séquence d’allocation à l’aide d’une liste de nombres aléatoires générée par ordinateur. Dissimulez l’attribution à l’instructeur jusqu’à la fin de l’évaluation de base.
  2. Assurez-vous que les deux groupes sont enseignés par le même enseignant en utilisant les mêmes supports et les mêmes heures de contact.
  3. Fournir un retour soit par correction humaine directe (WCF), soit via le flux de travail STEP-DWCF-R, où les retours de l’IA et des enseignants sont présentés via un agent IA robotique.

2. Tâches d’écriture

  1. Administrez un essai de base pour la tâche 2 de l’IELTS en semaine 1 dans les conditions de l’examen (≥250 mots, 40 min).
  2. Effectuez six tâches d’écriture hebdomadaires (semaines 2 à 7). Pour chaque tâche :
    1. Dans WCF, fournissez un tour de retours humains sur l’essai.
    2. Dans STEP-DWCF-R, générez un retour d’information IA, modérez-le avec un enseignant humain, et demandez à l’agent IA robotique de présenter le retour de manière interactive à l’apprenant.
    3. Dans le STEP-DWCF-R, répétez le cycle de rétroaction STEP-DWCF-R pendant 2 à 3 tours jusqu’à la fin de la révision.
  3. Administrez un essai post-test IELTS Task 2 en semaine 8 dans les mêmes conditions d’examen. Suivez le même calendrier hebdomadaire pour chaque tâche dans les deux groupes. Fournir un retour d’information du premier tour dans les 24 heures suivant la soumission du brouillon dans le STEP-DWCF-R. Exiger que les apprenants révisent et soumettent à nouveau dans les 48 heures. Suivez le même calendrier pour les tours suivants et terminez tous les cycles dans la fenêtre hebdomadaire.

3. Flux de travail de retour d’information

  1. Traiter chaque brouillon d’apprenant avec l’API GPT-5 (modèle = « gpt-5 », température = 0,7, max_output_tokens = 2048) pour générer des retours détaillés répartis sur quatre catégories fixes : grammaire, vocabulaire, organisation et raisonnement. L’invite système exacte et le schéma de sortie JSON sont fournis dans le dépôt open source (https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback/blob/main/evaluate.py, fonction build_prompt() et normalize_reasoning()).
  2. Modérer les retours générés par l’IA selon les critères suivants : supprimer les faux positifs ou les commentaires inexacts ; ajouter des questions critiques manquées en accord avec la grille IELTS ; Veillez à ce que les commentaires soient exploitables et encourageants ; et maintiennent la cohérence avec le schéma à quatre catégories. Consignez manuellement les décisions de modération.
  3. Enregistrez les retours modérés au format JSON et téléchargez-les dans l’interface de l’agent IA robotique (une application web Flask légère).
  4. Présentez vos retours via l’interface web. Affichez des tableaux structurés pour chaque catégorie (résumé, numéros et conseils de révision). Consignez les accusés de réception et les demandes de clarification des apprenants via les journaux système. Demandez aux apprenants de réviser et de soumettre à nouveau leurs brouillons. Répétez le cycle jusqu’à trois fois par tâche.
  5. Vérification et dépannage.
    1. Vérifiez la génération de feedback efficace par l’IA en confirmant que la sortie est valide en JSON contenant les quatre catégories requises : grammaire, vocabulaire, organisation et raisonnement. Confirmez la fin de la modération des enseignants en veillant à ce que les faux positifs aient été supprimés, que les problèmes manquants aient été ajoutés et que le fichier JSON modéré ait été sauvegardé.
    2. Téléchargez le fichier JSON modéré sur l’interface d’agent IA robotique basée sur Flask via le point de terminaison de téléchargement. Confirmez le téléchargement réussi via le message de confirmation de l’interface et l’entrée du journal de la base de données. Enregistrez automatiquement les resoumissions des apprenants via les journaux de soumission des formulaires.
    3. Traiter les sorties IA non conformes (par exemple, JSON mal formé, catégories manquantes ou retour d’information inexact) en utilisant les fonctions ensure_json() et normalize_reasoning(). Régénérez la sortie API avec des paramètres d’invite ajustés selon les besoins. Corrigez manuellement le JSON lors de la modération de l’enseignant, si nécessaire, afin de vous assurer que les quatre catégories sont présentes avant le téléchargement.
      REMARQUE : Des exemples de retours bruts sur l’IA, des versions modérées par l’enseignant et la sortie de l’interface livrée sont disponibles dans le dépôt (données/dossier et carnets/).

4. Mesure des résultats

  1. Définissez le critère principal comme le changement du score global de l’IELTS (de la semaine 1 à la semaine 8).
  2. Définissez les résultats secondaires comme des changements dans la réponse à la tâche, la cohérence et la cohésion, la ressource lexicale, ainsi que la plage grammaticale et la précision.
  3. Assignez deux évaluateurs indépendants ayant de l’expérience dans la notation de la tâche 2 de l’IELTS pour évaluer tous les essais. Retirez les noms et identifiants de groupe de tous les essais. Randomisez l’ordre des essais et les évaluateurs à l’aveugle selon les devoirs de groupe et le moment donné. Utilisez la même consigne de la tâche 2 de l’IELTS pour la première semaine de départ et la semaine 8 après l’examen. Résoudre les désaccords de notation supérieurs à 0,5 bande par la discussion jusqu’à ce qu’un consensus soit atteint. Évaluer la fiabilité inter-évaluateurs à l’aide du coefficient de corrélation intraclasse des mesures moyennes (ICC[2,2]).

5. Mesure du procédé

  1. Notez le nombre de tours de révision par tâche.
  2. Enregistrement de la réception des retours (adoptés, modifiés, refusés) par les apprenants.
  3. Suivez les erreurs persistantes entre les cycles.
  4. Notez le temps de retour des enseignants, le temps de livraison du robot et le temps de révision des apprenants.

6. Analyse des données

  1. Ajustez les modèles linéaires à effets mixtes avec les interactions Groupe, Temps et Groupe × Temps.
  2. Appliquer des modèles à effets mixtes généralisés pour les mesures de processus.
  3. Rapportez les tailles d’effet, les intervalles de confiance à 95 % et les valeurs p ajustées.
  4. Effectuez des vérifications de robustesse avec ANCOVA, des modèles spécifiques à chaque évaluateur et des SE robustes.

7. Disponibilité du code

Tout le code, les invites, les schémas JSON et les exemples de fichiers d’implémentation nécessaires pour reproduire le système STEP-DWCF-R sont disponibles librement sur https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Expériences et analyses

Les 32 apprenants ont fourni des données de référence. Les données post-test étaient disponibles pour 16 apprenants dans chaque groupe (WCF et STEP-DWCF-R ; Figure 2). La chronologie de l’étude et les mesures sont présentées à la Figure 3, et le flux de retour de retour de bout en bout est illustré à la Figure 4. Les paramètres exp...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude a comparé le STEP-DWCF-R, un cadre dynamique de rétroaction corrective écrite multi-composantes avec un agent IA robotique, avec un WCF à un seul cycle dans un cours d’écriture IELTS de huit semaines. Le step-dwcf-R a permis de réaliser des gains plus importants avant la post-production de la bande globale et sur TR, CC, LR et GRA. Les apprenants sous STEP-DWCF-R ont également effectué plus de cycles de révision et ont montré une réduction plus rapide des erreurs, les modèles...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs n’ont pas d’intérêts concurrents.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce travail a été financé par une subvention de transition de l’Université Sains de Malaisie, projet n° R501-LR-RND003-0000001342-0000.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Flask (Web Framework)Pallets Projectshttps://flask.palletsprojects.comVersion 2.1; utilisé pour l'interface web de l'agent IA robotique
API GPT-5OpenAIhttps://platform.openai.comModèle gpt-5, température=0,7; pour la génération de retour JSON structuré
Jinja2Pallets Projectshttps://jinja.palletsprojects.comModèles rendus côté serveur pour l'interface web
PythonPython Software Foundationhttps://www.python.orgVersion 3.10; scripting côté serveur
Windows 11Microsofthttps://www.microsoft.com/windowsSystème d'exploitation pour le système de retour IA

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Ing nierieNum ro 233Num ro 233Valeur videNum roR daction en anglaisr troaction corrective crite WCFr troaction corrective crite dynamique DWCFcollaboration humain IAappropriation de la r troactionmod les effets mixtes

Articles connexes