Methodenartikel

Een dynamisch schriftelijk corrigerende feedbackkader dat AI-agentlevering integreert voor gestructureerde en iteratieve essayondersteuning

DOI:

10.3791/71992

24 juli 2026

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie meet STEP-DWCF-R (Structured, Tiered, Evidence-driven Process for Dynamic Written Corrective Feedback with Robotic AI Agent) om de schrijfprestaties van IELTS te verbeteren door middel van meerronde AI en door docenten ondersteunde revisies.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Geautomatiseerde feedbacksystemen voor schrijven zijn wijdverbreid, maar de meeste leveren statische, gefragmenteerde opmerkingen die beperkte ondersteuning bieden voor revisie. Deze studie evalueert het STEP-DWCF-R-raamwerk (Structured, Tiered, Evidence-driven Process for Dynamic Written Corrective Feedback with Robotic AI Agent), waarbij AI-gegenereerde feedback, gemodereerd door een docent, via een robotische AI-agent wordt gegeven over meerdere iteratieve rondes binnen een taakcyclus van een week. In een acht weken durende quasi-experimentele studie werden 32 EFL-leerlingen gerandomiseerd naar ofwel traditionele schriftelijke corrigerende feedback (één ronde per taak) of STEP-DWCF-R. Beide groepen voltooiden IELTS Task 2-essays aan de basis en na de test, die werden geanonimiseerd, gerandomiseerd en gescoord door twee onafhankelijke beoordelaars (ICC = 0,86–0,93). Lineaire mixed-effects modellen toonden aan dat de STEP-DWCF-R groep significant grotere winsten vertoonde in de totale bandscore (Δ = 1,03 versus 0,31 banden) en over alle vier de analytische dimensies, met de grootste verbetering in coherentie en cohesie. Procesgegevens gaven aan dat STEP-DWCF-R-leerlingen gemiddeld 2,26 revisierondes per taak voltooiden, waarbij het aantal fouten lineair afnam over de rondes. Deze bevindingen suggereren dat het geïntegreerde STEP-DWCF-R-raamwerk, dat AI-gegenereerde feedback, lerarenmoderatie en iteratieve robotische AI-agentenlevering omvat, geassocieerd is met een grotere verbetering in IELTS-schrijven dan traditionele feedback in één ronde, wat wijst op praktische toepassingen voor AI-verbeterde dynamische feedback in EFL-contexten.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Schriftelijke corrigerende feedback (WCF) blijft centraal in de L2-schrijfdidactiek. Bewijs toont aan dat uitgebreide WCF de nauwkeurigheid van leerlingen in de loop van de tijd verbetert en, wanneer het in lijn is met de praktijk in de klas, kan samengaan met gerichte benaderingen die haalbaar zijn in authentieke contexten 1,2,3. Recente klasstudies tonen blijvende verbeteringen in nauwkeurigheid en vloeiendheid door aanhoudende, uitgebreide WCF. Onderzoek naar feedbackscope waarschuwt dat leraren formulieren strategisch moeten aanpakken in plaats van alles te markerenals 4,5,6,7,8,9. Tegelijkertijd zijn geautomatiseerde schrijfevaluatie (AWE) en geautomatiseerde schriftelijke corrigerende feedback (AWCF) snel gegroeid. De bevindingen zijn gemengd: sommige studies tonen verbeteringen in taakprestaties en grammaticaal bereik met AWCF- of Criterion-achtige programma's, terwijl andere geen significant voordeel vinden ten opzichte van feedback alleen van leraren of grotendeels lokale, oppervlakkige herzieningen noteren. Om deze heterogeniteit te weerspiegelen, trianguleren we bewust over meerdere AWCF-studies in plaats van te leunen op één enkele bron 10,11,12,13.

De overtuigingen van leerlingen over wie feedback geeft is ook belangrijk: quasi-experimenteel werk aan waargenomen bron geeft aan dat prestaties en vertrouwen kunnen verschuiven wanneer identieke feedback wordt gepresenteerd als "leraar" versus "geautomatiseerd", wat de noodzaak onderstreept om rekening te houden met perceptie-effecten in AWCF-ontwerpen14,15. Voortzettend op deze lijn suggereren nieuwe studies dat onderwijsrobots, vanwege hun belichaamde aanwezigheid, ook als feedbackaanbieders kunnen fungeren, wat mogelijk de betrokkenheid en het vertrouwen van leerlingen op unieke manieren kan beïnvloeden16.

Een aanvullende onderzoekslijn, dynamische schriftelijke corrigerende feedback (DWCF), legt de nadruk op frequente, beheersbare en uitgebreide feedbackcycli met codering en snelle revisie. Bewijs uit meerdere settings suggereert dat DWCF de nauwkeurigheid betrouwbaar verbetert (met frequentie-effecten op vloeiendheid), hoewel de resultaten kunnen variëren per cursusdoel en leerlingpopulatie 17,18,19,20. Ten slotte rapporteren vroege studies naar generatief-AI-gemedieerde feedback gelijkheid met feedback van leraren over schrijfresultaten en potentiële voordelen in combinatie met expliciete metalinguïstische begeleiding, wat motiveert tot nauwere integratie van menselijke en AI-feedback in L2-contexten21,22.

Om deze uitdagingen aan te pakken, stellen we het STEP-DWCF-R (Structured, Tiered, Evidence-driven Process for Dynamic Written Corrective Feedback with Robotic AI Agent) framework voor, een nieuw meerfasig DWCF-feedbacksysteem dat is ontworpen om gestructureerde, iteratieve en procesgerichte schrijfondersteuning te bieden. Ons systeem maakt gebruik van de voorspellende en generatieve kracht van Large Language Models (LLM's), met levering via een robotische AI-agentinterface en lerarenmoderatie, om complexe schrijfproblemen in beheersbare categorieën te segmenteren, feedback te geven via meerdere interactierondes en de effectiviteit te evalueren met zowel resultaat- als procesgebaseerde meetmethoden. Door feedback om te zetten in een gestructureerd en interactief proces, bevordert STEP-DWCF-R geautomatiseerde schrijfondersteuning van statische foutcorrectie naar een meer boeiend, belichaamd en leergericht systeem.

Onze bijdragen draaien om drie geïntegreerde vooruitgangen. Ten eerste stellen we een gestructureerd feedbackrepresentatieschema voor dat fouten categoriseert (bijv. grammatica, coherentie), zodat robotische AI-feedback van agent-geleverde LLM's zowel uitvoerbaar als pedagogisch interpreteerbaar is. Ten tweede introduceren we een iteratief meerfasenproces dat feedback over taal, structuur en redenering over meerdere rondes heen rijdt om de cognitieve belasting te verminderen en de betrokkenheid te verdiepen. Ten derde breiden we evaluatie uit voorbij post-scores en omvatten procesgerichte meetwaarden zoals foutvermindering en feedbackacceptatie, waardoor we een rijker beeld van de impact van leren bieden. WCF-kaders vormen de vroegste pogingen om schriftelijke corrigerende feedback binnen onderwijstechnologie te systematiseren. Deze systemen zijn oorspronkelijk in Automated Writing Evaluation (AWE) en Automated Essay Scoring (AES) en legden de nadruk op foutdetectie en vaardigheidsscore13,14. Hun bijdrage ligt in schaalbaarheid: duizenden leerlingen zouden feedback kunnen ontvangen zonder de bottleneck van menselijke beoordeling. Deze kaders boden echter doorgaans statische en gefragmenteerde opmerkingen, zoals grammaticale controles, lexicale suggesties of globale scores die leerlingen moeilijk konden omzetten in betekenisvolle revisies 23,24,25,26.

In de loop der tijd evolueerde het WCF-onderzoek met meer technologie-gemedieerde benaderingen. Deze nieuwere systemen probeerden bredere aspecten van schrijven te vangen door gebruik te maken van computationele methoden13,21. Meer recentelijk is de reikwijdte verder uitgebreid met belichaamde technologieën, waarbij educatieve robots zijn gaan fungeren als feedbackaanbieders in schrijf- of bijlescontexten. Hun fysieke aanwezigheid en interactieve mogelijkheden introduceren nieuwe dynamieken van vertrouwen, betrokkenheid en leerlingmotivatie. Toch is ondanks deze ontwikkelingen de dominante richting van WCF uitkomstgericht gebleven 8,27: het produceren van scores of geïsoleerde opmerkingen in één korte volgorde. Pedagogisch gezien is deze oriëntatie niet op lijn met formatieve beoordeling, waarbij feedback revisie over concepten zou moeten ondersteunen en metacognitieve betrokkenheid zou moeten ondersteunen 16,28,29,30,31. Zo onthult de conceptuele grens van WCF een blijvende kloof: feedback wordt gegeven, maar niet gestructureerd of gestructureerd om leerprocessen te sturen.

Als reactie op deze beperkingen zijn wetenschappers begonnen met het verkennen van dynamischere benaderingen van het schrijven van feedback. Vroege onderzoeken benadrukten het belang van iteratieve feedbackcycli, waarbij leerlingen meerdere keren herhalen onder gestructureerde richtlijnen17,32. Gestructureerde foutcategorisering is ook voorgesteld om de interpreteerbaarheid van feedback te verbeteren en deze af te stemmen op pedagogische doelstellingen33,34. Het begrip DWCF-framework consolideert deze richtingen door drie ontwerpprincipes in te bettelen: expliciete foutschema's, gefaseerde en iteratieve levering, en procesgerichte evaluatiemetrieken19,35. In plaats van studenten te overweldigen met een massa correcties in één keer, verdeelt DWCF de aandacht over lagen van schrijven—oppervlakkige nauwkeurigheid, structurele samenhang en argumentatieve diepgang—via opeenvolgende rondes17,33. De evaluatie strekt zich uit voorbij de eindscores en omvat procesindicatoren zoals foutreductiepercentages, feedbackacceptatie en revisiediepte 10,19,25. Ondanks de belofte blijven de praktische toepassingen van DWCF schaars, en de meeste studies schieten niet in om het operationeel te maken in grootschalige, technologie-gemedieerde contexten 10,36,37. Deze kloof benadrukt de noodzaak van kaders die niet alleen DWCF theoretiseren, maar ook de haalbaarheid ervan in echte onderwijsomgevingen aantonen. Figuur 1 toont het bredere theoretische kader van DWCF dat in de literatuur wordt voorgesteld. De figuur geeft een algemene verklaring voor hoe dynamische schriftelijke corrigerende feedback op meerdere niveaus kan werken, inclusief zowel gemeten uitkomsten (bijv. nauwkeurigheid, coherentie) als getheoretiseerde maar niet-gemeten constructies in de huidige studie (bijv. vermindering van schrijfangst, vloeiendheid en complexiteit). Het is opgenomen voor theoretische oriëntatie en niet als direct model van deze proef. Elementen die overeenkomen met de hier geanalyseerde uitkomsten en procesmetrieken zijn in de figuur weergegeven; Andere routes zijn illustratief en werden in deze studie niet geëvalueerd.

De opkomst van LLM's en multimodale systemen biedt een krachtig middel om DWCF op grote schaal operationeel te maken. LLM's, met hun zero-shot en few-shot mogelijkheden, kunnen contextgevoelige feedback genereren zonder taakspecifieke training21,22. Recente experimenten suggereren hun potentieel voor directieve segmentatie, gefaseerde verfijning en het genereren van verklaringen, die nauw aansluiten bij de principes van DWCF 13,37,38,39. Complementair onderzoek naar samenwerking tussen mens en AI heeft aangetoond dat iteratieve loops van het omgaan met, aanpassen en selectief adopteren van AI-feedback zowel de opname als de revisiekwaliteit kunnen verbeteren25,30. Wanneer deze processen via robots worden belichaamd, heeft de interactie theoretisch het potentieel om multimodaal te worden—waarbij gebaar, stem en aanwezigheid worden gecombineerd—wat de perceptie en motivatie van de leerling verder kan versterken.

Geworteld in de Zone van Proximale Ontwikkeling (ZPD)41, de Input Hypothesis42 en de Skill AcquisitionTheory 43, positioneren we STEP-DWCF-R als een controller die lerenondersteuning, inputverwerking en vaardigheidsontwikkeling verbindt. Concreet werken rubric-linked itemization, tijdige geconsolideerde lijsten en meerronde-door leraren gemodereerde AI-, mens- en robotcycli op een integratielaag die revisie bemiddelt en de hier geanalyseerde observeerbare eindpunten oplevert (IELTS Overall en TR/CC/LR/GRA; rondes, opname, persistente fouten, tijd). Constructies zoals het verminderen van schrijfangst worden in deze proef getheoretiseerd, maar niet gemeten.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit protocol werd goedgekeurd door de Ethische Commissie van de School voor Basisonderwijs, Shangrao Preschool Education College. Alle deelnemers waren volwassenen (≥18 jaar) en gaven schriftelijke geïnformeerde toestemming voorafgaand aan het onderzoek.

1. Studieontwerp

OPMERKING: Vanwege de beperkingen van het beschikbare EFL-klaslokaal (totaal aantal leerlingen N = 32) werden deelnemers gerandomiseerd in twee groepen van elk 16. Deze steekproefgrootte, hoewel bescheiden, werd als voldoende beschouwd voor een pilotonderzoek gezien het pre-post ontwerp binnen het onderwerp en de verwachte grote effectgroottes op basis van eerdere DWCF-studies 17,18,19,20.

  1. Randomiseer deelnemers in twee groepen (n = 16 elk) met behulp van eenvoudige randomisatie. Genereer de allocatievolgorde met behulp van een computergegenereerde willekeurige nummerlijst. Houd de toewijzing geheim voor de instructeur totdat de basisbeoordeling is afgerond.
  2. Zorg ervoor dat beide groepen door dezelfde instructeur worden onderwezen, met identieke materialen en contacturen.
  3. Geef feedback via directe menselijke correctie (WCF) of via de STEP-DWCF-R workflow, waarbij AI en feedback van docenten worden gepresenteerd via een robotische AI-agent.

2. Schrijfopdrachten

  1. Administreer een basisessay voor IELTS Taak 2 in week 1 onder examenomstandigheden (≥250 woorden, 40 min).
  2. Voer zes wekelijkse schrijfopdrachten uit (weken 2–7). Voor elke taak:
    1. Geef in WCF één ronde menselijke feedback op het essay.
    2. In STEP-DWCF-R genereer je AI-feedback, modereer je deze met een menselijke docent en geef je de robotische AI-agent de instructie om de feedback interactief aan de leerling te presenteren.
    3. In STEP-DWCF-R herhaal je de STEP-DWCF-R feedbackcyclus voor 2–3 rondes totdat de revisie voltooid is.
  3. Administreer een IELTS Taak 2-essay na de toets in week 8 onder dezelfde examenvoorwaarden. Volg dezelfde eenweekse kalender voor elke taak in beide groepen. Geef feedback van Ronde 1 binnen 24 uur na het indienen van het concept in STEP-DWCF-R. Verplicht leerlingen om binnen 48 uur te herzien en opnieuw in te dienen. Volg hetzelfde schema voor volgende rondes en voltooi alle cycli binnen het wekelijkse venster.

3. Feedbackworkflow

  1. Verwerk elk concept van de leerling met de GPT-5 API (model = "gpt-5", temperatuur = 0,7, max_output_tokens = 2048) om gespecificeerde feedback te genereren over vier vaste categorieën: grammatica, woordenschat, organisatie en redenering. De exacte systeemprompt en het JSON-uitvoerschema worden geleverd in de open-source repository (https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback/blob/main/evaluate.py, functie build_prompt() en normalize_reasoning()).
  2. Matig de door AI gegenereerde feedback volgens de volgende criteria: verwijder valse positieven of onjuiste opmerkingen; voeg gemiste kritieke kwesties toe die aansluiten bij de IELTS-rubriek; ervoor te zorgen dat de opmerkingen bruikbaar en bemoedigend zijn; en handhaaf consistentie met het vier-categorie schema. Registreer moderatiebeslissingen handmatig.
  3. Sla de gemodereerde feedback op in JSON-formaat en upload deze naar de robotic AI agent interface (een lichtgewicht Flask-webapplicatie).
  4. Geef feedback via de webinterface. Toon gestructureerde tabellen voor elke categorie (samenvatting, uitgaven en revisietips). Registreer bevestigingen en verduidelijkingsverzoeken van leerlingen via systeemlogboeken. Instructeer leerlingen om hun concepten te herzien en opnieuw in te dienen. Herhaal de cyclus tot drie keer per taak.
  5. Verificatie en probleemoplossing.
    1. Verifieer succesvolle AI-feedbackgeneratie door te bevestigen dat de output een geldig JSON is, inclusief alle vier de vereiste categorieën: grammatica, woordenschat, organisatie en redenering. Bevestig het voltooien van de moderatie van de leraar door ervoor te zorgen dat vals-positieven zijn verwijderd, ontbrekende problemen zijn toegevoegd en het gemodereerde JSON-bestand is opgeslagen.
    2. Upload het gemodereerde JSON-bestand via het upload-endpoint naar de Flask-gebaseerde robotische AI-agentinterface. Bevestig succesvolle upload via het bevestigingsbericht van de interface en de databaselogboekinvoer. Registreer automatisch herindieningen van leerlingen via formulierinleverlogboeken.
    3. Verwerk niet-conforme AI-uitvoer (bijv. misvormde JSON, ontbrekende categorieën of onnauwkeurige feedback) met behulp van de ensure_json() en normalize_reasoning()-functies. Regenereer de API-uitvoer met aangepaste promptparameters indien nodig. Corrigeer de JSON handmatig tijdens de moderatie van de docent, indien nodig, om ervoor te zorgen dat alle vier de categorieën aanwezig zijn vóór upload.
      OPMERKING: Voorbeelden van ruwe AI-feedback, door de docent gemodereerde versies en de geleverde interface-output zijn beschikbaar in de repository (data/map en notitieboeken/).

4. Uitkomstmeting

  1. Definieer het primaire resultaat als de verandering in de IELTS totale bandscore (week 1 tot week 8).
  2. Definieer secundaire uitkomsten als veranderingen in Taakrespons, Coherentie en Cohesie, Lexicale Bron, en Grammaticale Reikwijdte en Nauwkeurigheid.
  3. Wijs twee onafhankelijke beoordelaars met ervaring in IELTS Taak 2 beoordeling toe om alle essays te beoordelen. Verwijder namen en groepsidentificaties uit alle essays. Randomiseer de essayvolgorde en blind beoordelaars naar groepsopdracht en tijdstip. Gebruik dezelfde IELTS Taak 2-prompt voor zowel de Week 1 baseline als de week 8 post-test. Los het scoren van meningsverschillen groter dan 0,5 banden op via discussie totdat consensus is bereikt. Beoordeel de betrouwbaarheid van inter-raters met behulp van de gemiddelde metingen intraclass correlatiecoëfficiënt (ICC[2,2]).

5. Procesmeting

  1. Noteer het aantal revisierondes per taak.
  2. Recordopname van feedback (aangenomen, gewijzigd, afgewezen) door leerlingen.
  3. Houd persistente fouten bij tussen cycli.
  4. Noteer feedback van de leraar, de tijd voor de robotlevering en de tijd voor het herhalen van de leerling.

6. Data-analyse

  1. Pas lineaire mixed-effects modellen aan met interactie tussen Groep, Tijd en Groep × Tijd.
  2. Pas gegeneraliseerde mixed-effects modellen toe voor procesmaten.
  3. Rapporteffectgroottes, 95% betrouwbaarheidsintervallen en aangepaste p-waarden.
  4. Voer robuustheidscontroles uit met ANCOVA, rater-specifieke modellen en robuuste SE's.

7. Codebeschikbaarheid

Alle code, prompts, JSON-schema's en voorbeeldimplementatiebestanden die nodig zijn om het STEP-DWCF-R-systeem te reproduceren, zijn open beschikbaar op https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Experimenten en Analyse

Alle 32 leerlingen leverden basisgegevens. Na de test waren gegevens beschikbaar voor 16 leerlingen in elke groep (WCF en STEP-DWCF-R; Figuur 2). De studietijdlijn en de metingen worden weergegeven in Figuur 3, en de end-to-end feedbackworkflow is geïllustreerd in Figuur 4. Experimentele opzet- en implementatieparameters voor ons A...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie vergeleek STEP-DWCF-R, een multicomponent dynamisch schriftelijk corrigerende feedbackframework met een robotic AI-agent, met een enkelronde WCF in een acht weken durende IELTS-schrijfcursus. STEP-DWCF-R leverde grotere pre-post winsten op in de totale band en over TR, CC, LR en GRA. Leerlingen onder STEP-DWCF-R voltooiden ook meer revisierondes en vertoonden snellere foutvermindering, waarbij modellen een daling van ongeveer 4,1 fouten per ronde schatten. De grootste verbete...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs hebben geen concurrerende belangen.

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit werk werd gefinancierd door een Universiti Sains Malaysia Bridging Grant, projectnr: R501-LR-RND003-0000001342-00000.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
Flask (Web Framework)Pallets Projectshttps://flask.palletsprojects.comVersie 2.1; gebruikt voor webinterface van robotische AI-agent
GPT-5 APIOpenAIhttps://platform.openai.comModel gpt-5, temperatuur=0,7; voor gestructureerde JSON-feedbackgeneratie
Jinja2Pallets Projectshttps://jinja.palletsprojects.comServer-rendered templates voor webinterface
PythonPython Software Foundationhttps://www.python.orgVersie 3.10; backend-scripting
Windows 11Microsofthttps://www.microsoft.com/windowsBesturingssysteem voor AI-feedbacksysteem

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

TechniekEditie 233Editie 233Lege waardeEditieEngels schrijvenschriftelijke correctieve feedback WCFdynamische schriftelijke correctieve feedback DWCFmens AI collaboratiefeedbackopnamemixed effects modellen

Gerelateerde artikelen