Articolo metodologico

Un Framework Dinamico di Feedback Correttivo Scritto che Integra la Consegna di Agenti AI per un supporto strutturato e iterativo di saggi

DOI:

10.3791/71992

24 luglio 2026

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio confronta il STEP-DWCF-R (Structured, Livered, Evidence-driven Process for Dynamic Written Correctione Feedback with Robotic AI Agent) per migliorare le prestazioni di scrittura IELTS attraverso AI multi-round e revisioni supportate dagli insegnanti.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

I sistemi automatizzati di feedback per la scrittura sono diffusi, ma la maggior parte fornisce commenti statici e frammentati che forniscono un supporto limitato per la revisione. Questo studio valuta il framework STEP-DWCF-R (Structured, Livered, Evidence-driven Process for Dynamic Written Correctione Feedback with Robotic AI Agent), in cui il feedback generato dall'IA, moderato da un insegnante, viene fornito tramite un agente AI robotico attraverso più round iterativi all'interno di un ciclo di lavoro di una settimana. In uno studio quasi-sperimentale di otto settimane, 32 studenti EFL sono stati randomizzati sia per feedback correttivo scritto tradizionale (un round per compito) sia per STEP-DWCF-R. Entrambi i gruppi hanno completato i saggi IELTS Task 2 al basamento e al post-test, che sono stati anonimizzati, randomizzati e valutati da due valutatori indipendenti (ICC = 0,86–0,93). I modelli lineari a effetti misti hanno dimostrato che il gruppo STEP-DWCF-R ha mostrato guadagni significativamente maggiori nel punteggio complessivo delle bande (Δ = 1,03 vs. 0,31 bande) e in tutte e quattro le dimensioni analitiche, con il miglioramento più significativo osservato in Coerenza e Coesione. I dati di processo indicavano che gli studenti STEP-DWCF-R completavano in media 2,26 turni di revisione per compito, con il numero di errori che diminuiva linearmente tra i turni. Questi risultati suggeriscono che il framework integrato STEP-DWCF-R, che comprende feedback generato dall'IA, la moderazione degli insegnanti e la consegna iterativa di agenti AI robotici, è associato a un miglioramento della scrittura IELTS maggiore rispetto al feedback tradizionale a round singolo, indicando applicazioni pratiche per il feedback dinamico potenziato dall'IA nei contesti EFL.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il feedback correttivo scritto (WCF) rimane centrale nella pedagogia della scrittura di L2. Le evidenze mostrano che la WCF completa migliora la precisione degli studenti nel tempo e, quando allineata alla pratica in classe, può coesistere con approcci mirati, possibili in contesti autentici 1,2,3. Studi recenti in classe mostrano progressi duraturi in accuratezza e fluidità grazie a una WCF sostenuta e completa. La ricerca sull'ambito del feedback avverte che gli insegnanti dovrebbero indirizzare le forme in modo strategico invece di puntaretutto a 4,5,6,7,8,9. Parallelamente, la valutazione automatica della scrittura (AWE) e il feedback correttivo scritto automatizzato (AWCF) sono cresciuti rapidamente. I risultati sono contrastanti: alcuni studi mostrano miglioramenti nel rendimento dei compiti e nella gamma grammaticale con programmi in stile AWCF o Criterion, mentre altri non trovano vantaggi significativi rispetto al feedback riservato solo agli insegnanti o annotano revisioni prevalentemente locali e superficiali. Per riflettere questa eterogeneità, triangoliamo deliberatamente tra più studi AWCF invece di affidarci a una singola fonte 10,11,12,13.

Anche le convinzioni degli studenti su chi fornisce feedback sono importanti: un lavoro quasi-sperimentale su una fonte percepita indica che prestazioni e fiducia possono cambiare quando un feedback identico viene inquadrato come "insegnante" contro "automatizzato", sottolineando la necessità di tenere conto degli effetti di percezione nei progetti AWCF14,15. Estendendo questa linea, studi emergenti suggeriscono che i robot educativi, grazie alla loro presenza incarnata, possono anche agire come fornitori di feedback, influenzando potenzialmente il coinvolgimento e la fiducia degli studenti in modiunici 16.

Una linea di ricerca complementare, il feedback correttivo scritto dinamico (DWCF), enfatizza cicli di feedback frequenti, gestibili e completi con codifica e revisioni rapide. Evidenze provenienti da più contesti suggeriscono che il DWCF migliora in modo affidabile l'accuratezza (con effetti sulla frequenza sulla fluidità), anche se i risultati possono variare in base agli obiettivi del corso e alla popolazionedi studenti 17, 18, 19, 20. Infine, i primi studi sul feedback mediato dall'IA generativa riportano parità con il feedback degli insegnanti sui risultati di scrittura e sui potenziali benefici quando abbinati a una guida metalinguistica esplicita, stimolando una maggiore integrazione del feedback umano e AI nei contesti L221,22.

Per affrontare queste sfide, proponiamo il framework STEP-DWCF-R (Structured, Livered, Evidence-driven Process for Dynamic Written Corrective Feedback with Robotic AI Agent), un innovativo sistema di feedback DWCF a più stadi progettato per fornire supporto di scrittura strutturato, iterativo e orientato ai processi. Il nostro sistema sfrutta il potere predittivo e generativo dei Large Language Models (LLM), con la distribuzione tramite un'interfaccia robotica di agenti AI e la moderazione degli insegnanti, per segmentare questioni di scrittura complesse in categorie gestibili, fornire feedback attraverso più round di interazione e valutarne l'efficacia utilizzando sia metriche basate sui risultati che basate sui processi. Trasformando il feedback in un processo strutturato e interattivo, STEP-DWCF-R promuove il supporto automatico della scrittura dalla correzione statica degli errori a un sistema più coinvolgente, integrato e orientato all'apprendimento.

I nostri contributi si concentrano su tre progressi integrati. Innanzitutto, proponiamo uno schema di rappresentazione strutturata del feedback che categorizza gli errori (ad esempio, grammatica, coerenza) in modo che il feedback LLM fornito da agenti tramite IA robotica sia sia applicabile sia pedagogicamente interpretabile. In secondo luogo, introduciamo un processo iterativo a più fasi che sequenzia feedback attraverso linguaggio, struttura e ragionamento su più turni per ridurre il carico cognitivo e approfondire il coinvolgimento. In terzo luogo, estendiamo la valutazione oltre i post-scores includendo metriche orientate al processo come la riduzione degli errori e l'adozione del feedback, offrendo una visione più ricca dell'impatto sull'apprendimento. I framework WCF rappresentano i primi tentativi di sistematizzare il feedback correttivo scritto all'interno della tecnologia educativa. Originati nella Valutazione Automatizzata della Scrittura (AWE) e nella Valutazione Automatica dei Saggi (AES), questi sistemi enfatizzavano il rilevamento degli errori e il punteggio di competenza13,14. Il loro contributo risiede nella scalabilità: migliaia di studenti potrebbero ricevere feedback senza il collo di bottiglia della valutazione umana. Tuttavia, questi quadri fornivano tipicamente commenti statici e frammentati, come controlli grammaticali, suggerimenti lessicali o punteggi globali che gli studenti faticavano a trasformare in revisionisignificative 23,24,25,26.

Col tempo, la ricerca WCF si è evoluta includendo approcci più mediati dalla tecnologia. Questi sistemi più recenti cercavano di cogliere aspetti più ampi della scrittura sfruttando metodicomputazionali 13,21. Più recentemente, il campo si è ulteriormente ampliato con tecnologie incorporate, dove i robot educativi hanno iniziato ad agire come fornitori di feedback in contesti scritti o di tutoraggio. La loro presenza fisica e le possibilità interattive introducono nuove dinamiche di fiducia, coinvolgimento e motivazione degli apprendisti. Eppure, nonostante questi sviluppi, l'orientamento dominante della WCF è rimasto focalizzatosull'esito 8,27: produrre punteggi o commenti isolati in modo one-shot. Pedagogicamente, questo orientamento è disallineato con la valutazione formativa, dove il feedback dovrebbe accompagnare la revisione attraverso le bozze e supportare il coinvolgimento metacognitivo 16,28,29,30,31. Così, il confine concettuale della WCF rivela un divario duraturo: il feedback viene fornito, ma non strutturato o sequenziato per guidare i processi di apprendimento.

In risposta a queste limitazioni, gli studiosi hanno iniziato a esplorare approcci più dinamici alla scrittura dei feedback. Le prime indagini hanno evidenziato l'importanza dei cicli di feedback iterativi, in cui gli studenti rivedono più volte sotto una guidastrutturata 17,32. È stata inoltre proposta una categorizzazione strutturata degli errori per migliorare l'interpretabilità del feedback e allinearla agli obiettivipedagogici 33,34. La nozione di framework DWCF consolida queste direzioni incorporando tre principi di progettazione: schemi di errore espliciti, consegna a stadi e iterativa, e metriche di valutazione orientate alprocesso 19,35. Invece di sopraffare gli studenti con una massa di correzioni contemporaneamente, DWCF distribuisce l'attenzione su strati di scrittura—accuratezza superficiale, coerenza strutturale e profondità argomentativa—attraverso i turnisuccessivi 17,33. La valutazione si estende oltre i punteggi finali includendo indicatori di processo come tassi di riduzione degli errori, adozione del feedback e profondità dellerevisioni 10, 19, 25. Nonostante il suo potenziale, le applicazioni pratiche della DWCF restano scarse, e la maggior parte degli studi non la mette in pratica in contesti su larga scala, mediati dalla tecnologia. 10,36,37. Questa lacuna evidenzia la necessità di quadri che non solo teorizzino la DWCF, ma ne dimostrino anche la fattibilità in contesti educativi reali. La Figura 1 mostra il quadro teorico più ampio della DWCF proposto nella letteratura. La figura fornisce una motivazione generale su come il feedback correttivo scritto dinamico possa operare a più livelli, includendo sia gli esiti misurati (ad esempio, accuratezza, coerenza) sia i costrutti teorizzati ma non misurati nel presente studio (ad esempio, riduzione dell'ansia nella scrittura, fluidità e complessità). È incluso per orientamento teorico piuttosto che come modello diretto di questo saggio. Gli elementi corrispondenti ai risultati e alle metriche di processo qui analizzate sono indicati nella figura; Altri percorsi sono illustrativi e non sono stati valutati in questo studio.

L'emergere degli LLM e dei sistemi multimodali offre un potente mezzo per operazionalizzare il DWCF su larga scala. Gli LLM, con le loro capacità zero-shot e few-shot, possono generare feedback contestualmente sensibili senza addestramento specifico percompito 21,22. Esperimenti recenti suggeriscono il loro potenziale per la segmentazione direttiva, il raffinamento a stadi e la generazione di spiegazioni, che sono strettamente allineati ai principi del DWCF 13,37,38,39. Ricerche complementari nella collaborazione umano-IA hanno dimostrato che i cicli iterativi di coinvolgimento, adattamento e adozione selettiva del feedback dell'IA possono migliorare sia la qualità dell'adozione che dellarevisione 25,30. Quando questi processi sono incarnati dai robot, l'interazione ha il potenziale teorico di diventare multimodale—combinando gesto, voce e presenza—il che può ulteriormente migliorare la percezione e la motivazione dellostudente 40.

Basati sulla Zona di Sviluppo Prossimale (ZPD)41, sull'Ipotesidell'Input 42 e sulla Teoria dell'Acquisizionedelle Competenze 43, posizionaamo STEP-DWCF-R come un controller che collega il supporto dello studente, l'elaborazione degli input e lo sviluppo delle competenze. Concretamente, la listazione collegata a rubriche, le liste consolidate tempestive e i cicli di IA, umani e robotici a più round moderati dall'insegnante operano a uno strato di integrazione che media la revisione e produce gli endpoint osservabili qui analizzati (IELTS Overall e TR/CC/LR/GRA; round, rilevamento, errori persistenti, tempo). Costrutti come la riduzione dell'ansia da scrittura sono teorizzati ma non misurati in questo studio.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo protocollo è stato approvato dal Comitato Etico della Scuola di Educazione Primaria, Shangrao Preschool Education College. Tutti i partecipanti erano adulti (≥18 anni) e avevano fornito un consenso informato scritto prima dello studio.

1. Progettazione dello studio

NOTA: A causa dei vincoli della classe di EFL disponibile (iscrizione totale N = 32), i partecipanti sono stati randomizzati in due gruppi da 16 ciascuno. Questa dimensione del campione, sebbene modesta, è stata ritenuta sufficiente per un'indagine pilota dato il pre-post design all'interno del soggetto e le grandi dimensioni d'effetto previste basate su studi DWCFprecedenti 17,18,19,20.

  1. Randomizzare i partecipanti in due gruppi (n = 16 ciascuno) usando una semplice randomizzazione. Genera la sequenza di allocazione utilizzando una lista di numeri casuali generata al computer. Nascondere l'assegnazione all'istruttore fino al completamento della valutazione di base.
  2. Assicurati che entrambi i gruppi siano insegnati dallo stesso docente utilizzando materiali identici e ore di contatto.
  3. Fornire feedback tramite correzione umana diretta (WCF) o tramite il flusso di lavoro STEP-DWCF-R, dove il feedback di IA e insegnanti viene presentato tramite un agente AI robotico.

2. Compiti di scrittura

  1. Somministrare un saggio di base per il Compito 2 IELTS nella Settimana 1 in condizioni d'esame (≥250 parole, 40 min).
  2. Svolgere sei compiti settimanali di scrittura (Settimane 2–7). Per ogni compito:
    1. In WCF, fornisci un solo round di feedback umano sul saggio.
    2. Nel STEP-DWCF-R, genera feedback dell'IA, moderalo con un insegnante umano e istrui l'agente AI robotico a presentare il feedback in modo interattivo allo studente.
    3. Nel STEP-DWCF-R, si ripete il ciclo di feedback STEP-DWCF-R per 2–3 round fino al completamento della revisione.
  3. Somministra un saggio post-test IELTS Task 2 nella settimana 8 alle stesse condizioni dell'esame. Segui lo stesso calendario settimanale per ogni compito in entrambi i gruppi. Fornire feedback del Round 1 entro 24 ore dalla bozza di invio nel STEP-DWCF-R. Richiedere agli studenti di rivedere e ripresentare entro 48 ore. Segui lo stesso programma per i round successivi e completa tutti i cicli entro la finestra settimanale.

3. Flusso di lavoro di feedback

  1. Elaborare ogni bozza di studente con l'API GPT-5 (modello = "gpt-5", temperatura = 0,7, max_output_tokens = 2048) per generare feedback dettagliati in quattro categorie fisse: Grammatica, Vocabolario, Organizzazione e Ragionamento. Il prompt di sistema esatto e lo schema di output JSON sono forniti nel repository open-source (https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback/blob/main/evaluate.py, funzione build_prompt() e normalize_reasoning()).
  2. Moderare il feedback generato dall'IA secondo i seguenti criteri: rimuovere falsi positivi o commenti inaccurati; aggiungere questioni critiche trascurate in linea con la rubrica IELTS; assicurati che i commenti siano concreti e incoraggianti; e mantenere la coerenza con lo schema a quattro categorie. Registra manualmente le decisioni di moderazione.
  3. Salva il feedback moderato in formato JSON e caricalo sull'interfaccia dell'agente AI robotico (un'applicazione web leggera di Flask).
  4. Presenta feedback tramite l'interfaccia web. Visualizza tabelle strutturate per ogni categoria (riassunto, problemi e consigli per la revisione). Registra i ricevimenti e le richieste di chiarimenti degli studenti tramite i log di sistema. Istruisci gli studenti a rivedere e ripresentare le loro bozze. Ripeti il ciclo fino a tre volte per compito.
  5. Verifica e risoluzione dei problemi.
    1. Verifica la generazione di feedback con successo dell'IA confermando che l'output sia JSON valido contenente tutte e quattro le categorie richieste: Grammatica, Vocabolario, Organizzazione e Ragionamento. Conferma il completamento della moderazione degli insegnanti assicurandoti che i falsi positivi siano stati rimossi, che siano stati aggiunti i problemi mancanti e che il file JSON moderato sia stato salvato.
    2. Carica il file JSON moderato sull'interfaccia dell'agente AI robotico basato su Flask tramite l'endpoint di upload. Conferma il caricamento riuscito tramite il messaggio di conferma dell'interfaccia e la voce del registro del database. Registra automaticamente le ripresentazioni degli studenti tramite i registri di invio dei moduli.
    3. Processare output IA non conformi (ad esempio, JSON malformato, categorie mancanti o feedback impreciso) utilizzando le funzioni ensure_json() e normalize_reasoning(). Rigenerare l'output API con parametri di prompt modificati secondo necessità. Correggi manualmente il JSON durante la moderazione dell'insegnante, se necessario, per assicurarti che tutte e quattro le categorie siano presenti prima del carico.
      NOTA: Esempi di feedback grezzo dell'IA, versioni moderate dall'insegnante e l'output dell'interfaccia consegnata sono disponibili nel repository (dati/cartelle e quaderni/).

4. Misurazione degli Esiti

  1. Definisci l'esito primario come la variazione del punteggio complessivo della fascia IELTS (dalla Settimana 1 alla Settimana 8).
  2. Definire gli esiti secondari come cambiamenti nella Risposta al Compito, Coerenza e Coesione, Risorsa Lessicale e Gamma e Accuratezza Gramaticale.
  3. Assegna due valutatori indipendenti con esperienza nella valutazione del Compito 2 IELTS per valutare tutti i saggi. Rimuovi nomi e identificatori di gruppo da tutti i saggi. Randomizza l'ordine dei saggi e valutatori alla cieca per compiti di gruppo e tempi. Usa lo stesso prompt del Compito 2 IELTS sia per la base della settimana 1 che per la settimana 8 post-test. Risolvere i disaccordi di punteggio superiore a 0,5 bande attraverso la discussione fino a raggiungere il consenso. Valutare l'affidabilità inter-valutatori utilizzando il coefficiente di correlazione intraclasse delle misure medie (ICC[2,2]).

5. Misurazione del processo

  1. Registra il numero di turni di revisione per compito.
  2. Registrazione dell'acquisizione dei feedback (adottati, modificati, rifiutati) da parte degli studenti.
  3. Monitorare gli errori persistenti tra un ciclo e l'altro.
  4. Annota il tempo di feedback dell'insegnante, il tempo di consegna del robot e il tempo di revisione dello studente.

6. Analisi dei Dati

  1. Adattare i modelli di effetti misti lineari con interazioni Gruppo, Tempo e Gruppo × Tempo.
  2. Applicare modelli generalizzati a effetti misti per le misure di processo.
  3. Riportate le dimensioni degli effetti, gli intervalli di confidenza al 95% e i valori p corretti.
  4. Effettuare controlli di robustezza con ANCOVA, modelli specifici per valutatori e SE robusti.

7. Disponibilità del codice

Tutto il codice, i prompt, gli schemi JSON e i file di implementazione di esempio necessari per riprodurre il sistema STEP-DWCF-R sono disponibili apertamente su https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esperimenti e analisi

Tutti e 32 gli studenti hanno fornito dati di base. I dati post-test erano disponibili per 16 studenti in ciascun gruppo (WCF e STEP-DWCF-R; Figura 2). La timeline e le misure dello studio sono presentate nella Figura 3, e il flusso di lavoro di feedback end-to-end è illustrato nella Figura 4. I parametri sperimentali di configurazio...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio ha confrontato STEP-DWCF-R, un framework di feedback correttivo scritto dinamico multicomponente, con un agente AI robotico, con WCF a round singolo in un corso di scrittura IELTS di otto settimane. Il STEP-DWCF-R ha prodotto maggiori guadagni pre-post nella fascia complessiva e tra TR, CC, LR e GRA. Anche gli studenti con STEP-DWCF-R hanno completato più turni di revisione e mostrato una riduzione degli errori più rapida, con modelli che stimavano un calo di circa 4,1 erro...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori non hanno interessi in conflitto.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo lavoro è stato finanziato da una Universiti Sains Malaysia Bridging Grant, Progetto N: R501-LR-RND003-0000001342-0000.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
Flask (Web Framework)Pallets Projectshttps://flask.palletsprojects.comVersione 2.1; utilizzato per l'interfaccia web dell'agente AI robotico
API GPT-5OpenAIhttps://platform.openai.comModello gpt-5, temperatura=0.7; per la generazione di feedback JSON strutturati
Jinja2Pallets Projectshttps://jinja.palletsprojects.comModelli server-renderizzati per l'interfaccia web
PythonPython Software Foundationhttps://www.python.orgVersione 3.10; scripting del backend
Windows 11Microsofthttps://www.microsoft.com/windowsSistema operativo per il sistema di feedback AI

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

IngegneriaNumero 233Numero 233Valore VuotoNumeroscrittura in inglesefeedback correttivo scritto WCFfeedback correttivo scritto dinamico DWCFcollaborazione uomo IAacquisizione del feedbackmodelli a effetti misti

Articoli correlati