Artigo de método

Uma Estrutura Dinâmica de Feedback Corretivo Escrito Integrando a Entrega de Agentes de IA para suporte estruturado e iterativo de redações

DOI:

10.3791/71992

24 de julho de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo avalia o STEP-DWCF-R (Processo Estruturado, Escalonado, Orientado por Evidências para Feedback Corretivo Escrito Dinâmico com Agente Robótico de IA) para melhorar o desempenho na redação do IELTS por meio de IA em múltiplas rodadas e revisões apoiadas pelo professor.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Sistemas automatizados de feedback de escrita são comuns, mas a maioria entrega comentários estáticos e fragmentados que fornecem uma estrutura limitada para revisão. Este estudo avalia o framework STEP-DWCF-R (Processo Estruturado, Escalonado, Orientado por Evidências para Feedback Corretivo Escrito Dinâmico com Agente Robótico de IA), no qual o feedback gerado por IA, moderado por um professor, é entregue por meio de um agente robótico de IA em várias rodadas iterativas em um ciclo de tarefas de uma semana. Em um ensaio quase-experimental de oito semanas, 32 aprendizes de EFL foram randomizados para feedback corretivo tradicional escrito (uma rodada por tarefa) ou STEP-DWCF-R. Ambos os grupos completaram redações da Tarefa 2 do IELTS no início e no pós-teste, que foram anonimizadas, randomizadas e pontuadas por dois avaliadores independentes (ICC = 0,86–0,93). Modelos lineares de efeitos mistos demonstraram que o grupo STEP-DWCF-R apresentou ganhos significativamente maiores na pontuação geral de bandas (Δ = 1,03 vs. 0,31 bandas) e em todas as quatro dimensões analíticas, com a maior melhora observada em Coerência e Coesão. Dados de processo indicaram que os aprendizes do STEP-DWCF-R completaram em média 2,26 rodadas de revisão por tarefa, com a contagem de erros diminuindo linearmente entre rodadas. Esses achados sugerem que o framework integrado STEP-DWCF-R, que abrange feedback gerado por IA, moderação de professores e entrega iterativa de agentes robóticos de IA, está associado a uma maior melhoria na escrita do IELTS do que o feedback tradicional de rodada única, apontando para aplicações práticas para feedback dinâmico aprimorado por IA em contextos de EFL.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O feedback corretivo escrito (WCF) permanece central na pedagogia da escrita L2. Evidências mostram que a WCF abrangente melhora a precisão dos alunos ao longo do tempo e, quando alinhada com a prática em sala de aula, pode coexistir com abordagens focadas que são viáveis em contextos autênticos 1,2,3. Estudos recentes em sala de aula mostram ganhos duradouros em precisão e fluência a partir de WCF sustentada e abrangente. Pesquisas sobre o escopo do feedback alertam que os professores devem focar as formas estrategicamente em vez de marcartudo como 4,5,6,7,8,9. Paralelamente, a avaliação automatizada de escrita (AWE) e o feedback corretivo escrito automatizado (AWCF) cresceram rapidamente. Os resultados são mistos: alguns estudos mostram ganhos no desempenho das tarefas e na amplitude gramatical com programas do estilo AWCF ou Criterion, enquanto outros não encontram vantagem significativa sobre o feedback exclusivo do professor ou anotam revisões em grande parte locais e superficiais. Para refletir essa heterogeneidade, triangulamos deliberadamente entre múltiplos estudos AWCF em vez de nos basear em uma única fonte 10,11,12,13.

As crenças dos aprendizes sobre quem está fornecendo feedback também importam: trabalhos quase experimentais sobre fontes percebidas indicam que desempenho e confiança podem mudar quando feedback idêntico é enquadrado como "professor" versus "automatizado", ressaltando a necessidade de levar em conta os efeitos de percepção nos projetos AWCF14,15. Ampliando essa linha, estudos emergentes sugerem que robôs educacionais, devido à sua presença incorporada, também podem atuar como provedores de feedback, potencialmente influenciando o engajamento e a confiança do aprendiz de maneirasdistintas 16.

Uma linha complementar de pesquisa, o feedback corretivo escrito dinâmico (DWCF), enfatiza ciclos de feedback frequentes, gerenciáveis e abrangentes, com codificação e revisão rápida. Evidências de múltiplos contextos sugerem que o DWCF melhora a precisão de forma confiável (com efeitos de frequência na fluência), embora os resultados possam variar conforme os objetivos do curso e a populaçãode alunos 17, 18, 19 e 20. Por fim, estudos iniciais sobre feedback mediado por IA generativa relatam paridade com o feedback dos professores sobre resultados de escrita e potenciais benefícios quando combinados com orientações metalinguísticas explícitas, motivando uma integração mais próxima do feedback humano e de IA em contextos L221,22.

Para enfrentar esses desafios, propomos o framework STEP-DWCF-R (Structured, Tierado, Evidência Orientado por Processos para Feedback Corretivo Escrito Dinâmico com Agente de IA Robótico), um novo sistema de feedback DWCF em múltiplos estágios projetado para fornecer suporte estruturado, iterativo e orientado para processos. Nosso sistema aproveita o poder preditivo e gerador dos Grandes Modelos de Linguagem (LLMs), com entrega por meio de uma interface robótica de agente de IA e moderação do professor, para segmentar questões complexas de escrita em categorias gerenciáveis, fornecer feedback por meio de múltiplas rodadas de interação e avaliar sua eficácia usando métricas tanto baseadas em resultados quanto em processos. Ao transformar o feedback em um processo estruturado e interativo, o STEP-DWCF-R avança o suporte automatizado de escrita, passando da correção estática de erros para um sistema mais envolvente, incorporado e orientado para o aprendizado.

Nossas contribuições se concentram em três avanços integrados. Primeiro, propomos um esquema estruturado de representação por feedback que categoriza erros (por exemplo, gramática, coerência) para que o feedback robótico de IA entregue por agentes de LLM seja tanto acionável quanto pedagogicamente interpretável. Segundo, introduzimos um processo iterativo em múltiplas etapas que sequencia o feedback entre linguagem, estrutura e raciocínio em várias rodadas para reduzir a carga cognitiva e aprofundar o engajamento. Terceiro, estendemos a avaliação além das pós-pontuações para incluir métricas orientadas a processos, como redução de erros e adoção de feedback, oferecendo uma visão mais completa do impacto da aprendizagem. Os frameworks WCF representam as primeiras tentativas de sistematizar feedback corretivo escrito dentro da tecnologia educacional. Originados na Avaliação Automatizada de Redação (AWE) e na Pontuação Automatizada de Redações (AES), esses sistemas enfatizavam a detecção de erros e a pontuaçãode proficiência, com 13,14. A contribuição deles está na escalabilidade: milhares de alunos poderiam receber feedback sem o gargalo da avaliação humana. No entanto, esses frameworks normalmente forneciam comentários estáticos e fragmentados, como correções gramaticais, sugestões lexicais ou pontuações globais que os alunos tinham dificuldade para transformar em revisõessignificativas 23,24,25,26.

Com o tempo, a pesquisa em WCF evoluiu para incluir abordagens mais mediadas por tecnologia. Esses sistemas mais recentes buscaram capturar aspectos mais amplos da escrita aproveitando métodoscomputacionais 13,21. Mais recentemente, o escopo se expandiu ainda mais com tecnologias incorporadas, onde robôs educacionais começaram a atuar como provedores de feedback em contextos de escrita ou tutoria. Sua presença física e possibilidades interativas introduzem novas dinâmicas de confiança, engajamento e motivação do aprendiz. No entanto, apesar desses desenvolvimentos, a orientação dominante da WCF permaneceu focada noresultado 8,27: produzindo pontuações ou comentários isolados de forma única. Pedagogicamente, essa orientação está desalinhada com a avaliação formativa, onde o feedback deve apoiar a revisão entre os rascunhos e apoiar o engajamento metacognitivo 16,28,29,30,31. Assim, o limite conceitual da WCF revela uma lacuna duradoura: o feedback é fornecido, mas não estruturado ou sequenciado para guiar os processos de aprendizagem.

Em resposta a essas limitações, os estudiosos começaram a explorar abordagens mais dinâmicas para escrever feedback. Investigações iniciais destacaram a importância dos ciclos iterativos de feedback, onde os aprendizes revisam várias vezes sob orientaçãofundamentada 17,32. A categorização estruturada de erros também foi proposta para melhorar a interpretabilidade do feedback e alinhá-la com os objetivospedagógicos 33,34. A noção de um framework DWCF consolida essas direções ao incorporar três princípios de projeto: esquemas de erro explícitos, entrega em etapas e iterativa, e métricas de avaliação orientadas aprocessos 19,35. Em vez de sobrecarregar os alunos com uma grande quantidade de correções ao mesmo tempo, o DWCF distribui a atenção entre camadas de escrita — precisão superficial, coerência estrutural e profundidade argumentativa — ao longo das rodadassucessivas 17,33. A avaliação vai além das pontuações finais para incluir indicadores de processo, como taxas de redução de erros, adoção de feedback e profundidade de revisão10, 19, 25. Apesar de seu potencial, as aplicações práticas da DWCF continuam escassas, e a maioria dos estudos não chega a operacionalizá-la em contextos de grande escala mediados portecnologia 10,36,37. Essa lacuna destaca a necessidade de estruturas que não apenas teoricem a DWCF, mas também demonstrem sua viabilidade em ambientes educacionais do mundo real. A Figura 1 mostra o arcabouço teórico mais amplo da DWCF proposto na literatura. A figura fornece uma justificativa geral de como o feedback corretivo escrito dinâmico pode operar em múltiplos níveis, incluindo tanto resultados medidos (por exemplo, precisão, coerência) quanto construtos teorizados, mas não medidos, no presente estudo (por exemplo, redução da ansiedade na escrita, fluência e complexidade). Ele é incluído para orientação teórica, e não como um modelo direto deste ensaio. Elementos correspondentes aos resultados e métricas de processo analisados aqui estão indicados na figura; Outras vias são ilustrativas e não foram avaliadas neste estudo.

O surgimento de LLMs e sistemas multimodais oferece um meio poderoso de operacionalizar o DWCF em larga escala. LLMs, com suas capacidades zero-shot e few-shot, podem gerar feedback sensível ao contexto sem treinamento específico paratarefa 21,22. Experimentos recentes sugerem seu potencial para segmentação diretiva, refinamento em etapas e geração de explicações, que se alinham intimamente com os princípios do DWCF 13,37,38,39. Pesquisas complementares em colaboração humano–IA mostraram que ciclos iterativos de engajamento, adaptação e adoção seletiva do feedback da IA podem melhorar tanto a qualidade da adoção quanto da revisão25,30. Quando esses processos são incorporados por meio de robôs, a interação tem o potencial teórico de se tornar multimodal — combinando gesto, voz e presença — o que pode aprimorar ainda mais a percepção e motivação doaprendiz 40.

Fundamentados na Zona de Desenvolvimento Proximal (ZPD)41, na Hipótese de Entrada42 e na Teoria da Aquisição de Habilidades, posicionamos o STEP-DWCF-R como um controlador que conecta o suporte ao aprendiz, processamento de entrada e desenvolvimento de habilidades. Concretamente, a itemização vinculada a rubricas, listas consolidadas oportunas e ciclos de IA, humanos e robôs moderados por professores em múltiplas rodadas operam em uma camada de integração que media a revisão e gera os pontos finais observáveis analisados aqui (IELTS Overall e TR/CC/LR/GRA; rodadas, admissão, erros persistentes, tempo). Construtos como redução da ansiedade na escrita são teorizados, mas não medidos neste estudo.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esse protocolo foi aprovado pelo Comitê de Ética da Escola de Educação Primária do Shangrao Preschool Education College. Todos os participantes eram adultos (≥18 anos) e forneceram consentimento informado por escrito antes do estudo.

1. Desenho do estudo

NOTA: Devido às limitações da sala de aula de EFL disponível (matrícula total N = 32), os participantes foram randomizados em dois grupos de 16 cada. Esse tamanho da amostra, embora modesto, foi considerado suficiente para uma investigação piloto, dado o desenho pré-pós-pós-dentro do sujeito e os tamanhos de efeito grandes esperados, com base em estudos anteriores doDWCF 17,18,19,20.

  1. Randomize os participantes em dois grupos (n = 16 cada) usando randomização simples. Gerar a sequência de alocação usando uma lista de números aleatórios gerada por computador. Oculte a alocação do instrutor até que a avaliação inicial seja concluída.
  2. Garanta que ambos os grupos sejam ministrados pelo mesmo instrutor, usando materiais e horários de contato idênticos.
  3. Fornecer feedback seja por meio da correção humana direta (WCF) ou pelo fluxo de trabalho STEP-DWCF-R, onde o feedback da IA e do professor é apresentado por meio de um agente robótico de IA.

2. Tarefas de Escrita

  1. Administrar uma redação básica da Tarefa 2 do IELTS na Semana 1 sob condições de prova (≥250 palavras, 40 min).
  2. Realize seis tarefas semanais de escrita (Semanas 2–7). Para cada tarefa:
    1. No WCF, forneça uma rodada de feedback humano sobre a redação.
    2. No STEP-DWCF-R, gere feedback de IA, modere-o com um professor humano e instrua o agente robótico de IA a apresentar o feedback de forma interativa ao aprendiz.
    3. No STEP-DWCF-R, repita o ciclo de retroalimentação STEP-DWCF-R por 2–3 rodadas até que a revisão seja concluída.
  3. Administrar uma redação pós-prova da Tarefa 2 do IELTS na Semana 8 sob as mesmas condições do exame. Siga o mesmo calendário semanal para cada tarefa em ambos os grupos. Entregue feedback da Rodada 1 dentro de 24 horas após a submissão do rascunho no STEP-DWCF-R. Exigir que os alunos revisem e reenviem dentro de 48 horas. Siga o mesmo cronograma para as rodadas seguintes e complete todos os ciclos dentro do período semanal.

3. Fluxo de Trabalho de Feedback

  1. Processe cada rascunho do aprendiz com a API GPT-5 (modelo = "gpt-5", temperatura = 0,7, max_output_tokens = 2048) para gerar feedback detalhado em quatro categorias fixas: Gramática, Vocabulário, Organização e Raciocínio. O prompt exato do sistema e o esquema de saída JSON são fornecidos no repositório open-source (https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback/blob/main/evaluate.py, função build_prompt() e normalize_reasoning()).
  2. Moderar o feedback gerado pela IA de acordo com os seguintes critérios: remover falsos positivos ou comentários imprecisos; adicionar questões críticas que não passaram para fora alinhadas com a rubrica do IELTS; garantir que os comentários sejam acionáveis e encorajadores; e manter a consistência com o esquema de quatro categorias. Registre as decisões de moderação manualmente.
  3. Salve o feedback moderado em formato JSON e faça o upload na interface do agente robótico de IA (uma aplicação web leve do Flask).
  4. Apresente feedback pela interface web. Exiba tabelas estruturadas para cada categoria (resumo, questões e dicas de revisão). Registre os confirmantes e solicitações de esclarecimento dos aprendizes por meio de registros do sistema. Instrua os alunos a revisar e reenviar seus rascunhos. Repita o ciclo até três vezes por tarefa.
  5. Verificação e solução de problemas.
    1. Verifique a geração bem-sucedida de feedback por IA confirmando que o resultado é válido em JSON contendo as quatro categorias exigidas: Gramática, Vocabulário, Organização e Raciocínio. Confirme a conclusão da moderação dos professores garantindo que os falsos positivos tenham sido removidos, os problemas ausentes tenham sido adicionados e o arquivo JSON moderado tenha sido salvo.
    2. Faça upload do arquivo JSON moderado para a interface do agente robótico de IA baseada no Flask através do endpoint de upload. Confirme o upload bem-sucedido através da mensagem de confirmação da interface e da entrada de log do banco de dados. Registre automaticamente as reenviações dos alunos por meio dos registros de envio de formulários.
    3. Processe resultados de IA não conformes (por exemplo, JSON malformado, categorias ausentes ou feedback impreciso) usando as funções ensure_json() e normalize_reasoning(). Gere a saída da API com parâmetros ajustados do prompt conforme necessário. Corrija manualmente o JSON durante a moderação do professor, se necessário, para garantir que todas as quatro categorias estejam presentes antes do upload.
      NOTA: Exemplos de feedback bruto de IA, versões moderadas pelo professor e a saída da interface entregue estão disponíveis no repositório (dados/pasta e cadernos/).

4. Mensuração de Resultados

  1. Defina o resultado primário como a mudança na pontuação geral da faixa do IELTS (Semana 1 a Semana 8).
  2. Defina resultados secundários como mudanças na Resposta à Tarefa, Coerência e Coesão, Recursos Lexicais e Alcance Gramatical e Precisão.
  3. Designe dois avaliadores independentes com experiência na avaliação da Tarefa 2 do IELTS para avaliar todas as redações. Remova nomes e identificadores de grupos de todos os ensaios. Randomize a ordem dos ensaios e avaliadores cegos para trabalhos em grupo e prazos. Use o mesmo prompt da Tarefa 2 do IELTS tanto para a linha inicial da Semana 1 quanto para a Semana 8 após o teste. Resolver discordâncias de pontuação acima de 0,5 faixas por meio da discussão até que se alcance consenso. Avalie a confiabilidade entre avaliadores usando o coeficiente de correlação intraclasse de medidas médias (ICC[2,2]).

5. Medição de Processos

  1. Registre o número de rodadas de revisão por tarefa.
  2. Registro da captação do feedback (adotado, modificado, recusado) pelos aprendizes.
  3. Acompanhe erros persistentes entre os ciclos.
  4. Registre o tempo de feedback do professor, o tempo de entrega do robô e o tempo de revisão do aluno.

6. Análise de Dados

  1. Ajustar modelos lineares de efeitos mistos com interação Grupo, Tempo e Grupo × Tempo.
  2. Aplique modelos generalizados de efeitos mistos para medidas de processo.
  3. Relate tamanhos de efeito, intervalos de confiança de 95% e valores p ajustados.
  4. Realize verificações de robustez com ANCOVA, modelos específicos para avaliadores e SEs robustos.

7. Disponibilidade de Código

Todo o código, prompts, esquemas JSON e arquivos de implementação de exemplo necessários para reproduzir o sistema STEP-DWCF-R estão disponíveis abertamente no https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Experimentos e Análises

Todos os 32 alunos forneceram dados de referência. Os dados pós-teste estavam disponíveis para 16 aprendizes em cada grupo (WCF e STEP-DWCF-R; Figura 2). A linha do tempo e as medidas do estudo são apresentadas na Figura 3, e o fluxo de trabalho de feedback de ponta a ponta é ilustrado na Figura 4. Os parâmetros experimentais de co...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo comparou o STEP-DWCF-R, uma estrutura dinâmica de feedback corretivo escrito multicomponente, com um agente robótico de IA, com o WCF de rodada única em um curso de redação IELTS de oito semanas. O STEP-DWCF-R gerou ganhos maiores antes do pós-pós-produção na faixa geral e em TR, CC, LR e GRA. Os aprendizes sob o STEP-DWCF-R também completaram mais rodadas de revisão e apresentaram redução de erro mais rápida, com modelos estimando uma queda de cerca de 4,1 erros por rodada. ...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores não têm interesses concorrentes.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabalho foi financiado por uma Bolsa de Ponte da Universiti Sains Malaysia, Projeto Nº: R501-LR-RND003-0000001342-0000.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Flask (Web Framework)Pallets Projectshttps://flask.palletsprojects.comVersão 2.1; usado para interface web de agente robótico de IA
API GPT-5OpenAIhttps://platform.openai.comModelo gpt-5, temperatura=0.7; para geração de feedback JSON estruturado
Jinja2Pallets Projectshttps://jinja.palletsprojects.comModelos renderizados no servidor para interface web
PythonPython Software Foundationhttps://www.python.orgVersão 3.10; script de backend
Windows 11Microsofthttps://www.microsoft.com/windowsSistema operacional para sistema de feedback de IA

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

EngenhariaEdi o 233Edi o 233Valor VazioEdi oescrita em ingl sfeedback corretivo escrito WCFfeedback corretivo escrito din mico DWCFcolabora o humano IAabsor o de feedbackmodelos de efeitos mistos

Artigos relacionados