Методическая статья

Динамическая письменная корректирующая обратная связь, интегрирующая доставку агентов ИИ для структурированной и итеративной поддержки эссе

DOI:

10.3791/71992

24 июля 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данном исследовании оценивается STEP-DWCF-R (Структурированный, многоуровневый, основанный на доказательствах процесс динамической письменной корректирующей обратной связи с помощью роботизированного AI агента) для повышения эффективности письма IELTS с помощью многоэтапного ИИ и поддерживаемых преподавателями исправлений.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Автоматизированные системы обратной связи по написанию широко распространены, но большинство из них выдаёт статичные, фрагментированные комментарии, которые обеспечивают ограниченную поддержку для доработки. В данном исследовании оценивается фреймворк STEP-DWCF-R (Структурированный, многоуровневый, основанный на доказательствах процесс динамической письменной корректирующей обратной связи с помощью роботизированного AI агента), в котором обратная связь, сгенерированная ИИ, модерируемая учителем, передаётся через роботизированного агента ИИ в нескольких итеративных раундах в течение недельного цикла задач. В восьминедельном квазиэкспериментальном исследовании 32 учащихся EFL были рандомизированы либо по традиционной письменной корректирующей обратной связи (один раунд на задание), либо по STEP-DWCF-R. Обе группы завершили эссе по заданию IELTS 2 на начальном и после теста, которые были анонимизированы, рандомизированы и оценены двумя независимыми оценщиками (ICC = 0,86–0,93). Линейные модели с смешанными эффектами показали, что группа STEP-DWCF-R показала значительно большие улучшения общего диапазона (Δ = 1,03 против 0,31 полос) и по всем четырём аналитическим измерениям, при этом наибольшее улучшение наблюдалось в когерентности и когезии. Данные по процессу показали, что учащиеся STEP-DWCF-R в среднем выполняли 2,26 повторных раундов за задание, при этом количество ошибок линейно снижалось по разным раундам. Эти результаты свидетельствуют о том, что интегрированная структура STEP-DWCF-R, включающая обратную связь, генерируемую ИИ, модерацию учителей и итеративную доставку роботизированных агентов ИИ, связана с большим улучшением письма IELTS по сравнению с традиционной однораундовой обратной связью, что указывает на практические применения динамической обратной связи с использованием ИИ в контекстах EFL.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Письменная корректирующая обратная связь (WCF) остаётся центральным элементом педагогики второго письма. Данные показывают, что комплексная WCF со временем повышает точность учащихся и, в соответствии с практикой в классе, может сосуществовать с целенаправленными подходами, осуществимыми в аутентичныхконтекстах 1,2,3. Недавние исследования в классах показывают устойчивый рост точности и беглости благодаря устойчивому, всестороннему WCF. Исследования по сфере обратной связи предупреждают, что учителям следует стратегически ориентироваться на формы, а не оцениватьвсё как 4,5,6,7,8,9. Параллельно автоматизированная оценка письменных текстов (AWE) и автоматизированная письменная корректирующая обратная связь (AWCF) быстро развиваются. Результаты неоднозначны: некоторые исследования показывают улучшения в выполнении задач и грамматическом диапазоне с помощью программ в стиле AWCF или Criterion, в то время как другие не обнаруживают значительного преимущества по сравнению с обратной связью только от учителя или отмечают в основном локальные, поверхностные изменения. Чтобы отразить эту гетерогенность, мы сознательно триангуляируем несколько исследований AWCF, а не опираемся на один источник 10,11,12,13.

Также важны убеждения учащихся о том, кто даёт обратную связь: квазиэкспериментальная работа на воспринимаемом источнике показывает, что производительность и доверие могут измениться, когда идентичная обратная связь подаётся как «учитель» или «автоматизированная», что подчёркивает необходимость учитывать эффекты восприятия в проектахAWCF 14,15. Расширяя эту линию, новые исследования показывают, что образовательные роботы, благодаря своему воплощённому присутствию, могут также выступать в роли источников обратной связи, потенциально влияя на вовлечённость и доверие учащихся особымобразом 16.

Дополнительный направлений исследований является динамическая письменная корректирующая обратная связь (DWCF), которая делает акцент на частых, управляемых и комплексных циклах обратной связи с кодированием и быстрой пересмотром. Данные из различных источников свидетельствуют о том, что DWCF надёжно повышает точность (с частотным влиянием на беглость), хотя результаты могут различаться в зависимости от целей курса и численностиучащихся: 17, 18, 19, 20. Наконец, ранние исследования по обратной связи, опосредованной генеративным ИИ, показывают паритет обратной связи учителей о результатах письма и потенциальных преимуществах в сочетании с явным металингвистическим руководством, что стимулирует более тесную интеграцию человеческой и ИИ обратной связи в контекстах L221,22.

Для решения этих проблем мы предлагаем фреймворк STEP-DWCF-R (Structured, Tiered, Evidence-based Process for Dynamic Written Corrective Feedback with Robotic AI Agent) — новую многоступенчатую систему обратной связи DWCF, предназначенную для предоставления структурированной, итеративной и ориентированной на процесс поддержки письма. Наша система использует предиктивные и генеративные возможности Больших Языковых Моделей (LLM), предоставляемые через роботизированный интерфейс агента ИИ и модерацию преподавателей, чтобы сегментировать сложные задачи письма по управляемым категориям, предоставлять обратную связь через несколько раундов взаимодействия и оценивать её эффективность с использованием метрик, основанных на результатах и процессах. Преобразуя обратную связь в структурированный и интерактивный процесс, STEP-DWCF-R продвигает автоматизированную поддержку письма от статической коррекции ошибок к более увлекательной, воплощённой и ориентированной на обучение систему.

Наши взносы сосредоточены на трёх интегрированных авансах. Во-первых, мы предлагаем схему структурированного представления обратной связи, которая классифицирует ошибки (например, грамматику, когерентность), чтобы обратная связь LLM, передаваемая агентами роботизированного ИИ, была одновременно оперативной и педагогически интерпретируемой. Во-вторых, мы внедряем итеративный многоступенчатый процесс, который последовательно распределяет обратную связь по языку, структуре и рассуждению в нескольких раундах, чтобы снизить когнитивную нагрузку и углубить вовлечённость. В-третьих, мы расширяем оценку за пределы пост-баллов, включая процессно-ориентированные метрики, такие как снижение ошибок и принятие обратной связи, предоставляя более глубокий взгляд на влияние обучения. Рамки WCF представляют собой первые попытки систематизировать письменную корректирующую обратную связь в образовательных технологиях. Возникшие в области автоматизированной оценки написания (AWE) и автоматизированной оценки эссе (AES), эти системы делали упор на обнаружение ошибок и оценку квалификации13,14. Их вклад заключается в масштабируемости: тысячи учащихся могут получать обратную связь без узкого места, связанного с человеческой оценкой. Однако эти фреймворки обычно предоставляли статичные и фрагментированные комментарии, такие как проверки грамматики, лексические предложения или глобальные баллы, которые учащиеся с трудом превращали в значимыеисправления 23, 24, 25, 26.

Со временем исследования WCF эволюционировали и стали включать более технологически ориентированные подходы. Эти новые системы стремились охватить более широкие аспекты письма, используя вычислительныеметоды 13,21. В последнее время сфера деятельности расширилась ещё больше благодаря воплощённым технологиям, где образовательные роботы начали выступать в роли источника обратной связи в контекстах письма или репетиторства. Их физическое присутствие и интерактивные возможности вводят новые динамики доверия, вовлечённости и мотивации учащихся. Тем не менее, несмотря на эти изменения, доминирующая направленность WCF остаётся сосредоточенной нарезультатах 8,27: создание баллов или отдельных комментариев в одноразовом формате. С педагогической точки зрения эта ориентация несовпадает с формативной оценкой, где обратная связь должна сдерживать пересмотр между черновиками и поддерживать метакогнитивноевовлечённость 16,28,29,30,31. Таким образом, концептуальная граница WCF обнаруживает постоянный разрыв: обратная связь предоставляется, но не структурируется и не секвенируется для руководства процессами обучения.

В ответ на эти ограничения учёные начали изучать более динамичные подходы к написанию обратной связи. Ранние исследования подчеркнули важность итеративных циклов обратной связи, когда учащиеся повторяют несколько раз под руководством под руководством17,32. Также была предложена структурированная категоризация ошибок для улучшения интерпретации обратной связи и согласования её с педагогическимицелями 33,34. Понятие фреймворка DWCF консолидирует эти направления, встраивая три принципа проектирования: явные схемы ошибок, поэтапную и итеративную доставку, а также процессно-ориентированные метрикиоценки 19,35. Вместо того чтобы перегружать студентов множеством исправлений сразу, DWCF распределяет внимание по слоям письма — поверхностной точности, структурной связности и глубине аргументации — через последовательныеэтапы 17 и 33. Оценка выходит за рамки итоговых оценок и включает такие показатели процесса, как снижение уровней ошибок, принятие обратной связи и глубина редакции10, 19, 25. Несмотря на свои перспективы, практическое применение DWCF остаётся ограниченным, и большинство исследований не позволяют реализовать его в крупномасштабных, технологически опосредованныхконтекстах 10, 36, 37 (10, 36, 37). Этот разрыв подчёркивает необходимость фреймворков, которые не только теоретизируют DWCF, но и демонстрируют его осуществимость в реальных образовательных условиях. Рисунок 1 показывает более широкую теоретическую основу DWCF, предложенную в литературе. На рисунке даётся общее объяснение того, как динамическая письменная корректирующая обратная связь может работать на нескольких уровнях, включая как измеряемые результаты (например, точность, когерентность), так и теоретические, но неизмеренные конструкции в данном исследовании (например, снижение тревожности при письме, беглость и сложность). Она включена для теоретической ориентации, а не как прямая модель этого исследования. Элементы, соответствующие анализируемым здесь результатам и метрикам процессов, показаны на рисунке; Другие пути являются иллюстрационными и не были оценены в этом исследовании.

Появление LLM и мультимодальных систем предоставляет мощный способ для масштабного внедрения DWCF. LLM с возможностями нулевого и малого выстрела могут генерировать контекстно-зависимую обратную связь без обучения конкретнымзадачам 21,22. Недавние эксперименты указывают на их потенциал для директивной сегментации, поэтапного уточнения и генерации объяснений, что тесно соответствует принципам DWCF 13,37,38,39. Дополнительные исследования в области сотрудничества человека и ИИ показали, что итеративные циклы взаимодействия, адаптации и выборочного внедрения обратной связи ИИ могут улучшить как восприятие, так и качество доработок25,30. Когда эти процессы воплощаются в роботах, взаимодействие теоретически может стать мультимодальным — сочетая жест, голос и присутствие — что может дополнительно улучшить восприятие и мотивациюучащихся 40.

Основываясь на зоне ближайшего развития (ZPD)41, гипотезевхода 42 и теории приобретениянавыков 43, мы позиционируем STEP-DWCF-R как контроллер, связывающий поддержку учащихся, обработку ввода и развитие навыков. Конкретно, детализация, связанная с рубриками, своевременные консолидированные списки и многоэтапные циклы ИИ–, человека и робота, модерируемые учителями, работают на уровне интеграции, который опосредует ревизию и даёт наблюдаемые конечные точки, проанализированные здесь (IELTS Overall и TR/CC/LR/GRA; раунды, усваивание, постоянные ошибки, время). Такие конструкции, как снижение тревоги при написании, теоретизируются, но не измеряются в этом исследовании.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Этот протокол был утверждён Этическим комитетом Школы начального образования колледжа дошкольного образования Шанжрао. Все участники были взрослыми (≥18 лет) и предоставили письменное информированное согласие до начала исследования.

1. Дизайн исследования

ПРИМЕЧАНИЕ: Из-за ограничений доступного класса по EFL (общее количество учащихся N = 32) участников рандомизировали на две группы по 16 человек. Этот размер выборки, хотя и невелик, был признан достаточным для пилотного исследования с учётом предварительного проектирования внутри субъекта и ожидаемых больших размеров эффекта на основе предыдущих исследованийDWCF 17,18,19,20.

  1. Рандомизуйте участников на две группы (n = по 16 каждая) с помощью простой рандомизации. Генерируйте последовательность распределения с помощью компьютерно сгенерированного списка случайных чисел. Скрытое распределение от преподавателя до завершения базовой оценки.
  2. Убедитесь, что обе группы обучаются одним и тем же преподавателем с одинаковыми материалами и часами контакта.
  3. Доставлять обратную связь либо через прямую человеческую коррекцию (WCF), либо через рабочий процесс STEP-DWCF-R, где обратная связь от ИИ и учителя подаётся через роботизированного агента ИИ.

2. Письменные задачи

  1. Проведите базовое эссе по заданию IELTS 2 на первой неделе в условиях экзамена (≥250 слов, 40 минут).
  2. Проведите шесть еженедельных письменных заданий (2–7 недели). Для каждой задачи:
    1. В WCF дайте один раунд человеческой обратной связи по эссе.
    2. В STEP-DWCF-R генерируйте обратную связь ИИ, модерируйте её с учителем-человеком и инструктуйте роботизированного агента ИИ интерактивно передавать обратную связь ученику.
    3. В STEP-DWCF-R повторяйте цикл обратной связи STEP-DWCF-R в течение 2–3 раундов до завершения правки.
  3. Проведите эссе по заданию IELTS Task 2 после теста на 8-й неделе в тех же условиях экзамена. Следуйте одному и тому же недельному календарю для каждой задачи в обеих группах. Доставьте обратную связь первого раунда в течение 24 часов после подачи черновика в STEP-DWCF-R. Требуйте от учащихся повторять и повторно сдавать в течение 48 часов. Следуйте тому же расписанию для следующих раундов и завершайте все циклы в течение недельного окна.

3. Рабочий процесс обратной связи

  1. Обрабатывайте каждый черновик обучающегося с помощью GPT-5 API (модель = "gpt-5", температура = 0,7, max_output_tokens = 2048), чтобы получить детализированную обратную связь по четырём фиксированным категориям: грамматика, словарный запас, организация и рассуждение. Точные системные запросы и схема вывода JSON предоставляются в открытом репозитории (https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback/blob/main/evaluate.py, функции build_prompt() и normalize_reasoning()).
  2. Модерировать обратную связь, сгенерированную ИИ, согласно следующим критериям: удалять ложные срабатывания или неточные комментарии; добавить пропущенные критические вопросы, соответствующие критерии IELTS; убедитесь, что комментарии были практичными и вдохновляющими; и сохранять согласованность с четырёхкатегорийной схемой. Логируйте решения о модерации вручную.
  3. Сохраните модерируемую обратную связь в формате JSON и загрузите её в интерфейс роботизированного AI-агента (лёгкое веб-приложение Flask).
  4. Подавайте обратную связь через веб-интерфейс. Отображайте структурированные таблицы для каждой категории (резюме, вопросы и советы по редактированию). Записывайте подтверждения учащихся и запросы на разъяснения через системные журналы. Инструктировать учащихся пересматривать и повторно сдавать свои черновики. Повторяйте цикл до трёх раз за задачу.
  5. Проверка и устранение неполадок.
    1. Проверьте успешную генерацию обратной связи ИИ, убедившись, что результат является действительным JSON, содержащим все четыре необходимые категории: грамматику, словарный запас, организацию и рассуждение. Подтвердите завершение модерации учителей, убедившись, что ложные срабатывания удалены, добавлены отсутствующие проблемы и модерируемый JSON-файл сохранен.
    2. Загрузите модерируемый JSON-файл в интерфейс роботизированного AI-агента на базе Flask через конечную точку загрузки. Подтвердите успешную загрузку через сообщение подтверждения интерфейса и запись в журнале базы данных. Автоматически фиксируйте повторные отправки обучающихся через журналы подачи форм.
    3. Обрабатывайте несоответствующие результаты ИИ (например, искажённый JSON, отсутствующие категории или неточный обратный связь) с помощью функций ensure_json() и normalize_reasoning(). Регенерируйте выходные данные API с корректированными параметрами запросов по мере необходимости. При необходимости при необходимости корректируйте JSON во время модерации учителя, чтобы убедиться, что все четыре категории присутствуют перед загрузкой.
      ПРИМЕЧАНИЕ: Примеры сырой обратной связи от ИИ, версий, модерируемых учителем, и результатов интерфейса доступны в репозитории (данные/папки и блокноты/).

4. Измерение результатов

  1. Определите основной результат как изменение общего балла IELTS (с 1 по 8-ю неделю).
  2. Определите вторичные результаты как изменения в ответе на задачу, когерентности и когезии, лексическом ресурсе, а также грамматическом диапазоне и точности.
  3. Назначьте двух независимых оценщиков с опытом оценки IELTS Task 2 для оценки всех эссе. Удалите имена и идентификаторы групп из всех эссе. Рандомизируйте порядок эссе и слепые оценщики по групповому заданию и времени. Используйте один и тот же запрос IELTS Task 2 как для базовой недели 1, так и для недели 8 после теста. Разрешайте разногласия по оценке более 0,5 диапазонов путем обсуждения до достижения консенсуса. Оценить надёжность между оценщиками с помощью коэффициента корреляции внутриклассовых уровней средних измерений (ICC[2,2]).

5. Измерение процесса

  1. Фиксируйте количество раундов повторения на задачу.
  2. Запись восприятия обратной связи (принятой, изменённой, отклонённой) учащимися.
  3. Отслеживайте постоянные ошибки между циклами.
  4. Записывайте время обратной связи от учителей, время доставки робота и время повторения учащихся.

6. Анализ данных

  1. Подгонять линейные модели смешанных эффектов с взаимодействием группы, времени и группы × времени.
  2. Применяйте обобщённые смешанные эффекты для измерений процесса.
  3. Отчёт о размерах эффектов, 95% доверительных интервалах и скорректированных p-значениях.
  4. Проводите проверки надёжности с помощью ANCOVA, моделей, специфичных для оценок, и надежных SE.

7. Доступность кода

Весь код, подсказки, схемы JSON и примерные файлы реализации, необходимые для воспроизведения системы STEP-DWCF-R, доступны на https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Эксперименты и анализ

Все 32 учащихся предоставили исходные данные. Данные после тестирования были доступны для 16 учащихся в каждой группе (WCF и STEP-DWCF-R; Рисунок 2). Хронология исследования и показатели представлены на рисунке 3, а сквозная обратная связь показана на рисунке 4. Параметры экспериментальной настройки и реализации нашей системы ИИ прив...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании сравнивали STEP-DWCF-R — многокомпонентную динамическую структуру для корректирующей обратной связи с роботизированным агентом ИИ — с однораундовым WCF в восьминедельном курсе IELTS. STEP-DWCF-R обеспечил более значительные предпостовые приросты в общем диапазоне и по TR, CC, LR и GRA. Учащиеся по STEP-DWCF-R также прошли больше повторных раундов и показали более быстрое снижение ошибок, при этом модели оценивали снижение примерно на 4,1 ошибки за раунд. Наибольшее ул...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

У авторов нет конкурирующих интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Эта работа была профинансирована грантом Universiti Sains Malaysia Bridging, проект No R501-LR-RND003-0000001342-0000.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Flask (Web Framework)Pallets Projectshttps://flask.palletsprojects.comВерсия 2.1; используется для веб-интерфейса роботического ИИ-агента
API GPT-5OpenAIhttps://platform.openai.comМодель gpt-5, температура=0.7; для генерации структурированной обратной связи в формате JSON
Jinja2Pallets Projectshttps://jinja.palletsprojects.comШаблоны для серверной рендеризации веб-интерфейса
PythonPython Software Foundationhttps://www.python.orgВерсия 3.10; сценарии на бэкэнде
Windows 11Microsofthttps://www.microsoft.com/windowsОперационная система для системы обратной связи ИИ

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

233233WCFDWCF

Похожие статьи