本研究以多轮人工智能与教师辅助修改为基础,对STEP-DWCF-R(面向动态书面纠正反馈的结构化、分层式、循证流程,结合机器人人工智能代理)在提升雅思写作表现方面的效果进行基准评估。
方法文章
本研究以多轮人工智能与教师辅助修改为基础,对STEP-DWCF-R(面向动态书面纠正反馈的结构化、分层式、循证流程,结合机器人人工智能代理)在提升雅思写作表现方面的效果进行基准评估。
自动写作反馈系统虽已广泛应用,但大多数系统提供的反馈是静态且零散的,对修改过程的支架支持有限。本研究评估了STEP-DWCF-R框架(基于机器人AI代理的结构化、分层式、证据驱动的动态书面纠错反馈流程),该框架在一个为期一周的任务周期内,通过机器人AI代理以多轮迭代方式传递由教师监督的AI生成反馈。在一项为期八周的准实验研究中,32名英语作为外语(EFL)学习者被随机分配至传统书面纠错反馈组(每项任务仅一轮反馈)或STEP-DWCF-R组。两组均在基线和后测阶段完成雅思Task 2议论文写作,所有作文经匿名化和随机化处理后,由两名独立评分员进行评分(组内相关系数ICC = 0.86–0.93)。线性混合效应模型显示,STEP-DWCF-R组在总分提升方面显著优于对照组(Δ = 1.03 vs. 0.31分),且在四项分析维度上均有显著进步,其中“连贯与衔接”维度的提升最为明显。过程数据表明,STEP-DWCF-R组学习者平均每项任务完成2.26轮修改,且错误数量随轮次呈线性下降趋势。研究结果表明,整合了AI生成反馈、教师监督以及多轮机器人AI代理传递的STEP-DWCF-R框架,相较于传统的单轮反馈模式,更能有效促进EFL学习者的雅思写作能力提升,为人工智能增强型动态反馈在EFL教学中的实际应用提供了有力支持。
书面纠正性反馈(WCF)在二语写作教学中仍处于核心地位。有证据表明,全面的书面纠正性反馈能够长期提升学习者的语言准确性,并且当其与课堂教学实践相配合时,可与在真实教学环境中切实可行的聚焦式反馈方法并存1,2,3。近期的课堂研究表明,持续实施全面的书面纠正性反馈能带来持久的准确性与流利度提升。关于反馈范围的研究提醒教师应有策略地选择需纠正的语言形式,而非标记所有错误4,5,6,7,8,9。与此同时,自动写作评估(AWE)与自动书面纠正性反馈(AWCF)迅速发展。研究结果存在分歧:一些研究发现,使用AWCF或类似Criterion系统的项目能在任务完成度和语法广度方面带来提升,而另一些研究则发现其相较于仅由教师提供反馈并无显著优势,或仅观察到大量局部性、表层性的修改。为反映这一研究结果的异质性,我们有意综合多项AWCF研究进行三角验证,而非依赖单一来源10,11,12,13。
学习者对反馈提供者身份的信念同样重要:关于感知来源的准实验研究表明,当相同的反馈被设定为“教师提供”或“系统自动提供”时,学习表现和信任度均可能发生改变,这凸显了在自动写作反馈设计中考虑感知效应的必要性14,15。在此基础上,新兴研究进一步指出,教育机器人由于具备具身存在性,也可作为反馈提供者,可能以独特的方式影响学习者的参与度和信任感16。
另一条研究路径——动态书面纠正性反馈(DWCF),强调通过编码方式实现频繁、适度且全面的反馈循环,并快速进行修改。来自多种教学环境的证据表明,DWCF能够稳定提升语言准确性(并对流利度产生频率效应),尽管其效果可能因课程目标和学习者群体而异17,18,19,20。最后,关于生成式人工智能辅助反馈的早期研究显示,其在写作成果上的效果与教师反馈相当,若结合明确的元语言指导,还可能带来额外益处,这推动了在二语教学情境中进一步整合人工与人工智能反馈的探索21,22。
为应对这些挑战,我们提出了 STEP-DWCF-R 框架(基于结构化、分层、循证流程的机器人人工智能代理动态书面纠正反馈,Structured, Tiered, Evidence-driven Process for Dynamic Written Corrective Feedback with Robotic AI Agent),这是一种新型的多阶段动态书面纠正反馈(DWCF)系统,旨在提供结构化、迭代式且以过程为导向的写作支持。本系统利用大语言模型(Large Language Models, LLMs)的预测与生成能力,通过机器人人工智能代理界面传递反馈,并结合教师干预,将复杂的写作问题分解为可管理的类别,通过多轮互动提供反馈,并采用基于结果与基于过程的双重指标评估反馈效果。通过将反馈转化为结构化和互动式的过程,STEP-DWCF-R 推动自动化写作支持从静态的错误纠正,迈向更具参与性、具身性和以学习为中心的系统。
我们的贡献集中在三个相互关联的进展上。首先,我们提出了一种结构化的反馈表示框架,该框架对错误类型(如语法、连贯性)进行分类,从而使机器人AI代理提供的大语言模型(LLM)反馈既具有可操作性,又具备教学上的可解释性。其次,我们引入了一种迭代式的多阶段流程,将语言、结构和推理层面的反馈按轮次有序组织,以降低认知负荷并加深学习参与度。第三,我们将评估范围从最终得分扩展到包括错误减少率和反馈采纳率等以过程为导向的指标,从而更全面地反映学习效果。书面纠正性反馈(WCF)框架代表了在教育技术中系统化书面纠错反馈的最早尝试。这类系统起源于自动写作评估(AWE)和自动作文评分(AES),强调错误识别和能力评分13,14。其优势在于可扩展性:成千上万的学习者可以在无需依赖人工批改瓶颈的情况下获得反馈。然而,这些框架通常仅提供静态且零散的评语,例如语法检查、词汇建议或整体评分,学习者难以将其转化为有意义的修改行为23,24,25,26。
随着时间推移,写作计算机反馈(WCF)研究逐步发展,纳入了更多以技术为媒介的方法。这些较新的系统致力于通过计算方法捕捉写作的更广泛层面13,21。近年来,研究范围进一步扩展至具身技术领域,教育机器人开始在写作反馈或辅导情境中充当反馈提供者。其物理存在和交互特性引入了关于信任、参与度和学习者动机的新动态。然而,尽管取得了这些进展,WCF 的主流取向仍以结果为导向8,27:即以一次性方式生成评分或孤立的评语。从教学法角度看,这种取向与形成性评估不相契合;理想的反馈应能在多轮草稿修改过程中提供支架式支持,并促进元认知参与16,28,29,30,31。因此,WCF 的概念边界暴露出一个长期存在的差距:反馈虽已传递,却未被结构化或序列化以引导学习过程。
针对这些局限性,学者们开始探索更具动态性的写作反馈方法。早期研究强调了迭代反馈循环的重要性,即学习者在支架式指导下进行多次修改17,32。此外,有研究提出通过结构化错误分类来提高反馈的可解释性,并使其与教学目标保持一致33,34。动态书面纠正性反馈(DWCF)框架整合了这些方向,嵌入了三项设计原则:明确的错误图式、分阶段且迭代式的反馈传递方式,以及面向过程的评估指标19,35。DWCF 不再一次性向学生提供大量修改意见使其不堪重负,而是通过多轮反馈,将关注点分布在写作的不同层次上——包括表层准确性、结构连贯性以及论证深度17,33。评估范围也超越了最终得分,扩展至包括错误减少率、反馈采纳情况和修改深度等过程性指标10,19,25。尽管该框架前景广阔,但其实际应用仍较为有限,大多数研究尚未在大规模、技术中介的环境中实现其操作化10,36,37。这一空白凸显了亟需发展不仅在理论上构建 DWCF,还能在真实教育情境中验证其可行性的框架。 图1展示了文献中提出的 DWCF 的整体理论框架。该图从一般意义上说明了动态书面纠正性反馈可能在多个层面发挥作用的理论依据,包括本研究中可测量的结果(如准确性、连贯性)以及本研究中提出但未直接测量的理论构念(如写作焦虑减轻、流利度和语言复杂性)。该图旨在提供理论导向,而非本研究试验的直接模型。图中已标出与本文分析的结果和过程指标相对应的要素;其他路径仅为示意图,未在本研究中进行评估。
大型语言模型(LLMs)和多模态系统的兴起为大规模实施DWCF提供了强有力的手段。LLMs凭借其零样本和少样本能力,能够在无需针对特定任务训练的情况下生成具有上下文敏感性的反馈21,22。最近的实验表明,LLMs在指令分割、分阶段优化和解释生成方面具有潜力,这些功能与DWCF的原则高度契合13,37,38,39。在人机协作方面的互补研究表明,通过与AI反馈进行交互、调整并有选择性地采纳,形成迭代循环,可提升反馈的接受度和修改质量25,30。当这些过程通过机器人具象化实现时,交互在理论上可具备多模态特征——结合手势、语音和实体存在——这可能进一步增强学习者的感知与学习动机40。
基于最近发展区(Zone of Proximal Development, ZPD)41、输入假说(Input Hypothesis)42 和技能习得理论(Skill Acquisition Theory)43,我们将 STEP-DWCF-R 定位为一种连接学习者支持、输入处理与技能发展的调控机制。具体而言,与评分量规关联的条目化设计、及时整合的清单,以及多轮次由教师主导的 AI、人类与机器人循环,在一个整合层上运行,协调修改过程,并产生本研究分析的可观测终点指标(IELTS 总分及任务回应/连贯与衔接/词汇资源/语法多样性与准确性得分;修改轮次、语言吸收、持续性错误、时间)。诸如写作焦虑降低等构念在理论上有所探讨,但在本试验中未予测量。
访问受限。请登录或开始试用以查看此内容。
本方案已获上饶幼儿师范高等专科学校初等教育学院伦理委员会批准。所有参与者均为成年人(≥18岁),并在研究开始前签署书面知情同意书。
1. 研究设计
注意:由于可用的英语作为外语(EFL)教室的限制(总人数 N = 32),参与者被随机分为两组,每组16人。尽管样本量较小,但鉴于采用组内被试的前后测设计以及基于以往DWCF研究17,18,19,20所预期的较大效应量,该样本量被认为足以支持一项初步探索性研究。
2. 写作任务
3. 反馈工作流程
4. 结果测量
5. 过程测量
6. 数据分析
7. 代码可用性
用于重现 STEP-DWCF-R 系统所需的所有代码、提示词、JSON 模式及示例实现文件均可在 https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback 公开获取。
访问受限。请登录或开始试用以查看此内容。
实验与分析
所有32名学习者均提供了基线数据。每个组(WCF和STEP-DWCF-R)各有16名学习者的测试后数据可用(图2)。研究时间线和测量指标见图3,端到端反馈工作流程如图4所示。本研究人工智能系统的实验设置与实施参数见表1。分析按照预先设定的意向性治疗计划进行。我们首先评估基线等效性(表2),然后报告主要结果(图5和表3),接着是次要结果(表4),并进行稳健性和可靠性检验。
基线等效性
在基线水平(第1周),各组在预先指定的协变...
访问受限。请登录或开始试用以查看此内容。
本研究在为期八周的雅思写作课程中,比较了由机器人人工智能代理支持的多组分动态书面纠正性反馈框架STEP-DWCF-R与单轮次书面纠正性反馈(WCF)的效果。结果显示,STEP-DWCF-R在总分及任务回应(TR)、连贯与衔接(CC)、词汇资源(LR)和语法多样性与准确性(GRA)各项指标上的前后测提升均更为显著。接受STEP-DWCF-R教学的学习者完成的修改轮次更多,错误减少速度更快,模型估计每轮修改可减少约4.1个错误。其中,连贯与衔接方面的提升最为突出(ΔΔ = 0.85),表明结构化、与评分标准挂钩的反馈不仅有助于提高语言准确性,还能促进更高层次的篇章组织能力。这些发现与以往关于动态书面纠正性反馈(DWCF)的研究一致,表明迭代式、全面性的反馈能够随时间推移持续提升写作准确性14,15,16,17。
STEP-DWCF-...
访问受限。请登录或开始试用以查看此内容。
本工作由马来西亚理科大学桥梁资助项目资助,项目编号:R501-LR-RND003-0000001342-0000。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Flask(Web 框架) | Pallets Projects | https://flask.palletsprojects.com | 版本 2.1;用于机器人 AI 代理的网页界面 |
| GPT-5 API | OpenAI | https://platform.openai.com | 模型 gpt-5,temperature=0.7;用于生成结构化 JSON 反馈 |
| Jinja2 | Pallets Projects | https://jinja.palletsprojects.com | 用于网页界面的服务器端渲染模板 |
| Python | Python Software Foundation | https://www.python.org | 版本 3.10;后端脚本编写 |
| Windows 11 | Microsoft | https://www.microsoft.com/windows | AI 反馈系统的操作系统 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可