本研究构建了一个三级评估框架和公平性中介模型,以评估人工智能辅助英语写作系统。通过764个跨语言样本的分析,结果表明系统存在准确性差异,对非母语学习者(尤其是汉语A2水平学习者)存在公平性偏差,且用户对公平性的感知是影响其满意度的关键中介因素,具有重要的理论与实践意义。
研究文章
本研究构建了一个三级评估框架和公平性中介模型,以评估人工智能辅助英语写作系统。通过764个跨语言样本的分析,结果表明系统存在准确性差异,对非母语学习者(尤其是汉语A2水平学习者)存在公平性偏差,且用户对公平性的感知是影响其满意度的关键中介因素,具有重要的理论与实践意义。
在全球教育数字化转型的背景下,自动写作评估(AWE)因其具备实时性和标准化优势而被广泛采用;然而,传统的以准确性为导向的框架往往忽视了公平性问题以及学习者的主观感知,从而限制了其透明度和教育价值。为解决这一局限,本研究提出了一种可解释的人工智能(XAI)框架,旨在提供透明且可解释的反馈,使学习者能够理解并信任自动化评估结果。同时,该框架整合了一个多层次的验证模型——三级评估框架(TLEF),涵盖技术准确性、群体与个体公平性以及学习者感知,并结合人工智能公平性中介模型(AFMM)。研究采用分层随机抽样方法,从欧洲语言共同参考框架(CEFR)A2至C1级别的764名多语种学习者(英语、中文和西班牙语母语者)中收集数据,通过写作任务、人工智能与人类专家双重评分以及结构化问卷获取信息。研究未采用单一测试方法,而是综合运用多种统计分析手段,考察评估的有效性、公平性以及学习者感知之间的关系。统计分析方法包括相关性分析、均方根误差(RMSE)、等化几率检验(Equalized Odds testing)以及结构方程模型(SEM)。研究结果表明,尽管人工智能辅助写作评估系统(ETS Criterion)整体上具有较高的有效性(r = 0.82),但仍存在显著差异:中文母语者与人工评分者之间的一致性最低(0.72),且RMSE最高(中位数为2.15);在较低语言水平的学习者中(如A2级别),公平性偏差最为明显(ΔEO = 0.15);学习者对公平性的感知完全中介了其对准确性的感知与学习满意度之间的关系,而语言水平则调节了对公平性的敏感程度。本研究通过将公平性与感知重新定义为可解释性的核心维度,增强了AWE的理论基础,并为提升教育技术的透明度、公平性与社会可接受性提供了切实可行的路径。
教育和数字技术的深度全球化,增加了以科学且可信的方式评估英语写作水平的需求,以服务于语言教学、学术发展和职业晋升1。传统写作评估依赖人工评分,虽可衡量论证的充分性、文化适切性等主观写作特征2,但存在评分周期长、人力成本高,以及因评分者经验与倾向导致的偏倚等问题3,4。在大规模应用场景中,这些问题尤为突出,例如国际语言考试(IELTS、TOEFL)或高校开设的各类英语课程,人工评分难以满足即时反馈和广泛覆盖的需求5。
在此背景下,自动写作评估(AWE)系统因其具备实时处理、标准化和可扩展性等优势而得到广泛应用6。目前,数以百万计的中小学生、语言学校学员、高等教育学生及个人学习者正在使用诸如Grammarly(专注于语法错误识别和文体优化)和ETS Criterion(遵循正式写作规范)等主流工具7。尽管如此,AWE系统的技术效能及其在教育中的适用性仍存在争议8。从技术角度看,现有系统在客观维度(如错误检测和词汇多样性)上具有很高的准确性,其与人工评分的相关性可超过0.859。然而,在内容相关性、逻辑论证和文本组织等更为主观的方面,其相关性通常低于0.7010。这种不平衡可能促使学习者片面追求表面准确性,从而以牺牲整体写作能力为代价11。
公平性问题也限制了自动写作评估(AWE)的教育实用性。目前的研究倾向于关注准确性方面的总体指标,而忽视了可能系统性地对某些群体造成不利影响的偏差。12 例如,汉语或西班牙语学习者共有的中介语特征可能被误判为错误,从而导致系统性低估。13,14 此外,学习者对人工智能反馈的主观接受程度普遍尚不明确。15 调查表明,近三分之一的非母语学习者认为人工智能评分与实际表现之间存在不匹配,而技术准确性、群体公平性和学习者满意度的相关机制仍缺乏充分理解。16
这些缺陷反映了经典准确性范式的不足17。一个仅考虑人工智能与人工评分一致性的框架,无法捕捉到公平性问题或学习者对系统的信任问题。在实践中,自动写作评估(AWE)的教育价值必须同时满足三个条件:技术精确性、群体间的公平性以及学习者的可接受性18。缺乏这样一种全面的验证方法,有助于解释为何AWE系统在教育实践中虽被广泛采用,却未能获得充分信任19,20。
为应对这一挑战,本研究提出了一种多层次验证框架,将技术准确性、群体与个体公平性以及学习者感知整合为一个连贯的结构。所提出的可解释人工智能(XAI)框架旨在通过向教师和学生提供公平性诊断及透明的评分解释,实现在现有自动写作评估(AWE)平台中的实际应用,并可在写作课程或备考课程中加以应用,以评估其在真实评估场景中提升公平性、可解释性及教学实用性的能力。
在此背景下,本研究提出一个分析框架(AFMM),用于探讨感知公平性在确定准确性与满意度关系中的中介作用,以及语言熟练度在公平性敏感性上的调节作用。因此,该研究在理论和实践两方面均有所贡献:理论上,通过将公平性描述为与准确性及感知并列的关键效度维度,丰富了自动写作评价(AWE)的评估模型;实践上,为开发者提供了最大化公平性的策略,为教育工作者提供了对群体敏感的系统选择标准,并通过解释学习者感知的形成方式,提升了AWE的教育价值。除教育领域外,该框架还与可解释人工智能(XAI)的 broader 概念相契合,展示了公平性与用户感知如何在医疗保健、自主系统和网络安全等其他领域增强透明度、信任度和可接受性。
研究问题:
1. AWE 系统在不同母语和语言水平群体中的技术准确性和公平性表现如何?
2. 基于可解释人工智能(XAI)的多层级评估框架如何提升自动化英语写作评估的透明度与公平性?
文献综述:
影响大学生接受自动写作评价反馈的因素基于扩展的技术接受模型(TAM)进行考察21基于对448名中国学生使用结构方程模型(SEM)的调查数据,研究发现有用性、易用性和使用意愿对主观规范、信任、自我效能、认知反馈及系统特征具有显著影响。然而,该研究局限于单一国家和单一学生群体,限制了其结论的普适性。为探究中国英语作为外语(EFL)学习者如何回应Pigai自动写作评价(AWE)反馈22一项研究分析了大学生的重复提交作业(n = 5),发现学生初期侧重于错误纠正,对语言反馈的吸收较少,但回应的深度逐渐加深。然而,该研究的样本量非常有限,且所使用的自动写作评价(AWE)系统也存在局限性,限制了其适用性和推广性。另一项研究调查了英语作为外语(EFL)教师对人工智能评分工具(CoGrader)应用所持有的信念,以识别影响其观点的因素。23通过对10名沙特大学教师的混合方法研究,问卷调查与访谈结果显示,教师们对完全依赖人工智能并彻底替代教师持混合性积极态度,但对其可靠性及全面替代的可行性仍存疑虑。由于样本量有限且研究局限于单一国家,研究结论的普适性受到限制。
考虑到语料库语言学和人工智能技术的发展,一项研究探讨了自动作文评分(AES)框架24。该研究采用主成分分析(PCA)优化用于评估写作质量的语言指标,发现将微观特征与聚合特征相结合,比仅使用聚合特征更能有效界定写作质量。基于随机森林回归的非线性AES方法优于其他方法。此外,SHAP方法识别出每个评估属性所依赖的关键语言要素,通过可解释的人工智能提高了系统的透明度。研究结果可能有助于改进写作评估与教育中的多维方法。为应对阿拉伯语写作标注常面临成本高、耗时长的挑战,研究引入了人机协作系统。该方法在大语言模型(LLM)的辅助下,基于文学领域的七个特征对文章进行分析。验证流程和提示策略经过个性化设计,以确保一致性和准确性。该协作模式显著增加了标注资源的供给,且未影响评估质量,表明其是一种适用于资源较少语言的可扩展数据标注方法。
人工智能在教育领域的应用为显著减少评分工作量并提升写作教学质量提供了机遇25,26。与此同时,研究人员强调,人工智能的准确性并非其负责任使用的唯一相关因素。公平性与偏见减少、安全性与隐私保护、问责性、可解释性、透明度、教育效果、诚信性以及持续发展等原则同样至关重要。最近的研究基于GPT-4o,针对上述要求对零样本评分进行了实证评估。该研究重点关注教育工作者对自动写作评分工具(ADWTs)在教育诚信方面的看法27。一项涉及10个学科共100名研究生和教授的横断面研究显示,尽管教师认可ADWTs在实现教育目标方面的优势,但仍存在一些局限性,例如可及性有限、知识缺乏,以及对其影响教育诚信和创造力的担忧。研究建议,随着人工智能技术日益融入教育,必须重视伦理问题并推动利益相关方的参与,以确保其成功且负责任地应用。另有研究比较了人工智能技术与人工评分者在评估英语作为外语(EFL)学生提交的作文时的有效性28。对30篇作文的评估结果显示,尽管人工智能在内容、语言、结构和准确性方面提供了高质量的评语,但其评分 consistently 低于人工评分者。此外,人工智能提供的反馈更为详尽,但不同人工智能工具之间的评分差异并不显著。
研究空白:
目前,大多数关于自动写作评估(AWE)研究的学术工作主要关注评分准确性或用户接受度,极少研究探讨评分差异是否系统性地对母语者或不同语言水平群体造成不利影响。尽管已有研究考察了用户接受度,但这些研究通常局限于特定国家的某一AWE系统,且样本量有限,因而引发了关于其结果是否具有普遍适用性的疑问。虽然SHAP和PCA均为可解释人工智能(XAI)策略,旨在提升系统透明度,但尚无研究探讨AWE中的公平性机制,或学习者如何使用AWE提供的AI反馈。现有文献中缺乏综合考量准确性、公平性分析及学习者感知等明确定义维度的全面框架,也未见任何评估模型能够同时考虑评分者内部与评分者之间的准确性、公平性以及学习者感知。本研究提出并验证了一种可解释的评估框架TLEF和一种综合模型AFMM,旨在同时评估多语言背景及不同语言水平学习者的评分准确性、公平性及学习者感知。
访问受限。请登录或开始试用以查看此内容。
本节总结了伦理审批和参与者招募过程,包括作文施测、ETS Criterion系统与专家双人评分、学习者感知评估以及统计分析。重点阐述了准确性、公平性以及基于标准误(SEM)的感知建模如何整合到一个统一的可解释人工智能(XAI)验证流程中。基于XAI的自动作文评估(AWE)框架如图1所示。
步骤:
该过程包含多个步骤。首先,获得机构审查委员会(IRB)的批准,并从所有参与者处收集知情同意书。随后定义了自变量、因变量和控制变量。通过 Moodle 平台使用三个中性命题作文题目实施标准化写作任务,并在确保遵守字数、时间限制和结构等作文要求的前提下收集写作样本。采用 ETS Criterion 系统输出结果结合人工专家评分进行双重评分。在提交作文后立即发放学习者感知问卷。实施数据筛查和质量控制程序,以处理作弊或无效作答等异常情况。同时应用了公平性分析阈值(ΔEO、RMSE 检查)。最后,所有匿名化数据均安全存储于加密且受访问控制的服务器上。
伦理批准与知情同意
本研究获得了作者所在机构的机构审查委员会的伦理批准。所有操作均遵循《赫尔辛基宣言》及相关适用法规进行。所有参与者均为成年人(≥18岁),并在参与前签署书面知情同意书。写作样本和问卷回答在来源处即去标识化,并存储在加密且访问受控的服务器上;仅授权研究人员可访问。人工评分者对参与者的母语、语言熟练程度及人口学信息保持盲态。参与完全自愿,参与者有权随时退出,且研究不涉及欺骗或敏感干预措施。正式批准文件可根据期刊要求提供。
变量设计
本研究共定义了三组变量以指导分析。表1汇总了各构念在测量方法中所使用的测量方式和数据类型,并提供了自变量、因变量和控制变量的完整操作性定义。
AI评分准确性是第一个被评估的自变量,通过ETS Criterion的输出结果与专家评分之间的均方根误差(RMSE)和皮尔逊相关系数(r)进行衡量。专家校准得到的组内相关系数(ICC)为0.91,验证了评分的可靠性。
第二个自变量是学习者的语言背景,分为母语者和非母语者,并进一步细分为中文、西班牙语、阿拉伯语及其他群体。中国学生是目标人群之一,因为初步迹象显示他们存在系统性低估现象。
第三个自变量是写作熟练程度,根据官方证书和课前水平测试确认的欧洲共同语言参考框架(CEFR)等级A2至C1进行评定,同时也与雅思(IELTS)等级相当。在人工智能公平性调节模型中引入的另一个调节变量是写作熟练程度,用于检验不同熟练水平的学习者对公平性的敏感度是否存在差异。
公平感和学习者满意度是因变量。公平感通过一个包含八个条目的问卷进行评估,该问卷采用七点李克特量表评分,涵盖个体一致性与群体公正性(Cronbach's α = 0.87;CVI = 0.92)。学习者的满意度则通过六个李克特问题进行评估,用以反映其使用意愿及技能提升的感知(α = 0.85)。
在年龄、性别和写作经验方面对变量进行了控制。年龄分为三个组别(18-22岁、23-28岁和≥29岁),性别分为男性和女性。写作经验按每年的频率分为三个水平。
撰写任务文本
为获取三种中立主题的写作数据,设计了标准化的议论文题目,主题分别为“全球化对本土文化的影响”、“在线教育的优势与挑战”以及“人工智能的伦理边界”。这些主题一方面旨在平衡认知难度与可及性,另一方面旨在减少因先前知识差异而导致的表现差异。各主题的分布情况及作文长度的描述性统计结果见表2。
每篇论文要求为250词±10%,并在基于Moodle的平台上于45分钟内完成。禁止使用辅助工具,逾期提交的论文被排除在外。论文需遵循标准化结构,包括引言、两个论证段落和结论。共收集到764篇有效论文,平均长度为252.3词(标准差 = 8.7)。
评分比较数据
通过结合ETS Criterion系统输出结果与人工专家评分的双重程序,评估了AWE评分的准确性。评分数据通过Criterion系统的开放API获取。三名具有十年以上评估经验的语言学家独立对所有文章进行了评分。在正式评分前,评分员完成了三次校准培训。在校准过程中,评分者间信度达到ICC = 0.87;在正式评分中,信度提升至ICC = 0.91,各维度的特异性ICC均高于0.88。对于评分差异超过两分的文章,通过集体讨论达成一致(共18例)。评分流程及信度结果详见表3。
学习者感知问卷
通过基于技术接受模型(TAM)并扩展了公平性维度的22项问卷,收集了学习者对人工智能反馈的看法。该问卷包含三个维度:公平性感知(8项)、满意度(6项)以及可理解性和透明度等调节因素(8项)。五位专家进行的内容效度验证得出CVI为0.92,对60名学习者进行的预测试结果显示整体信度为α = 0.90。问卷结构及心理测量学指标详见表4。
主研究中的问卷在提交文章后立即发放,并设置了最短完成时间要求,以减少敷衍作答的情况。共发放了764份问卷,经过质量检查后,有效问卷为756份,有效率为98.95。
数据收集与质量控制
数据在四个阶段内记录了8周(2024年3月至4月):招募与知情同意;论文写作;双人评分与问卷发放;以及数据库的汇总。根据课前写作表现评定的熟练程度证书通过双重筛选进行审核,该过程剔除了16名参与者。通过实时监控剔除了4例疑似作弊情况,3例可疑的人工智能代写表现(分数偏差至少8分)在人工评估后进行了修正。根据反向题项一致性检验,剔除了8份无效问卷。
数据存储与伦理
所有数据均经过匿名化处理,并使用由母语、熟练程度和序列号组成的唯一标识符进行存储。文本、评分和问卷均经过加密,并存储在符合 ISO27001 标准且访问受限的服务器上。数据将在永久删除前保留 3 年。研究已获得机构审查委员会的伦理批准,并从所有参与者处获取了书面知情同意书。
访问受限。请登录或开始试用以查看此内容。
本部分基于五个分析维度呈现研究结果:实验设计、参与者特征、评分准确性、公平性评估以及学习与感知的建模。研究结果包括统计性能、组间差异、公平性差异,以及基于结构方程模型(SEM)的中介效应和调节效应。
实验设置
关键的软件操作步骤包括通过其应用程序编程接口(API)设置ETS Criterion,以自动评分相关信息;培训人工评分员;使用参考的统计软件及其默认统计选项进行数据分析;以及在R 4.3.1中使用标准的结构方程模型(SEM)软件包进行结构方程建模。AWE公平性研究中所使用的材料、软件平台和分析工具列于材料表中。
样本选择与人口统计学特征
采用分层随机抽样方法,在英语使用地区共招募了764名有效参与者。分析了控制变量以确保样本的代表性。大多数参与者年龄在18至22岁之间(n = 426,55.76%),其次是23...
访问受限。请登录或开始试用以查看此内容。
该研究从三个层面探讨了自动作文评分(AWE)系统,涵盖技术准确性、群体与个体公平性以及学习者感知,发现整体有效性与系统性的群体差异同时存在。人工智能评分与专家评分之间存在较强的相关性(总体 r = 0.82),但在不同子群体中观察到差异(母语者 r = 0.89,非母语者 r = 0.76;中国学习者 r = 0.72;表6)。均方根误差(RMSE)的分布也表明,中国学习者的误差更大且变异性更高(图2)。这些趋势表明存在构念表征不足,可能还存在领域偏移:当训练过程中对中介语特征赋予的权重不足时,模型将更善于识别表层正确性(如语法),而在语篇层面特征(如内容、论证)上的表现则相对较弱29。
公平性分析增强了该图像的解读。均等化几率(Equalized Odds)显示,中国学生之间存在显著差异(ΔEO = 0.12,p < 0.05),且在较低语言水平组中差异最为明显(A2 级 ΔEO = 0.15;表6)。此外还观察到,非母语者群体通过...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 数据存储系统 | 用于存储匿名化数据的加密、访问控制服务器。 | 机构服务器 | STORAGE-002 |
| ETS Criterion 系统 | 用于评分写作任务的AI辅助写作评估系统。 | 美国教育考试服务中心(Educational Testing Service, ETS) | ETS-001 |
| 公平性与准确性分析工具 | 用于均方根误差(RMSE)、等值几率(Equalized Odds)和统计分析的工具。 | 自定义脚本/统计软件包 | TOOL-FA-001 |
| 人类专家评分 | 由三位具有十年以上经验的语言学家提供的独立评分。 | 内部评分员 | HR-EXP-003 |
| 学习者感知问卷 | 包含8个条目的问卷,评估公平性与满意度,采用7点李克特量表评分。 | 内部开发 | QUES-008 |
| 统计软件(R 4.3.1) | 用于数据分析,包括结构方程模型(SEM)。 | R 基金会(R Foundation) | R-SW-431 |
| 分层随机抽样数据 | 从CEFR等级A2至C1的764名多语言学习者中收集的数据。 | 研究参与者 | DATA-764 |
| 写作任务提示 | 三个关于全球化、在线教育和人工智能伦理的标准化作文题目。 | 基于Moodle的平台 | PROMPT-003 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可