Artykuł badawczy

Badanie wpływu zautomatyzowanej oceny pisania za pomocą głębokiej sieci neuronowej i pisemnej oceny nauczycieli na wyniki pisania po angielsku

DOI:

10.3791/69995

8 maja 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dostarczanie informacji zwrotnej w postaci dwóch funkcji semantycznych opartych na NLP za pomocą systemu komputerowego oraz pisemnej opinii nauczyciela zostało wykorzystane, aby poprawić płynność i poprawność pisania uczniów w języku angielskim. Wyniki wykazały pozytywne wyniki dotyczące pierwszego podejścia.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Technologie wspomaganej komputerowo nauki języków odniosły największe postępy w nauce języków, zwłaszcza w kontekście sztucznej inteligencji (AI), w ostatnich latach. Istnieją różne technologie, takie jak automatyczna ocena pisania (AWE dalej) oraz automatyczne ocenianie esejów (AES), które są uważane za filary nauki języków nie tylko w dziedzinach informatyki, ale także w edukacji. Ocena może być przeprowadzona wyłącznie w formie holistycznych ocen z wykorzystaniem technologii AWE, która okazała się bardzo skuteczna w usprawnianiu nauki języka i dlatego nie może zapewnić szczegółowej ani dogłębnej informacji zwrotnej. Aby zapewnić szczegółową informację zwrotną dotyczącą pisania dwóch głównych elementów języka (tj. gramatyki i płynności), rozważono komputerowo wspomagany system implementacji obejmujący modele sieci neuronowych oraz dwie metody przetwarzania języka naturalnego opartego na semantycznej (NLP, dalej). W tym celu 90 pakistańskich studentów uniwersytetów, którzy byli uczniami uczących się angielskiego drugiego języka (ESL), zostało losowo przydzielonych do grup kontrolnych, informacji zwrotnej instruktorów oraz eksperymentalnych. Komputerowo wspomagana ocena obejmowała sieć neuronową. Wyniki testu porównawczego pomiędzy modelem bazowym AWE a instruktorami oceniającymi wykazały korelację między komputerowo wspomaganym sprzężeniem zwrotnym wykorzystującym te sieci neuronowe. Konsekwencje takich wyników leżą w pedagogice pisania ESL, zwłaszcza w sytuacjach, gdy dokładność językowa i płynność stanowią wyzwanie.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Informacja zwrotna w pisaniu obejmuje różne cechy języka, takie jak organizacja, gramatyka, płynność, treść i mechanika, umożliwiając uczniom przepisanie lub tworzenie nowego tekstu 1,2,3. Obecnie nauczyciele pisania angielskiego są głównymi beneficjentami dzięki szybkim zmianom i postępom w zakresie komputerowej nauki języków (CALL dalej) oraz komputerowej oceny pisania w postaci AWE lub AES oraz oceniania esejówpisemnych 4. Dodatkowo, komputerowa ocena pisania angielskiego dostarcza diagnostycznego feedbacku dotyczącego elementów językowych, takich jak treść, gramatyka, słownictwo itp., zapewniając terminowe, indywidualne i obiektywne odpowiedzi na tekst pisany uczniów. System AWE jest również w stanie udzielać uczniom jasnych, pisemnych odpowiedzi, aby mogli oni przyswoić wiedzę zdobytą dzięki tym odpowiedziom izwiększyć ich zdolnościpoznawcze.

Niniejsze badanie opierało się na badaniach4, które przedstawiały koncepcję wielostrategicznej, komputerowej nauki pisania po angielsku, z uwzględnieniem teorii sprzężenia zwrotnego pisania w języku angielskim oraz procesu analitycznego oceniania. Obejmowało to inne modele semantyczne oparte na NLP, które integrowały głębokie uczenie w pisemnej informacji zwrotnej, oferując rozbudowane oceny informacji zwrotnej. Porusza ograniczenia wcześniejszej technologii AWE, która kładzie nacisk wyłącznie na holistyczne, ale nie na analityczne, specyficzne ocenianie. W konsekwencji chodzi bardziej o dokładną i natychmiastową ocenę z punktami podi i całkowitą liczbą punktów dotyczących szeregu elementów wskaźników językowych, aby poprawić naukę pisania angielskiego wśród uczniów. Spośród różnych cech językoznawstwa (tj. treść, złożoność, poprawność, płynność) niniejsze badanie będzie dotyczyć jedynie płynności i aspektu gramatycznego uczniów ESL w Pakistanie. W tym celu obecne badanie sugeruje strategię technologii NLP polegającą na wykorzystaniu sieci neuronowych wraz z oceną nauczycieli.

W pakistańskim kontekście nauki języków pakistańscy uczniowie napotykają trudności z nauką pisania po angielsku, mimo że uważają naukę angielskiego za przedmiot obowiązkowy od klasy 1 i do klasy 14. Właśnie tutaj wchodzą w grę liczne czynniki, takie jak błędne kursy i stosowanie starych metod do wyjaśniania gramatyki7. Na poziomie uniwersyteckim liczba uczniów, których nauczyciele muszą nauczać, jest dość znaczna, ponieważ uczniowie mają różnorodne wykształcenie, obejmujące różne uczelnie i szkoły. To zmusza nauczycieli do poświęcania dużej części czasu na poprawianie błędów pisemnych uczniów, co sprawia, że obciążenie pracą jest zbyt duże. Z drugiej strony, uczniowie brali pisemną opinię nauczycieli za oczywistą i nie starali się je rozpoznać i poprawić.8.

Jedno z badań wykazało, że płynność jest głównie zależna od faktu, że strach uczniów przed popełnieniem błędu staje się barierą w płynnym pisaniu, dlatego uczniowie wolą unikać częstszych błędów niż angażować się w myśli. Czasami występuje ingerencja języka urdu w angielskie pismo, oprócz innych czynników kontekstowych. Ponadto język urdu jest językiem narodowym. W wyniku tych czynników kontekstowych nauczyciele mają trudności z udzielaniem precyzyjnej, terminowej i spójnej informacji zwrotnej każdemu uczniowi, gdy uczniowie tworzą materiały pisemne lub redagują rękopisy. Biorąc pod uwagę teorię oceny pisania, badanie to będzie mogło podążać za tym, który stosuje automatyczną strategię skontaktowania z pisaniem maszynowym podczas porównania tradycyjnej oceny nauczyciela i stosuje analityczne zamiast całościowego ocenianie, aby zapewnić uczniom natychmiastową informację zwrotną na temat dwóch istotnych wymiarów językowych (tj. gramatyki i płynności)4.

Pojawiły się różne przemysłowe produkty AWE i AES, w tym Pigai.org, Bingo English, My Access, E-rater, I-write, Criterion itd. AES/AWE na wczesnym etapie rozwoju charakteryzuje się głównie tradycyjnym systemem uczenia maszynowego opartym na twierdzeniu Bayesa10, regresji liniowej11 itd. Obecnie rozwoj głębokiego uczenia, szczególnie technologii sieci neuronowych, znacząco przyniósł również korzyści dziedzinie pisania informacji zwrotnej, takiej jak sieci rekurencyjne neuronowe (RNN12), długa pamięć krótkotrwała13, sieci konwolucyjne neuronowe (CNN)14, podejście BERT15. AWE również odniosło korzyści ze strategii przedszkoleniowych stosowanych na początku NLP16. Wiele badań uwzględniało różne rozwiązania skupiające się na sieciach neuronowych, takie jak generowanie próbek przeciwników w celu uczenia się, uczenie się przez Multitask17, uczenie się przez samonadzór18 oraz algorytmy grafowe19. Niektórzy zaproponowali różne techniki rozwiązania problemu braku danych treningowych do pisania informacji zwrotnej20. Istnieją także modele punktacji, które przyczyniają się do wielu modeli sieci neuronowych21.

Korekcja błędów gramatycznych (GEC dalej) to niezależny sposób realizacji misji NLP, który ma zdolność automatycznego wykrywania i korygowania błędów kompozycji. Treść zadań GEC jest powiązana z aspektami AWE. Zadania AWE są traktowane jako uwzględniające diagnozę błędów gramatycznych, z których większość musi być poprawnie zaakcentowana. Jednak badania AWE poświęciły GEC mniejszą uwagę, a tylko nieliczne zintegrowały wczesny model GEC z technologią AWE. Początkowo badania nad GEC najczęściej wybierają N-gram22, a modeljęzykowy 23 , w tym BERT24 , aby identyfikować i poprawiać błędy gramatyczne. Jednak powyższe rozwiązania nie mogły całkowicie rozwiązać problemów takich jak nieporządek czy pominięcie komponentów. Architektura encoder-decoder25 osiągnęła ten sam sukces w GEC, rozwiązując problemy, których wcześniej inne modele nie potrafiły rozwiązać. Ważne jest, aby zauważyć, że zaawansowane architektury GEC wykorzystywały wiele modeli do rozwiązywania problemów, w tym podejścia oparte na Transformerze26.

Inne badania potwierdziły skuteczność AES w porównaniu z ocenami ludzkimi w ocenie esejówpisarskich 27,28. Badanie29 wykazało wpływ automatycznej oceny na biegłość języka angielskiego uczniów. Wyniki wskazywały, że automatyczna ocena miała pozytywny wpływ na biegłość pisania po angielsku. Dla porównania,niektóre inne badaniaignorują wysoki wskaźnik wykrywania błędów przez AES w porównaniu do ocen ludzkich. Najnowsze badania podkreślają rosnącą skuteczność narzędzi wspomaganych przez AI do oceny pisania w edukacji językowej. Jedno z takich badań,31, porównało automatyczne ocenianie z informacjami zwrotnymi wykładowców w kontekście uczenia się chińskich studentów.

Rewolucyjna rola narzędzi opartych na AI w pisaniu akademickim była aktywnie opisywana w najnowszej literaturze. Badania dotyczące zastosowania narzędzi pisemnych opartych na AI jako uzupełnień do tradycyjnej edukacji pisania w języku obcym podkreślają kluczowe znaczenie równych szans i proaktywnego wsparcia nauczycieli w skutecznym wdrażaniu technologii32. Badania badające AWE, takie jak Pigai, wskazały na silną korelację między informacjami zwrotnymi wspieranymi przez komputery a ulepszaniem pisania, poprawek i nowych tekstów ESL33. Inne badanie podkreśliło korzyści płynące z autoenkoderów wariacyjnych (VAE), które pozytywnie wpływają na aspekt szkolenia pisania angielskiego u uczniów i otrzymują informacje zwrotne na wyższych poziomach głębokiego uczenia, specjalizując się w różnych cechach językowych34. Inne badania sugerowały, że systemy AWE nerwowe byłyby skuteczne w użyciu z GEC opartym na NLP, który wykorzystuje głębokie uczenie do natychmiastowej oceny35.

Ulepszanie systemów wieloagentowych jest ważnym krokiem w rozwoju technologii wspomagających pisanie. Przykładem bycia asystentem wieloagentowym, asystentem akademickiego dopracowywania pisania, AcademyCraft, oparty na głębokim uczeniu, wykazał zdolność do pisania i udzielania szczegółowej informacji zwrotnej, ułatwiając tym samym wsparcie pisania oparte na sztucznej inteligencji EFL/ESL, na złożonych schematach analitycznych36. W rzeczywistości badania oparte na technologii na nauce języka zidentyfikowały także różnorodne, emergentne wzorce, takie jak głębokie uczenie, automatyczna ocena i semantyczna informacja zwrotna, a analiza wyników wykazała stopniowy i stały wzrost dokładności pisania oraz zaangażowania uczniów37.

Modele transformer-LSTM wykazują pewną skłonność do automatycznego gradowania i przekazywania informacji zwrotnej na angielskim pismie. Takie architektury hybrydowe wzajemnie łączyły kontekstowe rozumienie transformatorów z sekwencyjnym przetwarzaniem systemów LSTM, co skutkowało poprawą dokładności w ocenianiu gramatyki i spójności oraz zapewnieniem bardziej zniuansowanego generowania informacji zwrotnej38. Postrzeganie nauczycieli EFL wobec narzędzi AI do pisania konsekwentnie informuje o wymiernych postępach w organizacji treści i jakości pisania, koncentrując się na kluczowej roli pomocy pedagogicznej w stymulowaniu użyteczności integracji technologicznej39. Mniej badań porównuje opinie wykładowców z komputerowo wspieraną informacją zwrotną, co sugeruje modele głębokiego uczenia mające na celu zbadanie wpływu na angielskie pisanie uczniów ESL pod względem płynności i gramatyki.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wszystkie programy i narzędzia wykorzystane w badaniu zostały wymienione w Tabeli materiałów.

Kryteria oceniania

Klasyfikacja oceny przyjęta w niniejszym badaniu obejmuje dwie główne domeny, mianowicie płynność i poprawność, które zawierają wszystkie wymagania niezbędne do kompleksowej oceny pisania w języku angielskim jako języku obcym (EFL). Wymiary te mają na celu pomiar kluczowych aspektów jakości pisania, które pomagają w skutecznej komunikacji i wykazaniu biegłości językowej. Moduł płynności mierzy naturalność, ekspresyjność i spójność tekstu poprzez ocenę płynności wywodu oraz stopnia właściwego wykorzystania słownictwa i struktury zdań. Moduł poprawności koncentruje się na precyzyjnej poprawności gramatycznej, braku błędów technicznych oraz zgodności ze standardowymi konwencjami języka angielskiego i w sposób hipotetyczny mierzy oraz zlicza błędy językowe na kilku poziomach (patrz Tabela 1)

Definicja zadania

Biorąc pod uwagę warunki zautomatyzowanej oceny pisemnej uczniów uczących się języka angielskiego, niniejsze badanie proponuje nowy model systemu komputerowego wspomagania oceny pisania w języku angielskim (EG). W porównaniu z poprzednimi badaniami, które były ograniczone zakresem systemów zautomatyzowanej oceny pisemnej, proponowany system pomoże rozwiązać te ograniczenia poprzez wprowadzenie innowacyjnych technik głębokiego uczenia, aby umożliwić użytkownikom poziom analizy lingwistycznej, zakres modyfikacji oraz analizę informacji zwrotnej w całym systemie w oparciu o rozległe przetwarzanie danych. System dwumodelowy, operujący na dwóch najważniejszych wskaźnikach kompozycji, mianowicie płynności (na ile utwór jest naturalny, spójny i ekspresyjny) oraz poprawności (na ile poprawnie napisany jest tekst obarczony błędami gramatycznymi, mechanicznymi i językowymi) za pomocą oddzielnych komponentów sieci neuronowych, musi przeprowadzić szereg ewaluacji. Ponadto identyfikuje on błędy na kilku poziomach lingwistycznych, zaleca środki naprawcze i przekazuje informacje zwrotne w formie listy, aby umożliwić użytkownikom metodyczną poprawę procesu nauki języka u uczniów. W celu opisania procesu obliczeń w komputerowym systemie automatycznej oceny proponujemy następujący model matematyczny w wzorach (1)–(4) (patrz Tabela 2).

Równanie wyniku końcowego, formuła dla metody ważonego punktowania, Σ(wSf + wSc), do celów edukacyjnych.     (1)

Σf=σ(wynik BERT); schemat równania w analizie modelu AI.    (2)

Wzór na równowagę statyczną \( S_c = 100e^{-\lambda \cdot \text{ErrorRatio}} \); analiza równania.   (3)

Równanie funkcji sigmoidalnej σ(x)=1/(1+e^-x); schemat dla regresji logistycznej, sieci neuronowych.   (4)

gdzie: Final Score = złożony wynik oceny pisemnej; w1 = waga przypisana do wyniku płynności; w2 = waga przypisana do wyniku poprawności; Sf = wynik płynności oparty na modelu BERT (znormalizowany do [0, 1]); Sc = wynik poprawności z wykładniczym zanikiem; λ = stała zaniku kontrolująca karę za błędy; σ(x) = logistyczna funkcja aktywacji sigmoid; ErrorRatio = stosunek liczby błędów do całkowitej liczby tokenów w tekście. Wyniki płynności są normalizowane do przedziału [0, 1] za pomocą logistycznej funkcji sigmoid σ(x), natomiast funkcja wykładniczego zaniku jest stosowana przy ocenie poprawności, aby nałożyć odpowiednią karę za częstotliwość występowania błędów.

Architektura i projekt systemu

Jego architektura systemowa opiera się na systemie dwumodułowym z architekturą przetwarzania równoległego, w której analiza wprowadzonych wypracowań jest przeprowadzana równolegle za pośrednictwem równoległych ścieżek ewaluacji. Moduły Płynności i Poprawności generują odpowiednio wyniki, a końcowy wynik zbiorczy stanowi średnia ważona tych dwóch wyników cząstkowych. Moduł poprawności, poza punktacją, oferuje również sugestie dotyczące wykrywania i korygowania błędów (patrz Rysunek 1).

Moduł płynności

Płynność pisania można zdefiniować jako charakter lub wzorzec użycia języka w odniesieniu do poprawnego doboru słownictwa, różnorodności struktur zdań, złożoności syntaktycznej, spójności itp.4. Modele oceny płynności wychwytują przekazywane idee bez jąkania się czy nienaturalności, brzmiąc zbliżenie do natywnych trendów komunikacyjnych. Tradycyjny pomiar płynności opiera się na skalach, co rodzi problemy z niezawodnością między sędziami. Proponowany system eliminuje tę wadę, ponieważ zawiera sieć neuronową opartą na modelu BERT, aby automatycznie indukować spójność semantyczną i naturalność językową poprzez głębokie rozumienie sytuacyjne. Decyzja architektoniczna została podjęta z uwzględnieniem zalet modelu BERT, który okazał się skuteczny w identyfikacji relacji kontekstowych i wzorców semantycznych niezbędnych w pomiarze płynności. Sekwencje wejściowe są wprowadzane do systemu i przekazywane przez 12 warstw transformera z wielogłowicową samoatencją (multi-head self-attention) w celu zidentyfikowania długodystansowych zależności i relacji kontekstowych (patrz Rycina 2).

Mechanizm uwagi przedstawia się następująco:

Wzór matematyczny dla mechanizmu uwagi w sieciach neuronowych, przedstawiający operację softmax.   (5)

Przyjmijmy, że Q, K i V są macierzami reprezentującymi odpowiednio zapytanie (query), klucz (key) i wartość (value), a d i k są wymiarami wektorów kluczy. Osadzenie tokena CLS jest osadzeniem podsumowującym, które rejestruje ogólną spójność semantyczną całej sekwencji wejściowej.

Obliczenie wyniku płynności przebiega w następujący sposób:

Wzór funkcji sigmoidalnej, Sf=sigmoid(WreghCLS+breg), wyrażenie matematyczne.  (6)

gdzie hCLS jest osadzeniem (embeddingiem) tokenu BERT [CLS], Wreg oraz breg są parametrami głowicy regresyjnej, a σ to funkcja aktywacji sigmoidalnej, która normalizuje wynik do przedziału [0, 1].

Moduł poprawności

Ocena poprawności koncentruje się na dokładności gramatycznej, precyzji mechanicznej oraz przestrzeganiu standardowych konwencji języka angielskiego. Wymiar ten odnosi się do technicznych aspektów pisania, w tym do składni, morfologii, interpunkcji oraz poprawności ortograficznej. Komponent poprawności nie tylko ocenia liczbę błędów językowych, ale także bada ich wpływ na ogólną jakość tekstu. W przeciwieństwie do oceny biegłości, która kładzie nacisk na spójność semantyczną i naturalny przepływ, moduł oceny poprawności wymaga precyzyjnej identyfikacji błędów i systematycznej korekty. Moduł ten rozróżnia poszczególne rodzaje błędów, ocenia ich stopień dotkliwości i dostarcza celowanych poprawek w celu wspierania procesu nauki. Do obliczania straty poprawności wykorzystano model FLAN-T5, który został dostrojony do wykrywania i korygowania błędów gramatycznych. Wybór ten wynika z możliwości transformacji tekstu w tekście modelu T5, co pozwala systemowi nie tylko na znajdowanie błędów, ale także na wprowadzanie odpowiednich korekt w ramach jednego systemu. System ma formę koder-dekoder, a tekst jest wprowadzany w formie tej transformacji: (patrz Rysunek 3)

Formuła korekcji tekstu T5, T5_Decoder(T5_Encoder), metoda kodowania.   (7)

Element kodera generuje reprezentacje wrażliwe na kontekst, które oddają nie tylko tendencje gramatyczne, ale także potencjalne obszary występowania błędów:

Równanie kodowania sieci neuronowej: wzór H_enc = T5Encoder(T_input).   (8)

Dzięki generowaniu odpowiednich wariantów gramatycznych dla błędnie zidentyfikowanych pomyłek, dekoder generuje poprawione sekwencje:

Wyrażenie matematyczne, T_corrected = T5Decoder(H_enc), model sieci neuronowej, dekodowanie tekstu.   (9)

Tego rodzaju dwukierunkowe przetwarzanie pozwala systemowi na rozpoznawanie kontekstów błędów oraz sposobu ich korygowania, dzięki czemu wskazówki są spójne semantycznie, a jednocześnie koncentrują się na poprawkach gramatycznych.

Kwantyfikacja błędu i algorytm punktacji

Wskaźnik dokładności porównywał tekst oryginalny z wersją poprawioną, uwzględniając błędy językowe oraz ich stopień nasilenia w zależności od pozycji w tekście i stopnia zakłócenia znaczenia. Metoda ta pozwala uchwycić rozróżnienie między rodzajami błędów a ich wpływem na zrozumienie treści tekstu. Zależność między częstotliwością błędów a niską jakością tekstu została w systemie oceniania uwzględniona w sposób logarytmiczny. Podstawowym etapem porównywania tokenów tekstu oryginalnego i poprawionego są dwa stopnie porównania, które opierają się na technice wyrównywania ciągów znaków na poziomie bitowym. Drugi etap obejmuje identyfikację i klasyfikację rodzajów błędów w oparciu o znane taksonomie językowe, które rozróżniają błędy gramatyczne (zgoda podmiotu z orzeczeniem, spójność czasów i poprawność struktury składniowej), błędy mechaniczne (pisownia wielkich liter, interpunkcja i ortografia) oraz błędy użycia (dobór słownictwa, wyrażenia idiomatyczne i odpowiedni rejestr). Trzecim etapem jest obliczenie współczynnika błędów na podstawie całkowitej długości tekstu. Czwarty krok wykorzystuje algorytm punktacji oparty na wykładniczym zaniku, który przekształca współczynniki błędów w bezpośrednio interpretowalne wyniki poprawności, aby przybliżyć nieaddytywną i nieliniową zależność między częstotliwością błędów a jakością tekstu.

Matematyczne opracowanie procesu kwantyfikacji błędów rozpoczyna się od obliczenia stosunku wprowadzonych błędów, co pozwala na wyznaczenie znormalizowanej wartości wskaźnika wprowadzania błędów, co z kolei umożliwia rzetelne porównanie tekstów o różnej długości:

Wzór na współczynnik błędów, Error_Ratio=Number_of_Corrections/Total_Tokens, równanie matematyczne.   (10)

Wzór na stałą rozpadu \(S_c = 100e^{-2.5 \cdot \text{Error Ratio}}\); równanie matematyczne.   (11)

Na podstawie empirycznej walidacji z ocenami ekspertów ustalono parametr kalibracji wynoszący 2,5, tak aby funkcja punktacji dostarczała wyników zgodnych z ludzkim rozumieniem spadku jakości tekstu wraz ze wzrostem częstotliwości błędów. Ustalenie wartości tego parametru w ten sposób gwarantuje, że każdy tekst o niskim współczynniku błędów (Error_Ratio < 0,1) otrzyma wysoką ocenę poprawności, ponieważ ściśle przestrzega zasad standardowego języka angielskiego; każdy tekst o umiarkowanym współczynniku błędów (0,1 < Error_Ratio ≤ 0,3) otrzyma pośrednią ocenę poprawności, wskazującą na występowanie pewnych zastrzeżeń językowych, które nie są jednak całkowicie krytyczne; natomiast każdy tekst o wysokim współczynniku błędów (Error_Ratio > 0,3) otrzyma niską ocenę poprawności ze względu na krytyczne błędy językowe, które znacząco utrudniają zrozumienie treści.

Algorytm punktacji poprawności stosowany w ocenie poprawności systematycznie uwzględnia wszystkie błędy zlokalizowane i naprawione przez system oparty na modelu T5 jako pozycje karne przy obliczaniu końcowego współczynnika błędów. Mechanizm przyznawania punktów karnych stosowany w przypadku błędów gramatycznych jest reprezentowany przez wykładniczy spadek wraz ze wzrostem proporcji błędów w stronę wysokich wartości, co oznacza bardzo niską jakość tekstu, a osiąga wartość 100, gdy współczynnik błędów wynosi 0, co oznacza całkowity brak wykrytych błędów. Stanowi to przykład perfekcyjnego zastosowania standardowych konwencji języka angielskiego. Taka relacja matematyczna zapewnia, że wskaźnik poprawności oferuje znaczące rozróżnienie w całym spektrum poziomów biegłości językowej i jest responsywny na niewielkie, sukcesywne postępy, które wskazują na rzeczywiste nabycie kompetencji.

Zbiory danych: korpus treningowy i ewaluacyjny

Dane treningowe o odpowiedniej jakości i zakresie mają kluczowe znaczenie dla wydajności systemu dwumodelowego. W niniejszym badaniu wykorzystano dobrze zaprojektowany zestaw danych tekstów napisanych przez studentów w celu opracowania i oceny modelu, który powstał poprzez zastosowanie różnych zadań pisarskich. Próba obejmowała 45 mężczyzn i 45 kobiet – studentów pakistańskich uniwersytetów w średnim wieku 19 lat, realizujących obowiązkowy kurs „Functional English”. Każdy student napisał osiem esejów w ciągu ośmiu tygodni, w tym w ramach pretestu, esejów interwencyjnych oraz posttestu. Studenci mieli za zadanie napisać od 400–450 słów dla każdego zadania pisarskiego. Statystyki zestawów danych wykazują następujące cechy:

70 500 słów

Średnia długość zdania: 15,7 słowa (SD = 3,2)

Zakres słownictwa (wskaźnik Type-Token Ratio): 0,64 (SD 0,08) Gęstość błędów gramatycznych: 2,3 na 100 słów (SD = 1,1)

Uzasadnienie i zapewnienie jakości wybranych danych

Wybór zbioru danych był podyktowany kilkoma istotnymi względami, które zapewniły bogactwo i relewantność w kontekście badań nad automatyczną oceną pisania. Po pierwsze, wybrano populację studentów ekonomii ze względu na charakter zbliżony do osób uczących się EFL w szkolnictwie wyższym w Pakistanie, co umożliwiło zaprezentowanie bardziej autentycznych prób pisemnych odzwierciedlających rzeczywiste sytuacje. Po drugie, ustalenie maksymalnego i minimalnego potencjalnego zakresu słów (400–450 słów) oparto na danych z badań pilotażowych, które wykazały, że zakres ten jest wystarczająco złożony językowo, aby mógł zostać wiarygodnie przeanalizowany przez maszynę, a jednocześnie zachowuje rozmiar umożliwiający spójną ocenę przez ludzi. Każda z prac została oceniona przez trzech przeszkolonych nauczycieli języka angielskiego (wiarygodność międzyoceniającymi κ = 0.847 dla wymiaru płynności oraz 0.823 dla wymiaru poprawności) przy użyciu zestandaryzowanych 10-punktowych skal oceny płynności i poprawności. Szkolenie oceniających było rygorystyczne i opierało się na opracowanych rubrykach oceniania w odniesieniu do kryteriów oceniania pisania w testach IELTS i TOEFL. Dane stanowią zestaw adnotowany przez ludzi, który może być wykorzystany do trenowania i walidacji modeli uczonych na danych z ludzkimi adnotacjami.

Procedury preprocessingu i walidacji danych

Zbiór danych został poddany systematycznemu wstępnemu przetwarzaniu, które obejmowało normalizację tekstu, tokenizację tekstu za pomocą tokenizatora BERT WordPiece oraz weryfikację jakości. W celu zapewnienia integralności danych wykluczono osoby, które przesłały niepełne prace lub przygotowały teksty zawierające plagiat. Końcowy zbiór danych został losowo podzielony na zbiór treningowy (70%, n = 189), walidacyjny (15%, n = 41) i testowy (15%, n = 40) poprzez próbkowanie warstwowe, aby zapewnić zrównoważenie poziomów biegłości oraz rodzajów zadań. Przeprowadzono analizę lingwistyczną dużego korpusu referencyjnego zawierającego profesjonalnie zredagowane teksty akademickie, artykuły prasowe oraz opublikowane eseje, obejmującego około 50 milionów słów. Korpus ten dostarcza wzorców językowych niezbędnych do przeprowadzenia testów płynności i wspomaga procedury wykrywania błędów poprzez porównanie ich ze standardowym użyciem języka. W korpusie referencyjnym etapami poprzedzającymi wstępne przetwarzanie i indeksowanie są tokenizacja, tagowanie części mowy, analiza składniowa i etykietowanie semantyczne, co ma na celu ułatwienie efektywnego dostępu podczas oceny w czasie rzeczywistym.

Strategia trenowania modelu płynności

Zaproponowano sekwencyjny system optymalizacji w celu przeszkolenia danych dla osiągnięcia płynności. W procesie uczenia wykorzystano najnowocześniejsze funkcje, w tym adaptacyjne harmonogramowanie tempa uczenia, progresywny rozmiar partii (batch size) oraz zaawansowane metody regularyzacji zapobiegające przeuczeniu w miarę postępu treningu, co pozwala utrzymać skuteczność modelu w identyfikacji wzorców językowych wskazujących na biegłość językową. Tempo uczenia wynosi 5 × 10-4 z liniowym harmonogramem spadku, skonfigurowanym tak, aby zapewnić stabilną zbieżność i uniknąć oscylacji wokół optymalnych wartości parametrów. Tempo uczenia to wybrano za pomocą wyszukiwania siatkowego (grid search) w przedziale [1 x 10-6, 1 x 10-4], przy czym 5 x 10-5 okazało się najbardziej odpowiednim kompromisem między szybkością zbieżności a stabilnością. Właściwe trenowanie zostało ograniczone do zaledwie 3 epok, co jest konfiguracją zoptymalizowaną na podstawie korzyści empirycznych wynikających z monitorowania straty walidacyjnej, aby zapobiec przeuczeniu, nie ograniczając jednocześnie aktualizacji parametrów w stopniu uniemożliwiającym efektywną naukę. W celu zapobieżenia degradacji zastosowano mechanizmy wczesnego zatrzymania (early halting) z cierpliwością (patience) wynoszącą 2 epoki i minimalnym delta na poziomie 0,001.

Optymalizacja jest przeprowadzana za pomocą optymalizatora AdamW, przy uproszczonych wyborach parametrów takich jak β₁ = 0.9 (pęd, który wykładniczo kontroluje zanik oszacowań pierwszego momentu), β₂ = 0.999 (estymacja drugiego momentu, która wykładniczo kontroluje zanik oszacowań drugiego momentu) oraz ε = 1 × 10⁻8 (wyraz stabilności numerycznej). Regularyzacja w postaci weight decay (λ = 0.01) zapobiega nadmiernemu wzrostowi wartości parametrów, a wartość ta została wybrana na podstawie analizy wyników walidacji w zakresie [0.001, 0.1]. Rozbudowany system monitorowania pozwala śledzić różne metryki w trakcie treningu, aby zagwarantować optymalną wydajność modelu i uniknąć przeuczenia. W ramach struktury monitorowania ujęto:

Śledzenie strat: Straty treningowe i walidacyjne są monitorowane w każdej epoce, a wczesne zatrzymanie (early stopping) następuje automatycznie, gdy strata walidacyjna nie ulega poprawie przez 2 kolejne epoki.

Metryki wydajności: Dane walidacyjne są wykorzystywane do obliczania współczynników korelacji Pearsona między wynikami przewidywanymi a rzeczywistymi co 100 kroków treningowych.

Wykrywanie gradientów: Normy gradientów są monitorowane w celu wykrycia zanikających i eksplodujących gradientów, a przy normie gradientu wynoszącej 1,0 stosowane jest przycinanie gradientów.

Harmonogram tempa uczenia: Zmniejszenie tempa uczenia na podstawie walidacji (czynnik = 0,5) w przypadku wykrycia plateau trwającego ponad 1 epokę.

Kwestie regularyzacji: Współczynniki dropout (0,1 dla BERT, 0,3 dla głowicy regresyjnej) zostały określone poprzez systematyczną ablację. Podczas procesu trenowania zastosowano kilka metod regularyzacji zapobiegających przeuczeniu: (1) regularyzację dropout z wykorzystaniem zoptymalizowanych współczynników dla każdego typu warstwy w sieci, (2) decay wag, zgodnie z powyższym opisem, (3) wczesne zatrzymanie (early stopping), determinowane przez wyniki na zbiorze walidacyjnym, oraz (4) augmentację danych polegającą na parafrazowaniu 15% przykładów treningowych przy użyciu metod tłumaczenia zwrotnego. Punkty kontrolne (checkpoints) najlepiej działającego modelu zapisywano po każdej epoce, a modele z najwyższymi wynikami wybierano na podstawie wskaźników korelacji walidacyjnej. Funkcją straty użytą w części oceny płynności jest błąd średniokwadratowy (MSE), który stanowi główną funkcję celu dla zadania regresji polegającego na przewidywaniu ciągłych wyników płynności. Matematyczny zapis funkcji straty przedstawia się następująco:

Równanie funkcji straty płynności, L_fluency, analiza wartości przewidywanych w stosunku do rzeczywistych, formuła matematyczna.  (12)

N to całkowita wielkość próby treningowej, y_pred, i to przewidywany wynik biegłości dla i-tej próbki, a y_true, i to odpowiadający mu wynik rzeczywisty ustalony przez ekspertów oceniających. Ta funkcja straty jest bardzo użyteczna w kwadratowym ograniczaniu błędu między wartością przewidywaną a rzeczywistą, tak aby większe błędy wiązały się z większą karą; jest ona również różniczkowalna. Mechanizm harmonogramowania tempa uczenia jest zaawansowany i składa się z dwufazowego procesu: rozpoczyna się od etapu liniowego rozgrzewania (warmup), po którym następuje proces systematycznego zaniku w celu uzyskania optymalnych cech zbieżności. W fazie rozgrzewania tempo uczenia rozpoczyna się od zera i stopniowo zmienia się do wartości maksymalnej, po czym parametry modelu są optymalizowane względem zbioru treningowego. Wyrażenie matematyczne fazy rozgrzewania ma postać:

Równanie harmonogramu tempa uczenia, lr(t)=lrmax·min(t/warmup_steps,1.0), formuła matematyczna.   (13)

Po fazie rozgrzewki (warmup), szybkość uczenia jest systematycznie zmniejszana w sposób liniowy, aby uniknąć przekroczenia optymalnych wartości parametrów i zapewnić stabilną zbieżność. Matematycznie faza zaniku przyjmuje postać:

Równanie harmonogramu tempa uczenia, lr(t)=lr_max*(1-(t-warmup_steps)/(total_steps-warmup_steps)).   (14)

gdzie t to aktualny krok uczenia, lr max to maksymalna szybkość uczenia osiągnięta podczas rozgrzewki, warmup to liczba kroków przypisanych do fazy rozgrzewki, a total to całkowita liczba kroków uczenia we wszystkich epokach. Wspomniana procedura harmonogramowania zapewnia agresywne uczenie modelu na niższych poziomach oraz stabilność na poziomach zbieżności.

Strategia trenowania modelu poprawności

Model poprawności oparto na strategii uczenia transferowego (transfer learning) z wykorzystaniem wstępnie wytrenowanego modelu FLAN-T5, aby w razie potrzeby skorzystać z całej dostępnej wiedzy gramatycznej. Miało to na celu analizę ogólnego rozumienia języka, a także specyficznych informacji dotyczących błędów popełnianych przez osoby uczące się języka angielskiego jako drugiego (ESL). Zastosowana metoda uczenia transferowego wykorzystuje punkt kontrolny pszemraj/flan-t5-large-grammar-synthesis jako model bazowy, który oferuje kilka istotnych zalet w zakresie poprawności. Ponieważ model jest już wytrenowany i posiada wysoką zdolność rozumienia języka wypracowaną na różnorodnych obszarach tekstowych, potrafi on przystosować się do wielu stylów i tematów pisania. W szczególności przeprowadzono dostrajanie (fine-tuning) specyficzne dla gramatyki na dużych zbiorach danych korygujących, obejmujących wiele rodzajów błędów gramatycznych spotykanych w tekstach pisanych w drugim języku. Co więcej, punkt kontrolny zawiera wydajne systemy wykrywania błędów, które zostały przetestowane pod kątem różnych typów pomyłek (tj. błędów morfologicznych, składniowych i semantycznych), tworząc idealny standard porównawczy dla wrodzonych parametrów testowania korekty w niniejszym badaniu.

Proces adaptacji domeny odzwierciedla systematyczne modyfikacje parametrów, które nie zmieniają ogólnych zdolności rozumienia języka modelu wstępnie wytrenowanego, lecz wprowadzają specyficzne cechy rozwiązania zadania oceny pisemnej. Ten proces adaptacji ma następujące wyprowadzenie matematyczne:

Wzór adaptacji domeny θ_final=θ_pretrained+Δθ_domain; aktualizacja modelu uczenia maszynowego.   (15)

Tutaj θpretrained reprezentuje parametry wstępnie wytrenowanego modelu kodujące ogólne rozumienie języka i wiedzę gramatyczną, a Δθdomain reprezentuje specyficzne aktualizacje parametrów wyuczone na podstawie docelowego zadania oceny pisania. Aktualizacje specyficzne dla dziedziny są obliczane poprzez optymalizację opartą na gradiencie na zbiorze danych docelowych, co zapewnia rozwój w modelu specyficznej dla zadania wrażliwości na rodzaje błędów powszechnie występujące w pisaniu w języku EFL, bez zakłócania jego szerszych możliwości językowych.

Eksperymenty z porównaniami

Aby udowodnić funkcjonalność EG, jako kluczową wartość pomiarową zaproponowano współczynnik korelacji Pearsona, który określa liniową zależność między wynikami automatycznymi a wiedzą ekspercką ludzi. Współczynnik korelacji oblicza się według wzoru:

Wzór na współczynnik korelacji, r, równanie, analiza statystyczna, obliczanie korelacji danych.    (16)

Gdzie xi reprezentuje wyniki automatyczne, reprezentuje oceny ludzkie, a obliczenie równowagi statycznej, równanie ΣFx=0, ΣFy=0, schemat strukturalny oraz Równowaga statyczna; schemat ΣFx=0, ΣFy=0 z wektorami sił; narzędzie analizy mechaniki to odpowiednie wartości średnie. Współczynnik korelacji mieści się w zakresie od −1 do 1, przy czym wartości bliskie 1 wskazują na silny dodatni związek między oceną automatyczną a ludzką.

Wzór na średni błąd bezwzględny, MAE=1/N Σ|y_pred,y_true|; narzędzie analizy statystycznej.    (17)

Wzór na błąd średniokwadratowy, równanie RMSE do statystycznej analizy błędów, dokładność predykcyjna.    (18)

Wzór na R-kwadrat: R² = 1 - SSres/SStot; analiza statystyczna, równanie dopasowania danych.    (19)

Porównania z modelem bazowym

Aby ocenić wydajność EG i wykazać jego przewagę nad istniejącymi metodami, przeprowadzono szczegółowe porównania z uznanymi systemami AWE oraz tradycyjnymi podejściami opartymi na pojedynczej metryce. Porównania te z modelami bazowymi są niezbędne do walidacji wartości dodanej architektury EG i wykazania, że integracja oceny płynności i poprawności zapewnia mierzalną poprawę w stosunku do podejść koncentrujących się na poszczególnych wymiarach w izolacji. Wybór modeli bazowych obejmuje cztery kategorie AWE, z których każda odzwierciedla odmienną orientację w kwestii sposobu oceniania pisania. Pierwsza z nich obejmuje pojedynczy model oparty na BERT do oceny płynności. Modele te wykorzystują architektury transformera do oceny wzorców tekstowych pod kątem gładkości i spójności. Druga kategoria, osadzona w tradycyjnych metodologiach lingwistycznych, koncentruje się na systemach opartych na regułach do wykrywania błędów gramatycznych. W związku z tym nacisk położono na poprawność, pomijając inne aspekty związane z jakością pisania, takie jak kohezja i treść. Trzecią kategorią są systemy AWE oparte na cechach, które obejmują wskaźniki złożoności lingwistycznej — takie jak zmienność długości zdań, dywersyfikacja leksyki i złożoność syntaktyczna — w celu wygenerowania ogólnych wyników jakości. Czwarta kategoria uwzględnia systemy hybrydowe, łączące różne lingwistyczne cechy powierzchniowe, często z wykorzystaniem metod zespołowych lub średnich ważonych. Modele te nie osiągają poziomu zintegrowanego zaawansowania, który charakteryzuje architektury neuronowe EG. Wydajność modeli bazowych oceniano w trzech głównych wymiarach. Pierwszy mierzy zgodność ocen generowanych przez system z ocenami wyszkolonych ekspertów (lektorów języka angielskiego) przy użyciu zestandaryzowanych rubryk. Drugi określa generalizowalność, identyfikując, czy wydajność pozostaje spójna w przypadku trzech esejów o różnej tematyce i stopniu złożoności. Trzeci wymiar opiera się na niezawodności predykcyjnej, oceniając dokładność i stabilność punktacji za pomocą narzędzi statystycznych, takich jak średni błąd bezwzględny, pierwiastek błędu średnio kwadratowego oraz analiza przedziału ufności. Wspólnie wymiary te tworzą solidne ramy porównawcze i podkreślają przewagę systemów EG, szczególnie w osiąganiu większej precyzji i stabilności niż w przypadku podejść tradycyjnych.

Grupy eksperymentalna i kontrolna

Badanie to objęło 90 studentów ekonomii na poziomie licencjackim, którzy uczęszczali na kurs języka angielskiego w ramach dwóch nienaruszonych grup zajęciowych. Dane zbierano w trzech etapach: przed testem, w trakcie interwencji oraz po teście, aby śledzić postępy w dokładności i płynności pisania w czasie. Badanie z udziałem ludzi zostało zatwierdzone przez Radę Doradczą Wydziału Uniwersytetu COMSATS w Islamabadzie, kampus w Lahore, Pakistan. Uczestnicy zostali poddani dwóm warunkom: tradycyjnej informacji zwrotnej od człowieka oraz informacji zwrotnej wspomaganej komputerowo. Grupa kontrolna składała się z 45 studentów, którzy otrzymywali tradycyjną pisemną informację zwrotną od wykwalifikowanego lektora języka angielskiego. Uczestnicy otrzymywali pisemne uwagi do swoich esejów w formie ocen holistycznych, wskazania błędów oraz rekomendacji w postaci komentarzy instruktora dotyczących sposobu poprawy pracy. Grupa eksperymentalna obejmowała z kolei 45 studentów, których nauczano w ten sam sposób w klasie, jednak pisanie studentów było wspierane przez szybką, zautomatyzowaną informację zwrotną dostarczaną przez EG, która dostarczała im informacji diagnostycznych, zarówno w zakresie płynności, jak i poprawności, w ciągu około 30 sekund od przesłania tekstu.

Badanie to przeprowadzono w ciągu 8 tygodni, rozpoczynając od testu wstępnego (tydzień 1) w celu określenia początkich umiejętności pisania osób badanych przed zastosowaniem interwencji. Przez sześć tygodni uczestnicy z grupy eksperymentalnej otrzymywali informacje zwrotne generowane komputerowo z wykorzystaniem markerów semantycznych NLP, natomiast uczestnicy z grupy kontrolnej otrzymywali oceny nauczycieli. Ostatecznie przeprowadzono test końcowy (w tygodniu 8), aby zbadać różnice między wynikami dokładności i płynności w pomiarach przed i po interwencji. W celu zapewnienia porównywalności wyników, respondenci byli proszeni o wykonywanie podobnych zadań pisemnych w każdym okresie oceny, co pozwoliło zminimalizować potencjalne zmienne zakłócające związane z trudnością zadań oraz stopniem znajomości treści. Aby zapewnić spójność poziomu trudności poleceń oraz ustanowić trafność treściową, polecenia pisemne zostały dobrane w sposób kongruentny. Tematy wypracowań wybrano tak, aby studenci poruszali różne obszary tematyczne, co miało zapobiec efektowi wprawy oraz znudzeniu uczestników wynikającemu z konieczności wykonywania podobnych zadań przez dłuższy czas.

W fazie wstępnej uczestnicy zostali poproszeni o napisanie eseju o długości 400–450 słów na temat celów naukowych i zawodowych. To zadanie opisowe opierało się na osobistych doświadczeniach i przyszłych planach, co wymagało uporządkowania tekstu, podania jasnych przykładów oraz logicznego sformułowania osobistych celów i motywacji. Zadania pisemne w ramach interwencji opierały się na różnych tematach, takich jak opis codziennej rutyny, hobby, podróże, pierwszy dzień na uniwersytecie, pamiętne dni z życia oraz chwile spędzone z najlepszym przyjacielem. Temat testu końcowego dotyczył „Wpływu technologii na komunikację”, a wymagana długość eseju wynosiła 400–450 słów.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ważność i wiarygodność podejścia statystycznego

System został przetestowany przy użyciu różnych komplementarnych metod statystycznych, które dostarczyły wyczerpujących dowodów na wpływ EG na rozwój pisania. Jest to wieloaspektowa metoda analityczna, która uznaje, że interwencje edukacyjne podlegają złożonej analizie statystycznej, której nie można sprowadzić do zwykłych porównań grup, lecz raczej do analizy wzorców zmian, wielkości efektów oraz korelacji różnych strategii pomi...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wyniki eksperymentów pokazują kilka istotnych osiągnięć. Po pierwsze, system dwóch modeli osiągnął silną korelację z ocenami ekspertów ludzkich (r = 0,923), znacznie przewyższając podejścia pojedynczego modelu i współczesne systemy AWE. Po drugie, kontrolowane badanie interwencji wykazało istotną poprawę w zakresie pisania uczniów ESL, przy czym duże rozmiary efektu (d = 1,28) przewyższały te opisane w najnowszej literaturze. Po trzecie, system wykazał lepszą wydajność w wielu metrykach ewaluacji, w tym obniżył średni bł...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nie ma konfliktów interesów wśród wszystkich autorów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Doceniamy wsparcie COMSATS University Islamabad na kampusie w Lahore oraz wydziału anglistyki w zbieraniu danych od studentów.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
OPROGRAMOWANIE / BIBLIOTEKI UŻYTE W BADANIU
Ramy Deep LearningPyTorch1.13.1Ramy głębokiego uczenia do implementacji sieci neuronowych
Modele wstępnie wytrenowaneTransformers (Przytulająca Twarz)4.21.3Wstępnie wytrenowane ładowanie modeli, implementacje modeli BERT i T5
Model językowyBERT (Dwukierunkowe reprezentacje enkodera z transformers)Bert-podstawa-bez obudowyOcena płynności, ocena spójności semantycznej, zrozumienie kontekstowe
Model językowyFLAN-T5 (Precyzyjnie dostrojony język Net T5)pszemraj/flan-t5-large-grammar-synthesisKorekcja błędów gramatycznych, transformacja tekstu na tekst, wykrywanie błędów
Obliczenia numeryczneNumPy1.23.5Obliczenia numeryczne, operacje tablicowe dla funkcji matematycznych
Analiza danychPandy1.5.2Manipulacja danymi, analiza statystyczna i wstępne przetwarzanie
Uczenie maszynoweScikit-learn1.1.3Obliczanie metryk statystycznych, analiza korelacji, metryki ewaluacyjne
WizualizacjaMatplotlib3.6.2Wizualizacja danych, wykresy postępów treningowych, wykresy wydajności
WizualizacjaSeaborn0.12.1Wizualizacja danych statystycznych, mapy korelacji termiczne
Zestaw narzędzi NLPNLTK (Natural Language Toolkit)3.7Wstępne przetwarzanie tekstu, tokenizacja, analiza językowa
Przetwarzanie NLPSpaCy3.4.4Zaawansowane preprzetwarzanie NLP, tagowanie POS, analiza składniowa
TokenizacjaTokenizery0.13.2Szybka tokenizacja dla BERT WordPiece i tokenizacji T5
OPROGRAMOWANIE STATYSTYCZNE I ANALITYCZNE
Oprogramowanie statystyczneOprogramowanie statystyczne SPSSWersja 26.0Analiza statystyczna, niezależne próby T-testy, ANOVA, analiza korelacji
Zbiór danych treningowychKaggle ASAP DatasetWersja z 2012 rokuReferencje korpusu treningowego (90% modeli AWE korzysta z tego zbioru danych)
BIBLIOTEKI OPTYMALIZACJI I TRENINGU PYTHONA
Optymalizatortorch.optim.AdamWPyTorch 1.13.1Optymalizacja modelu z regularizacją spadku wagi (λ=0,01), β 1=0,9, β 2=0,999, ε=1&razy; 10< sprzeciw>-20< godzina>
Utrata / Aktywacjatorch.nn.functionalPyTorch 1.13.1Aktywacja igowa, funkcje utraty, regularizacja wypadająca
Ładowanie danychtorch.utils.data.DataLoaderPyTorch 1.13.1Stopniowe rozmiarowanie partii (4→ 16), ładowanie i grupowanie danych
TokenizacjaTransformers. AutoTokenizerTransformers 4.21.3Tokenizacja BERT WordPiece, wstępne przetwarzanie tekstu
Ładowanie modeluTransformers. AutoModelTransformers 4.21.3Wstępnie wytrenowane ładowanie modeli dla architektur BERT i T5
Kontrola gradientutorch.nn.utils.clip_grad_norm_PyTorch 1.13.1Przycinanie gradientu (próg: 1,0) dla treningu stabilności
Harmonogram LRtorch.optim.lr_schedulerPyTorch 1.13.1Planowanie tempa uczenia się z liniowym zanikiem i rozgrzewką
Metrykisklearn.metricsScikit-learn 1.1.3Korelacja Pearsona, MAE, obliczenia RMSE do oceny
PYTHONA
Klasa bazowaModuł torch.nn.PyTorch 1.13.1Klasa bazowa dla niestandardowych architektur sieci neuronowych (Fluency & Moduły poprawności)
Warstwy liniowetorch.nn.LinearPyTorch 1.13.1Implementacja głowicy regresji liniowej (768→ 512→ 256→ 128→ 1 neurony)
Regularizacjatorch.nn.DropoutPyTorch 1.13.1Regularizacja z rezygnacji (0,1 dla BERT, 0,3 dla regresyjnej głowy)
Aktywacjatorch.nn.functional.sigmoidPyTorch 1.13.1Aktywacja sigmoidalów dla normalizacji wyników płynności [0,1]
Aktywacjatorch.nn.functional.reluPyTorch 1.13.1Aktywacja ReLU w warstwach regresji dla transformacji nieliniowych
TransformerTransformers. BertModelTransformers 4.21.312 warstw transformatorów z wielogłowicową samouwagą do oceny płynności
Seq2SeqTransformers. T5For
Generowanie warunkowe
Transformers 4.21.3Architektura enkodera-dekodera do korekcji błędów gramatycznych
Funkcja stratytorch.nn.MSELossPyTorch 1.13.1Średnia kwadratowa funkcja straty błędu dla treningu regresji płynności
PYTHON LIBRARY EVALUATION AND METRICS LIBRARIES
Korelacjascipy.stats.pearsonrSciPy 1.9.3Współczynnik korelacji Pearsona dla zgodności modelu z człowiekiem
Metryka błędusklearn.metrics.mean_absolute_errorScikit-learn 1.1.3Obliczenie średniego błędu bezwzględnego (MAE) dla dokładności predykcji
Metryka błędusklearn.metrics.mean_squared_errorScikit-learn 1.1.3Średni kwadratowy błąd korzeniowy (RMSE) do oceny wielkości błędu
Test statystycznyscipy.stats.ttest_indSciPy 1.9.3Niezależne próby testu t do testów istotności statystycznej
Macierz korelacjinumpy.corrcoefNumPy 1.23.5Obliczanie macierzy korelacji dla wiarygodności między oceniającymi
Korelacja danychPandy. DataFrame.corrPandas 1.5.2Analiza korelacji danych i raportowanie statystyczne
Wizualizacjamatplotlib.pyplotMatplotlib 3.6.2Wizualizacja wydajności, wykresy korelacji, wykresy postępów w treningu
Mapa ciepłaseaborn.heatmapSeaborn 0.12.1Wizualizacja macierzy korelacji i prezentacja danych statystycznych
PYTHON PROCESSING I BIBLIOTEKI NLP
Przetwarzanie teksture (Wyrażenia regularne)Wbudowany Python 3.9+Dopasowywanie wzorców tekstu, czyszczenie i wstępne przetwarzanie danych
Obsługa konfiguracjijsonWbudowany Python 3.9+Obsługa plików konfiguracyjnych, przechowywanie parametrów modelu
SerializacjaOgórekWbudowany Python 3.9+Serializacja modeli i zapisywanie/ładowanie punktów kontrolnych
Śledzenie postępówTQDM4.64.1Paski postępu dla pętli treningowych i przetwarzania danych
WycinkowanieLogowanieWbudowany Python 3.9+Rejestrowanie postępów treningowych, śledzenie błędów i debugowanie
PowtarzalnośćlosowoWbudowany Python 3.9+Losowe ustawienie zalążkowe dla eksperymentów powtarzalnych
System plikówOSWbudowany Python 3.9+Operacje systemu plików, zarządzanie ścieżkami modeli
Parsowanie CLIargparseWbudowany Python 3.9+Parsowanie argumentów w wierszu poleceń dla konfiguracji treningowych
KOMERCYJNA AWE / PLATFORMY AES (Odniesienie)
Platforma komercyjnaPigai.orgKomercyjna platforma AWEChińska ocena pisania EFL, zautomatyzowane systemy informacji zwrotnej
Platforma komercyjnaBingo angielskiKomercyjny system AWEWsparcie w nauce języka angielskiego, rozwój umiejętności pisania
Platforma edukacyjnaMój dostępPlatforma do pisania edukacyjnegoOcena pisania uczniów i przekazywanie informacji zwrotnej
Silnik punktacjiE-raterAutomatyczny silnik punktacji ETSOcena eseju standaryzowanego testu, holistyczna ocena
Narzędzie ocenyI-writeNarzędzie do oceny pisaniaOcena pisania akademickiego i informacja zwrotna diagnostyczna
Służba treningowaKryteriumUsługa ćwiczeń pisania ETSRozwój umiejętności pisania i automatyczna informacja zwrotna
Model językowy AIChatGPTModel językowy OpenAIOpinia i ocena pisania wspomagana przez AI (cytowane w literaturze)
LEARNING (Cytowane w literaturze)
ArchitekturaRekurencyjne sieci neuronowe (RNN)Cai, 2019Sekwencyjne przetwarzanie tekstu — Systemy sprzężenia zwrotnego i automatyczna ocena
ArchitekturaDługa pamięć krótkotrwała (LSTM)Jin i in., 2018Modelowanie zależności na długi zasięg — Automatyczne ocenianie esejów i analiza sekwencji
ArchitekturaKonwolucyjne sieci neuronowe (CNN)Dong i in., 2017Lokalne rozpoznawanie wzorców — Klasyfikacja tekstu i ekstrakcja cech do oceny
ArchitekturaHybryda transformer-LSTMXuan, 2025Połączone przetwarzanie kontekstowe i sekwencyjne — Automatyczne punktowanie i generowanie informacji zwrotnej
ArchitekturaAutomatykodery wariacyjne (VAE)Kumar i in., 2024Modelowanie generatywne — Wzmocniony rozwój umiejętności pisania i spersonalizowana informacja zwrotna
ArchitekturaSystemy wieloagentoweThompson i in., 2024Wspólne przetwarzanie AI & mdash; Zaawansowane wsparcie pisarskie (platforma AcademiCraft)
MechanizmMechanizmy uwagiDong i in., 2017Uwaga na siebie i wielogłowa uwaga — Poprawiona wydajność AES i zrozumienie kontekstu
TRADYCYJNE TECHNIKI UCZENIA MASZYNOWEGO (Referencja)
Metoda statystycznaTwierdzenie BayesaRudner & Liang, 2002Tradycyjne podejście ML — wczesny rozwój AES/AWE i punktacja probabilistyczna
Metoda statystycznaRegresja liniowaPhandi i in., 2015Modelowanie statystyczne — Ocena pisania oparta na cechach i prognozowanie wyników
Metoda uczenia sięUczenie się preferencji rangChen & He, 2013Metodologia oparta na rankingu & mdash; Ocena eseju porównawcza i modelowanie preferencji
Model językowyModele N-gramoweXie i in., 2015Statystyczne modelowanie językowe — Korekcja błędów gramatycznych i rozpoznawanie wzorców
ArchitekturaArchitektura encoder-dekoderGe i in., 2018Modelowanie sekwencja po sekwencji — Korekcja błędów gramatycznych i transformacja tekstu
Standard ocenyOcena pisemna IELTSDostosowanie rubryki punktacjiStandaryzowane kryteria oceny płynności i poprawności
Standard ocenyOcena pisania TOEFLStandardy pisania akademickiegoOcena biegłości i standaryzowane punktowanie
Miara statystycznaRozmiar efektu D Cohena0,2=mały, 0,5=średni, 0,8=dużyOcena praktycznej istotności dla skuteczności interwencji
Miara niezawodnościNiezawodność między oceniającymi (κ)Płynność: 0,847 / Poprawność: 0,823Współczynnik kappa & mdash; Walidacja zgodności i zgodności przez ludzkiego ewaluatora

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Bitchener, J. Evidence in support of written corrective feedback. J Second Lang Writ. 17 (2), 102-118 (2008).
  2. Nusrat, A., Ashraf, F., Narcy-Combes, M. F. Effect of direct and indirect teacher feedback on accuracy of English writing: A quasi-experimental study among Pakistani undergraduate students. 3L Lang Linguist Lit. 25 (4), 84-98 (2019).
  3. Nusrat, A., Khan, S., Kashif, F., Fawad, R. Effect of teachers’ asynchronous e-feedback and synchronous oral feedback on English language learners’ writing accuracy. Front Educ. 7, 783684 (2022).
  4. Chen, B., Bao, L., Zhang, R., Zhang, J., Liu, F., Wang, S., et al. A multi-strategy computer-assisted EFL writing learning system with deep learning incorporated and its effects on learning: A writing feedback perspective. J Educ Comput Res. 61 (8), 60-102 (2024).
  5. Li, J., Link, S., Hegelheimer, V. Rethinking the role of automated writing evaluation (AWE) feedback in ESL writing instruction. J Second Lang Writ. 27, 1-18 (2015).
  6. Ellis, R. Explicit form-focused instruction and second language acquisition. The handbook of educational linguistics. , 437-455 (2008).
  7. Shamim, F. Trends, issues and challenges in English language education in Pakistan. Asia Pac J Educ. 28 (3), 235-249 (2008).
  8. Haider, G. An insight into difficulties faced by Pakistani student writers: Implications for teaching of writing. J Educ Soc Res. 2 (3), 17-27 (2012).
  9. Nawaz, M., Hussain, S. A., Bughio, F. A. Exploring the preferred corrective feedback and practiced corrective feedback among Pakistani ESL secondary school students and teachers in writing class: Matches and mismatches. Int J Lang Lit Transl. 6 (1), 31-45 (2023).
  10. Rudner, L. M., Liang, T. Automated essay scoring using Bayes theorem. J Technol Learn Assess. 1 (2), 1-22 (2002).
  11. Phandi, P., Chai, K. M. A., Ng, H. T. Flexible domain adaptation for automated essay scoring using correlated linear regression. , 431-439 (2015).
  12. Cai, C. Automatic essay scoring with recurrent neural network. , 1-7 (2019).
  13. Jin, C., He, B., Hui, K., Sun, L. TDNN: A two-stage deep neural network for prompt-independent automated essay scoring. 1, 1088-1097 (2018).
  14. Dong, F., Zhang, Y., Yang, J. Attention-based recurrent convolutional neural network for automatic essay scoring. CoNLL. , 153-162 (2017).
  15. Sharma, A., Kabra, A., Kapoor, R. Feature enhanced capsule networks for robust automatic essay scoring. , 365-380 (2021).
  16. Mim, F. S., Inoue, N., Reisert, P., Ouchi, H., Inui, K. Corruption is not all bad: Incorporating discourse structure into pre-training via corruption for essay scoring. IEEE ACM Trans Audio Speech Lang Process. 29, 2202-2215 (2021).
  17. Cummins, R., Rei, M. Neural multi-task learning in automated assessment. arXiv. , 1-9 (2018).
  18. Cao, Y., Jin, H., Wan, X., Yu, Z. Domain-adaptive neural automated essay scoring. , 1011-1020 (2020).
  19. Jiang, Z., Liu, M., Yin, Y., Yu, H., Cheng, Z., Gu, Q., et al. Learning from graph propagation via ordinal distillation for one-shot automated essay scoring. , 2347-2356 (2021).
  20. Li, X., Chen, M., Nie, J. Y. SEDNN: Shared and enhanced deep neural network model for cross-prompt automated essay scoring. Knowl Based Syst. 210, 106491 (2020).
  21. Beseiso, M., Alzubi, O. A., Rashaideh, H. A novel automated essay scoring approach for reliable higher educational assessments. J Comput High Educ. 33 (3), 727-746 (2021).
  22. Xie, W., Huang, P., Zhang, X., Hong, K., Huang, Q., Chen, B., et al. Chinese spelling check system based on an n-gram model. , 128-136 (2015).
  23. Brockett, C., Dolan, W. B., Gamon, M. Correcting ESL errors using phrasal SMT techniques. , 249 (2006).
  24. Zhang, S., Huang, H., Liu, J., Li, H. Spelling error correction with soft-masked BERT. , 882-890 (2020).
  25. Ge, T., Wei, F., Zhou, M. Reaching human-level performance in automatic grammatical error correction: An empirical study. arXiv. , 1-15 (2018).
  26. Zhao, W., Wang, L., Shen, K., Jia, R., Liu, J. Improving grammatical error correction via pre-training a copy-augmented architecture with unlabeled data. 1, 156-165 (2019).
  27. Shermis, M. D., Koch, C. M., Page, E. B., Keith, T. Z., Harrington, S. Trait ratings for automated essay grading. Educ Psychol Meas. 62 (1), 5-18 (2002).
  28. Mizumoto, A., Shintani, N., Sasaki, M., Teng, M. F. Testing the viability of ChatGPT as a companion in L2 writing accuracy assessment. Res Methods Appl Linguist. 3 (2), 100116 (2024).
  29. Ajabshir, Z. F., Ebadi, S. The effects of automatic writing evaluation and teacher-focused feedback on CALF measures and overall quality of L2 writing across different genres. Asian Pac J Second Foreign Lang Educ. 8 (1), 26 (2023).
  30. Almusharraf, N., Alotaibi, H. An error-analysis study from an EFL writing context: Human and automated essay scoring approaches. Tech Knowl Learn. 28 (3), 1015-1031 (2023).
  31. Chen, H., Pan, J. Computer or human: A comparative study of automated evaluation scoring and instructors' feedback on Chinese college students' English writing. Asian Pac J Second Foreign Lang Educ. 7 (1), 34 (2022).
  32. Liu, X., Zhang, Y., Chen, L. The transformative impact of AI-powered tools on academic writing: Perspectives of EFL university students. Lang Learn Technol. 28 (2), 78-95 (2024).
  33. Zhang, Q., Li, F. From process to product: Writing engagement and performance of EFL learners under computer-generated feedback instruction. System. 115, 102998 (2023).
  34. Kumar, S., Patel, R., Williams, T. Automated deep learning approaches in variational autoencoders (VAEs) for enhancing English writing skills. J Educ Technol Res. 45 (3), 234-251 (2024).
  35. Martinez, A., Rodriguez, P., Thompson, K. Neural automated writing evaluation with corrective feedback. Comput Linguist. 50 (1), 123-145 (2024).
  36. Thompson, J., Anderson, C., Davis, R. AcademiCraft: Transforming writing assistance for English for academic purposes with multi-agent system innovations. Artif Intell Educ. 12 (4), 445-462 (2024).
  37. Rodriguez, M., Kim, S., Brown, D. Technology-enhanced language learning in English language education: Performance analysis, core publications, and emerging trends. Appl Linguist Rev. 15 (2), 201-225 (2024).
  38. Xuan, Y. Transformer-LSTM models for automatic scoring and feedback in English writing assessment. IEEE Access. 13, 82084-82096 (2025).
  39. Anderson, R., Smith, K., Johnson, M. The impact of AI writing tools on the content and organization of students' writing: EFL teachers' perspective. Comput Educ. 195, 104712 (2023).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Kompuerowe Wspomaganie Nauki J zyk wModele Sieci NeuronowychPrzetwarzanie J zyka NaturalnegoAutomatyczna Ocena WypracowaPedagogika Pisania dla ESLInformacja Zwrotna w Zakresie GramatykiP ynno Pisania

Powiązane artykuły