$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Deskriptive Statistik
Deskriptive Statistiken liefern einen Überblick über die Merkmale der Stichprobe sowie über die Verteilung, zentrale Tendenz und Variabilität der untersuchten Variablen. In dieser Studie wurden deskriptive Analysen durchgeführt, um die Teilnehmerstichprobe zu charakterisieren und die zentralen Variablen zusammenzufassen, bevor die strukturellen Analysen durchgeführt wurden.
Tabelle 1 fasst die demografischen Merkmale der 280 Studierenden im Bereich Englisch als Fremdsprache (EFL) zusammen. Weibliche Teilnehmende machten 54,3 % (n = 152) der Stichprobe aus, während männliche Teilnehmende 45,7 % (n = 128) ausmachten. Die meisten Teilnehmenden waren 21–23 Jahre alt (52,1 %), gefolgt von den 18–20-Jährigen (36,4 %) und den 24–25-Jährigen (11,4 %). Bezüglich des akademischen Studienjahres stellten Studierende im zweiten Studienjahr die größte Gruppe dar (42,1 %), gefolgt von Studierenden im ersten (34,3 %) und dritten Studienjahr (23,6 %). Die meisten Teilnehmenden gaben eine mittlere Erfahrung mit ChatGPT an (47,1 %), während 36,8 % umfangreiche Erfahrung und 16,1 % begrenzte Erfahrung berichteten. Alle Teilnehmenden hatten zuvor bereits Kontakt mit ChatGPT gehabt, was den Einschlusskriterien der Studie entspricht; die Kategorie „begrenzte Erfahrung“ deutet auf minimale Nutzung hin, nicht auf völlige Unbekanntschaft. Die Teilnehmenden gaben überwiegend mittlere digitale Kompetenz an (54,6 %), gefolgt von hoher (30,4 %) und geringer (15,0 %) digitaler Kompetenz. Die Mehrheit der Teilnehmenden wies ein fortgeschrittenes mittleres Englisch-Niveau auf (62,5 %), während 22,9 % grundlegende und 14,6 % fortgeschrittene Englischkenntnisse angaben. Insgesamt zeigen die demografischen Merkmale, dass die Stichprobe Teilnehmende mit unterschiedlichen akademischen Hintergründen, Stufen der digitalen Kompetenz, Englischkenntnissen und Erfahrungen mit ChatGPT umfasste (Tabelle 1, Abbildung 2).
| Variable | Kategorie | Häufigkeit, n | Prozentsatz, % |
| Geschlecht | Männlich | 128 | 45,7 |
| Weiblich | 152 | 54,3 |
| Altersgruppe | 18–20 Jahre | 102 | 36,4 |
| 21–23 Jahre | 146 | 52,1 |
| 24–25 Jahre | 32 | 11,4 |
| Studienjahr | Erstes Jahr | 96 | 34,3 |
| Zweites Jahr | 118 | 42,1 |
| Drittes Jahr | 66 | 23,6 |
| Erfahrung mit ChatGPT | Begrenzte Erfahrung | 45 | 16,1 |
| Mäßige Erfahrung | 132 | 47,1 |
| Umfangreiche Erfahrung | 103 | 36,8 |
| Grad der digitalen Kompetenz | Niedrig | 42 | 15 |
| Mäßig | 153 | 54,6 |
| Hoch | 85 | 30,4 |
| Englischkenntnisse | Grundlegend | 64 | 22,9 |
| Mittelstufe | 175 | 62,5 |
| Fortgeschritten | 41 | 14,6 |
Tabelle 1: Demografische Merkmale der Studienteilnehmer. Die Tabelle fasst die demografischen Merkmale der 280 in die Studie eingeschlossenen Studierenden mit Englisch als Fremdsprache (EFL) zusammen. Häufigkeiten und Prozentangaben werden für Geschlecht, Altersgruppe, Studienjahr, Erfahrung mit ChatGPT, Grad der digitalen Kompetenz und Englischkenntnisse angegeben.

Abbildung 2. Demografische Merkmale der Studienteilnehmer. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.
Abbildung 2 zeigt die demografische Verteilung der Studienteilnehmer nach Geschlecht, Altersgruppe, Studienjahr, Erfahrung mit KI-Tools, Grad der digitalen Kompetenz und Englischkenntnissen. Die Verteilung weist einen leicht höheren Anteil weiblicher im Vergleich zu männlichen Teilnehmern auf, wobei die meisten Befragten zwischen 21 und 23 Jahre alt sind. Ein mittlerer Grad der digitalen Kompetenz und fortgeschrittene Englischkenntnisse waren die am häufigsten genannten Kategorien (Abbildung 2).
Tabelle 2 zeigt die deskriptiven Statistiken für die untersuchten Variablen. Der Unterrichtsstil, gemessen anhand von 25 Items, wies einen mittleren Wert von 3,84 (SD = 0,76) auf, wobei die Werte zwischen 2,1 und 4,8 lagen. Die Nutzung von ChatGPT, erfasst anhand von acht Items, hatte einen mittleren Wert von 3,67 (SD = 0,81), wobei die Antworten zwischen 1,5 und 5,0 variierten. Digitale Kompetenz, gemessen anhand von 29 Items, lag bei einem mittleren Wert von 3,72 (SD = 0,73), mit Werten zwischen 2,2 und 4,9. Die Motivation, bewertet anhand von 20 Items, wies den höchsten mittleren Wert auf (3,92, SD = 0,68), mit Werten zwischen 2,4 und 5,0. Die Angst, gemessen anhand von 27 Items, hatte einen mittleren Wert von 3,41 (SD = 0,89). Kreativität, erfasst anhand von 12 Items, wies einen mittleren Wert von 3,78 (SD = 0,74) auf, mit Werten zwischen 2,0 und 5,0. Diese deskriptiven Statistiken zeigen eine Variabilität der gemessenen Konstrukte auf und liefern gleichzeitig eine Gesamtübersicht über die Antworten der Teilnehmer.
| Variable | Anzahl der Elemente | Mittelwert (M) | Standardabweichung (SD) | Minimum | Maximum |
| Angst | 27 | 3,41 | 0,89 | 1,8 | 5 |
| Nutzung von ChatGPT | 8 | 3,67 | 0,81 | 1,5 | 5 |
| Kreativität | 12 | 3,78 | 0,74 | 2 | 5 |
| Digitale Kompetenz | 29 | 3,72 | 0,73 | 2,2 | 4,9 |
| Motivation | 20 | 3,92 | 0,68 | 2,4 | 5 |
| Lehrstil | 25 | 3,84 | 0,76 | 2,1 | 4,8 |
Tabelle 2: Deskriptive Statistiken für die Untersuchungskonstrukte. Die Tabelle zeigt die Anzahl der Fragebogenitems, den Mittelwert (M), die Standardabweichung (SD), den minimalen beobachteten Wert und den maximalen beobachteten Wert für Unterrichtsstil, ChatGPT-Nutzung, digitale Kompetenz, Motivation, Fremdsprachenunterrichtsangst und Kreativität basierend auf den Antworten von 280 Teilnehmern.
Gängige Verzerrung durch Methodenvarianz
Die Verzerrung durch gemeinsame Methodenvarianz (CMV) bezieht sich auf eine irreführende Kovarianz zwischen Variablen, die auf die Messmethode und nicht auf die untersuchten Konstrukte zurückzuführen ist. Da in dieser Studie ein selbstberichteter Fragebogen verwendet wurde, kamen sowohl prozedurale als auch statistische Ansätze zum Einsatz, um den möglichen Einfluss der CMV-Verzerrung zu bewerten. Prozedural wurde den Teilnehmenden Anonymität und Vertraulichkeit zugesichert, um die Verzerrung durch soziale Erwünschtheit zu minimieren und ehrliche Antworten zu fördern. Zusätzlich wurden die aus etablierten Instrumenten übernommenen Fragebogenitems in zufälliger Reihenfolge präsentiert, um Antwortmuster zu reduzieren, die die CMV-Verzerrung künstlich erhöhen könnten. Statistisch wurde der Harman-Einfaktor-Test durchgeführt, indem alle gemessenen Variablen in eine explorative Faktorenanalyse (EFA) ohne Rotation eingegeben wurden. Die Analyse ergab, dass der erste ungebrochene Faktor 32,7 % der Gesamtvarianz erklärte, was unterhalb des empfohlenen Schwellenwerts von 50 % liegt und darauf hindeutet, dass die CMV-Verzerrung die Studienergebnisse wahrscheinlich nicht wesentlich beeinflusst hat (Tabelle 3).
| Statistik | Wert | Schwellenwert | Interpretation |
| Gesamtanzahl extrahierter Faktoren | 7 | N/V | Mehrere Faktoren wurden extrahiert, was darauf hinweist, dass die gemessenen Merkmale unterschiedliche Konstrukte darstellen. |
| Von dem ersten Faktor erklärte Varianz | 32,70 % | <50 % | Unterhalb des allgemein akzeptierten Schwellenwerts, was darauf hindeutet, dass eine gemeinsame Methodenvarianz (CMV) wahrscheinlich kein ernsthaftes Problem darstellt. |
| Kumulierte erklärte Varianz (erste drei Faktoren) | 62,10 % | N/V | Zeigt an, dass die ersten drei Faktoren einen beträchtlichen Anteil der Gesamtvarianz erklären. |
| Kaiser-Meyer-Olkin-(KMO-)Maß der Stichprobenadäquatheit | 0,89 | >0,80 | Zeigt eine ausgezeichnete Stichprobenadäquatheit für die Faktoranalyse an. |
| Bartlett-Test auf Sphärizität (p-Wert) | <0,001 | p < 0,05 | Signifikantes Ergebnis, das darauf hinweist, dass die Korrelationsmatrix für eine Faktoranalyse geeignet ist. |
Tabelle 3: Ergebnisse des Einzelfaktortests nach Harman und der Stichprobenadäquatheit. Die Tabelle fasst die Ergebnisse des Einzelfaktortests nach Harman, des Kaiser-Meyer-Olkin-(KMO-)Maßes der Stichprobenadäquatheit und des Bartlett-Tests auf Sphärizität zusammen. Der Einzelfaktortest nach Harman wurde durchgeführt, um den möglichen Einfluss einer gemeinsamen Methodenvarianz (CMV) zu bewerten. Die KMO-Statistik und der Bartlett-Test wurden verwendet, um die Eignung des Datensatzes für eine Faktoranalyse zu überprüfen.
Tabelle 3 zeigt die Ergebnisse des Harman-Einfaktortests, der angibt, dass der erste unrotierte Faktor 32,7 % der gesamten Varianz erklärte, was unterhalb der empfohlenen Schwelle von 50 % liegt und darauf hindeutet, dass eine gemeinsame Methodenverzerrung in dieser Studie keine wesentliche Rolle spielt. Das Kaiser-Meyer-Olkin-(KMO)-Maß der Stichprobenadäquatheit betrug 0,89 und zeigt an, dass die Daten für eine Faktoranalyse geeignet waren. Zusätzlich war der Bartlett-Test auf Sphärizität statistisch signifikant (p < 0,001), was bestätigt, dass die Korrelationsmatrix für die Faktoranalyse geeignet war. Insgesamt stützen diese Ergebnisse die Eignung des Datensatzes für nachfolgende Analysen mittels Strukturgleichungsmodellierung.
Messmodell
Das Messmodell wurde bewertet, um die Zuverlässigkeit und Validität der Studienkonstrukte mittels PLS-SEM, implementiert in SmartPLS 4, gemäß den Empfehlungen von Hair et al.60 zu überprüfen. Es wurden die Indikatorzuverlässigkeit, die interne Konsistenz, die konvergente Validität und die diskriminante Validität analysiert. Die Indikatorzuverlässigkeit wurde anhand der outer loadings bewertet, wobei Items mit Loadings über 0,70 als zuverlässige Indikatoren ihrer jeweiligen Konstrukte beibehalten wurden. Items mit Loadings zwischen 0,60 und 0,70 wurden nur dann beibehalten, wenn ihre Entfernung die interne Konsistenz des entsprechenden Konstrukts nicht verbesserte. Die interne Konsistenz wurde anhand von Cronbachs Alpha und CR geprüft. Die konvergente Validität wurde mithilfe des AVE bewertet, wobei alle Konstrukte AVE-Werte über 0,50 aufwiesen, was darauf hinweist, dass jedes Konstrukt mehr als die Hälfte der Varianz seiner Indikatoren erklärt. Die diskriminante Validität wurde anhand des HTMT-Verhältnisses überprüft, und alle HTMT-Werte lagen unter dem empfohlenen Schwellenwert von 0,85, was die empirische Unterscheidbarkeit der Studienkonstrukte unterstützt (Tabellen 4 und 5).
| Konstrukt | Faktorladung | Zusammengesetzte Reliabilität (CR) | Durchschnittlich extrahierte Varianz (AVE) | Äußerer Varianzinflationsfaktor (VIF) |
| Lehrstil (Autorität) | 0.87 | 0.91 | 0.66 | 1.38 |
| Lehrstil (Experte) | 0.89 | 0.92 | 0.68 | 1.45 |
| Lehrstil (Persönliches Modell) | 0.86 | 0.9 | 0.65 | 1.4 |
| Lehrstil (Moderator) | 0.88 | 0.93 | 0.69 | 1.43 |
| Lehrstil (Delegierer) | 0.85 | 0.89 | 0.62 | 1.39 |
| Nutzung von ChatGPT | 0.92 | 0.94 | 0.72 | 1.47 |
| Fremdsprachenunterrichtsangst (Kommunikationshemmung) | 0.86 | 0.9 | 0.64 | 1.35 |
| Fremdsprachenunterrichtsangst (Prüfungsangst) | 0.88 | 0.92 | 0.67 | 1.41 |
| Fremdsprachenunterrichtsangst (Angst vor negativer Bewertung) | 0.83 | 0.88 | 0.6 | 1.32 |
| Motivation (Instrumentalität) | 0.84 | 0.89 | 0.61 | 1.34 |
| Motivation (Ethnozentrismus und Integrativität) | 0.86 | 0.9 | 0.63 | 1.36 |
| Motivation (Einstellung zum Englischlernen) | 0.89 | 0.93 | 0.7 | 1.44 |
| Kreativität (Originalität) | 0.88 | 0.92 | 0.67 | 1.41 |
| Kreativität (Flexibilität) | 0.87 | 0.91 | 0.66 | 1.38 |
| Kreativität (Flüssigkeit) | 0.89 | 0.93 | 0.68 | 1.42 |
| Kreativität (Ausführlichkeit) | 0.85 | 0.9 | 0.63 | 1.37 |
| Digitale Kompetenz | 0.93 | 0.95 | 0.75 | 1.49 |
Tabelle 4: Bewertung des Messmodells. In der Tabelle sind die Faktorladungen, die zusammengesetzte Reliabilität (CR), die durchschnittlich erklärte Varianz (AVE) sowie der äußere Varianzinflationsfaktor (VIF) für jede im Messmodell der partiellen kleinsten Quadrate Strukturgleichungsmodellierung (PLS-SEM) enthaltene Konstrukte und Unterdimension aufgeführt. Mithilfe dieser Statistiken wurde die Indikatorreliabilität, die Reliabilität der internen Konsistenz, die konvergente Validität sowie die Multikollinearität bewertet.
| Konstrukt | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | 10 | 11 | 12 | 13 | 14 | 15 | 16 | 17 |
| 1. Lehrstil (Autorität) | — | | | | | | | | | | | | | | | | |
| 2. Lehrstil (Experte) | 0.702 | — | | | | | | | | | | | | | | | |
| 3. Lehrstil (Persönliches Modell) | 0.743 | 0.581 | — | | | | | | | | | | | | | | |
| 4. Lehrstil (Fachkraft) | 0.629 | 0.735 | 0.702 | — | | | | | | | | | | | | | |
| 5. Lehrstil (Delegierender) | 0.754 | 0.549 | 0.802 | 0.692 | — | | | | | | | | | | | | |
| 6. Nutzung von ChatGPT | 0.52 | 0.643 | 0.743 | 0.536 | 0.693 | — | | | | | | | | | | | |
| 7. Fremdsprachenunterrichtsangst (Kommunikationsangst) | 0.665 | 0.521 | 0.649 | 0.559 | 0.73 | 0.827 | — | | | | | | | | | | |
| 8. Fremdsprachenunterrichtsangst (Testangst) | 0.832 | 0.614 | 0.53 | 0.622 | 0.689 | 0.631 | 0.567 | — | | | | | | | | | |
| 9. Angst im Fremdsprachenunterricht (Angst vor negativer Beurteilung) | 0.608 | 0.809 | 0.585 | 0.651 | 0.637 | 0.614 | 0.81 | 0.556 | — | | | | | | | | |
| 10. Motivation (Instrumentalität) | 0.762 | 0.623 | 0.66 | 0.634 | 0.811 | 0.534 | 0.802 | 0.755 | 0.519 | — | | | | | | | |
| 11. Motivation (Ethnozentrismus und Integrativität) | 0.803 | 0.674 | 0.571 | 0.504 | 0.517 | 0.805 | 0.827 | 0.753 | 0.562 | 0.554 | — | | | | | | |
| 12. Motivation (Einstellung zum Englischlernen) | 0.626 | 0.816 | 0.677 | 0.591 | 0.742 | 0.716 | 0.633 | 0.562 | 0.598 | 0.549 | 0.679 | — | | | | | |
| 13. Kreativität (Originalität) | 0.626 | 0.678 | 0.501 | 0.732 | 0.538 | 0.678 | 0.839 | 0.543 | 0.523 | 0.577 | 0.668 | 0.719 | — | | | | |
| 14. Kreativität (Flexibilität) | 0.726 | 0.669 | 0.844 | 0.528 | 0.654 | 0.579 | 0.517 | 0.775 | 0.644 | 0.667 | 0.679 | 0.82 | 0.697 | — | | | |
| 15. Kreativität (Flüssigkeit) | 0.711 | 0.692 | 0.815 | 0.635 | 0.629 | 0.505 | 0.792 | 0.817 | 0.604 | 0.55 | 0.518 | 0.604 | 0.59 | 0.626 | — | | |
| 16. Kreativität (Ausführlichkeit) | 0.749 | 0.761 | 0.783 | 0.69 | 0.811 | 0.55 | 0.503 | 0.842 | 0.732 | 0.714 | 0.659 | 0.744 | 0.543 | 0.606 | 0.634 | — | |
| 17. Digitale Kompetenz | 0.606 | 0.641 | 0.593 | 0.742 | 0.727 | 0.628 | 0.631 | 0.648 | 0.742 | 0.688 | 0.806 | 0.578 | 0.673 | 0.549 | 0.7 | 0.529 | — |
Tabelle 5: Diskriminante Validität, bewertet mittels des Heterotrait–Monotrait-Verhältnisses (HTMT). Die Tabelle zeigt die HTMT-Werte für alle Paare von Konstrukten und Subdimensionen, die im Messmodell enthalten sind. HTMT wurde verwendet, um die diskriminante Validität zu bewerten, indem die empirische Unterscheidbarkeit der latenten Konstrukte überprüft wurde. Werte unterhalb des vorgegebenen Schwellenwerts von 0,85 deuten auf eine akzeptable diskriminante Validität hin.
Tabelle 4 fasst die Bewertung des Messmodells zusammen. Die Faktorladungen lagen zwischen 0,83 und 0,93, überstiegen damit die empfohlene Schwelle von 0,70 und deuten auf eine zufriedenstellende Indikatorzuverlässigkeit hin. Die Werte der zusammengesetzten Reliabilität lagen zwischen 0,88 und 0,95 und zeigen eine hohe innere Konsistenz aller Konstrukte. Die AVE-Werte lagen zwischen 0,60 und 0,75, übertrafen den empfohlenen Mindestwert von 0,50 und stützen die konvergente Validität. Zusätzlich lagen alle äußeren Varianzinflationsfaktoren (VIF) unter 1,50, was auf keine Hinweise auf Multikollinearität zwischen den Indikatoren hindeutet. Insgesamt unterstützen diese Ergebnisse die Zuverlässigkeit und Gültigkeit des Messmodells für die anschließende Bewertung des Strukturmodells.
Abbildung 3 veranschaulicht das Messmodell, einschließlich der latenten Konstrukte, ihrer entsprechenden Dimensionen und Indikatoren sowie der Beziehungen zwischen den in der Studie untersuchten Variablen.

Abbildung 3. Messmodell der partiellen kleinsten Quadrate mit struktureller Gleichungsmodellierung. Das mit der Methode der partiellen kleinsten Quadrate und struktureller Gleichungsmodellierung (PLS-SEM) erstellte Messmodell zeigt die Beziehungen zwischen den latenten Konstrukten, deren Dimensionen und den beobachtbaren Indikatoren. Die an den Verbindungspfaden angezeigten Werte stellen die geschätzten outer loadings bzw. Pfadkoeffizienten dar, je nach Anwendungsfall. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.
Tabelle 5 zeigt die HTMT-Ergebnisse zur Bewertung der diskriminanten Validität. Alle HTMT-Werte lagen unterhalb der konservativen Schwelle von 0,85, was auf eine zufriedenstellende diskriminante Validität zwischen den 17 Konstrukten hinweist. Die höchsten HTMT-Werte wurden zwischen Kreativität (Flexibilität) und Unterrichtsstil (Persönliches Modell) (0,8437), Kreativität (Ausführlichkeit) und Angst (Prüfungsangst) (0,8422) sowie Kreativität (Originalität) und Angst (Kommunikationsangst) (0,8394) beobachtet. Obwohl diese Werte nahe an der empfohlenen Schwelle lagen, blieben sie unterhalb von 0,85 und untermauern somit die empirische Unterscheidbarkeit der Konstrukte. Die übrigen HTMT-Werte waren niedriger und stützen zusätzlich die diskriminante Validität innerhalb des Messmodells.
Ergebnisse der Hypothesenprüfung (Strukturmodell)
Das Strukturmodell wurde evaluiert, um die postulierten Beziehungen zwischen Unterrichtsstil, ChatGPT-Nutzung, digitaler Kompetenz, Motivation, FLCA und Kreativität zu untersuchen. Die Ergebnisse unterstützten alle vorgeschlagenen direkten und vermittelnden Hypothesen. Unterrichtsstil, ChatGPT-Nutzung und digitale Kompetenz waren positiv mit der Motivation assoziiert. Die Motivation stand negativ im Zusammenhang mit FLCA, während FLCA negativ mit Kreativität assoziiert war. Darüber hinaus vermittelte die Motivation die Beziehungen zwischen Unterrichtsstil, ChatGPT-Nutzung und digitaler Kompetenz einerseits und FLCA andererseits (Tabellen 6 und 7).
| Hypothese | Standardisierter Pfadkoeffizient (β) | t-Wert | p-Wert | Unterstützt | 95 % Konfidenzintervall (KI) | Untere Grenze (LLCI) | Obere Grenze (ULCI) |
| H1. Lehrstil → Motivation von EFL-Schülern | 0,36 | 5,45 | <0,001 | Ja | [0,26; 0,46] | 0,26 | 0,46 |
| H2. Nutzung von ChatGPT → Motivation von EFL-Schülern | 0,4 | 6,27 | <0,001 | Ja | [0,30; 0,50] | 0,3 | 0,5 |
| H3. Digitale Kompetenz → Motivation von EFL-Schülern | 0,33 | 4,95 | <0,001 | Ja | [0,23; 0,43] | 0,23 | 0,43 |
| H4. Motivation von EFL-Schülern → Angst im Fremdsprachenunterricht | –0,27 | –4,81 | <0,001 | Ja | [–0,37; –0,17] | –0,37 | –0,17 |
| H5. Angst im Fremdsprachenunterricht → Kreativität von EFL-Schülern | –0,26 | –4,01 | <0,001 | Ja | [–0,36; –0,16] | –0,36 | –0,16 |
Tabelle 6: Prüfung der Direkt-Effekt-Hypothese. Die Tabelle zeigt die Ergebnisse der Direkt-Effekt-Analysen, die mithilfe der partiellen kleinsten-Quadrate-Strukturgleichungsmodellierung (PLS-SEM) durchgeführt wurden. Angegebene Statistiken umfassen den standardisierten Pfadkoeffizienten (β), t-Wert, p-Wert, 95%-Bootstrap-Konfidenzintervall (KI), untere Grenze des Konfidenzintervalls (LLCI), obere Grenze des Konfidenzintervalls (ULCI) sowie die Entscheidung bezüglich der Hypothesenunterstützung. Die statistische Signifikanz wurde mittels Bootstrapping mit 5.000 Neustichproben bewertet.
| Hypothese | Vermittlungspfad | Standardisierter indirekter Effekt (β) | t-Wert | p-Wert | Unterstützt | 95 % Konfidenzintervall (KI) | Untere Grenze (LLCI) | Obere Grenze (ULCI) |
| H6 | Lehrstil → Motivation → Fremdsprachenunterrichtsangst | 0.28 | 4.56 | <0.001 | Ja | [0.18, 0.38] | 0.18 | 0.38 |
| H7 | ChatGPT-Nutzung → Motivation → Fremdsprachenunterrichtsangst | 0.34 | 5.02 | <0.001 | Ja | [0.24, 0.44] | 0.24 | 0.44 |
| H8 | Digitale Kompetenz → Motivation → Fremdsprachenunterrichtsangst | 0.3 | 4.68 | <0.001 | Ja | [0.20, 0.40] | 0.20 | 0.40 |
Tabelle 7: Mediationsanalyse. Die Tabelle fasst die indirekten Effekte zusammen, die mithilfe der partiellen kleinsten Quadrate Strukturgleichungsmodellierung (PLS-SEM) geschätzt wurden. Die angegebenen statistischen Kenngrößen umfassen den standardisierten indirekten Effekt (β), t-Wert, p-Wert, 95%-Bootstrap-Konfidenzintervall (CI), untere Grenze des Konfidenzintervalls (LLCI), obere Grenze des Konfidenzintervalls (ULCI) sowie die Entscheidung zur Hypothesenunterstützung. Die statistische Signifikanz wurde mittels Bootstrapping mit 5.000 Resampling-Durchgängen bewertet.
Tabelle 6 zeigt die Ergebnisse der Analysen direkter Effekte. Alle fünf postulierten direkten Beziehungen waren statistisch signifikant (p < 0,001), was die Hypothesen H1–H5 stützt. Der Unterrichtsstil (β = 0,36), die Nutzung von ChatGPT (β = 0,40) und digitale Kompetenz (β = 0,33) waren positiv mit der Motivation von EFL-Lernenden assoziiert, wobei die Nutzung von ChatGPT den größten standardisierten Pfadkoeffizienten unter den drei Prädiktoren aufwies. Die Motivation war negativ mit der FLCA assoziiert (β = –0,27), was darauf hindeutet, dass eine höhere Motivation mit geringeren Angstniveaus einhergeht. Im Weiteren war die FLCA negativ mit Kreativität assoziiert (β = –0,26). Die 95-%-Bootstrap-Konfidenzintervalle für alle direkten Effekte schlossen die Null aus und bestätigten somit die statistische Signifikanz der postulierten Beziehungen. Tabelle 7 zeigt die Mediationsanalysen, die untersuchen, ob die Motivation die Beziehungen zwischen Unterrichtsstil, Nutzung von ChatGPT und digitaler Kompetenz einerseits und FLCA andererseits vermittelt. Die indirekten Effekte waren für alle drei Pfade statistisch signifikant (H6: β = 0,28, t = 4,56, p < 0,001; H7: β = 0,34, t = 5,02, p < 0,001; H8: β = 0,30, t = 4,68, p < 0,001). Die 95-%-Bootstrap-Konfidenzintervalle schlossen für alle indirekten Effekte die Null aus, was die statistische Signifikanz der Mediationspfade bestätigt. Die positiven indirekten Koeffizienten spiegeln die Gesamtstärke der indirekten Effekte über die Motivation wider, während die direkte Beziehung zwischen Motivation und FLCA, wie im Strukturmodell berichtet, negativ war. Folglich waren höhere Ausprägungen von Unterrichtsstil, Nutzung von ChatGPT und digitaler Kompetenz mit einer höheren Motivation assoziiert, die wiederum mit einer geringeren FLCA verbunden war (Tabellen 6 und 7). Insgesamt unterstützte das Strukturmodell alle postulierten direkten (H1–H5) und indirekten (H6–H8) Beziehungen. Die Ergebnisse zeigen statistisch signifikante Zusammenhänge zwischen Unterrichtsstil, Nutzung von ChatGPT, digitaler Kompetenz, Motivation, FLCA und Kreativität, wobei die Motivation im Strukturmodell als signifikanter Mediator fungiert.
Dimensionale Analyse des Lehrstils
Es wurde eine Dimensionsanalyse durchgeführt, um die Beziehungen zwischen den fünf Dimensionen des Lehrstils sowie der Motivation, der fremdsprachlichen Lernangst (FLCA) und der Kreativität von EFL-Schülern zu untersuchen. Die Dimensionen des Lehrstils umfassten Autorität, Experte, persönliches Vorbild, Moderator und Delegierer. Das Strukturmodell schätzte die direkten Effekte jeder Lehrstil-Dimension auf die drei Ergebnisvariablen, um festzustellen, ob die beobachteten Beziehungen je nach Lehransatz unterschiedlich waren (Tabelle 8).
| Dimension des Lehrstils | Ergebnisvariable | Standardisierter Pfadkoeffizient (β) | t-Wert | p-Wert | Untere Grenze des 95 %igen Konfidenzintervalls (LLCI) | Obere Grenze des 95 %igen Konfidenzintervalls (ULCI) | Unterstützt |
| Autorität | Motivation | 0,12 | 1,85 | 0,065 | –0,02 | 0,26 | Nein |
| Autorität | Angst im Fremdsprachenunterricht | 0,35 | 5,12 | <0,001 | 0,22 | 0,48 | Ja |
| Autorität | Kreativität | –0,28 | –4,02 | <0,001 | –0,42 | –0,14 | Ja |
| Experte | Motivation | 0,3 | 4,89 | <0,001 | 0,18 | 0,42 | Ja |
| Experte | Angst im Fremdsprachenunterricht | –0,18 | –2,95 | 0,003 | –0,30 | –0,06 | Ja |
| Experte | Kreativität | 0,22 | 3,56 | <0,001 | 0,1 | 0,34 | Ja |
| Persönliches Vorbild | Motivation | 0,25 | 4,02 | <0,001 | 0,13 | 0,37 | Ja |
| Persönliches Vorbild | Angst im Fremdsprachenunterricht | –0,22 | –3,45 | 0,001 | –0,35 | –0,09 | Ja |
| Persönliches Vorbild | Kreativität | 0,24 | 3,78 | <0,001 | 0,12 | 0,36 | Ja |
| Vermittler | Motivation | 0,34 | 5,5 | <0,001 | 0,22 | 0,46 | Ja |
| Vermittler | Angst im Fremdsprachenunterricht | –0,28 | –4,45 | <0,001 | –0,40 | –0,16 | Ja |
| Vermittler | Kreativität | 0,31 | 4,95 | <0,001 | 0,19 | 0,43 | Ja |
| Delegierender | Motivation | 0,29 | 4,62 | <0,001 | 0,17 | 0,41 | Ja |
| Delegierender | Angst im Fremdsprachenunterricht | –0,24 | –3,85 | <0,001 | –0,37 | –0,11 | Ja |
| Delegierender | Kreativität | 0,27 | 4,25 | <0,001 | 0,15 | 0,39 | Ja |
Tabelle 8: Dimensionsanalyse des Lehrstils. In der Tabelle werden die direkten Beziehungen zwischen den Dimensionen des Lehrstils – Autorität, Experte, Vorbild, Moderator und Delegator – und den Ergebnisvariablen Motivation, Fremdsprachenunterrichtsangst und Kreativität dargestellt. Zu den angegebenen Statistiken gehören der standardisierte Pfadkoeffizient (β), der t-Wert, der p-Wert, die untere Grenze des 95 %igen Bootstrap-Konfidenzintervalls (LLCI), die obere Grenze des 95 %igen Bootstrap-Konfidenzintervalls (ULCI) sowie die Entscheidung bezüglich der Hypothesenunterstützung.
Tabelle 8 zeigt die Ergebnisse der dimensionalen Analyse der Lehrstile. Der Begleiter-Lehrstil wies die stärksten positiven Zusammenhänge mit Motivation (β = 0.34, p < 0,001) und Kreativität (β = 0,31, p < 0,001) auf sowie den stärksten negativen Zusammenhang mit FLCA (β = –0,28, p < 0,001). Die Lehrstile Experte, Vorbild und Delegierender waren ebenfalls positiv mit der Motivation (β = 0,30, 0,25 bzw. 0,29) und der Kreativität (β = 0,22, 0,24 bzw. 0,27) assoziiert, wiesen jedoch negative Zusammenhänge mit FLCA auf (β = –0,18, –0,22 bzw. –0,24). Alle diese Beziehungen waren statistisch signifikant. Im Gegensatz dazu war der Autoritäts-Lehrstil nicht signifikant mit der Motivation assoziiert (β = 0,12, p = 0,065). Er zeigte jedoch eine signifikante positive Assoziation mit FLCA (β = 0,35, p < 0,001) sowie eine signifikante negative Assoziation mit Kreativität (β = –0,28, p < 0,001). Insgesamt zeigt die dimensionale Analyse deutliche Muster der Zusammenhänge zwischen einzelnen Dimensionen des Lehrstils und den gemessenen Lernergebnissen. Zusammenfassend lässt sich sagen, dass die Beziehungen zwischen Lehrstil und Lernergebnissen der Studierenden je nach Lehrstil-Dimension variieren. Für die meisten Lehrstil-Dimensionen wurden statistisch signifikante Zusammenhänge beobachtet, während der Autoritäts-Lehrstil keine statistisch signifikante Assoziation mit Motivation aufwies.
Prädiktive Validität des inneren Modells unter Verwendung von PLS Predict
Die prädiktive Validität des Strukturmodells wurde mithilfe des PLS-Predict-Verfahrens bewertet, um die Out-of-Sample-Prädiktionsleistung des Modells zu überprüfen. Die prädiktive Relevanz wurde anhand der Q2-Predict-Statistik sowie von Maßen des Vorhersagefehlers, einschließlich des Wurzelmittlerfehlers (RMSE) und des mittleren absoluten Fehlers (MAE), bewertet. Die Q2-Predict-Werte lagen für die endogenen Konstrukte zwischen 0,32 und 0,48 und deuten somit auf eine positive prädiktive Relevanz hin. Motivation und Kreativität wiesen die höchsten Q2-Predict-Werte auf (0,42 bzw. 0,48). Auch die Werte des Vorhersagefehlers wurden analysiert; der RMSE lag zwischen 0,54 und 0,63, der MAE zwischen 0,41 und 0,49 für die endogenen Konstrukte (Tabelle 9).
| Konstrukt | Bestimmtheitsmaß
(R²) | Vorhersagekraft
(Q² Predict) | Wurzel des mittleren quadratischen Fehlers
(RMSE) | Mittlerer absoluter Fehler
(MAE) |
| Motivation | 0.45 | 0.42 | 0.61 | 0.48 |
| Angst im Fremdsprachenunterricht | 0.38 | 0.32 | 0.63 | 0.49 |
| Kreativität | 0.42 | 0.48 | 0.54 | 0.41 |
Tabelle 9: Vorhersageleistung des Strukturmodells. Die Tabelle fasst die Vorhersageleistung der endogenen Konstrukte zusammen, die mithilfe der partiellen kleinsten Quadrate Strukturgleichungsmodellierung (PLS-SEM) bewertet wurden. Zu den angegebenen Statistiken gehören das Bestimmtheitsmaß (R2), die prädiktive Relevanz (Q2 Predict), der mittlere quadratische Fehler (RMSE) und der mittlere absolute Fehler (MAE). Höhere Werte von R2 und Q2 Predict weisen auf eine größere Erklärungs- und Vorhersageleistung hin, während niedrigere RMSE- und MAE-Werte auf einen geringeren Vorhersagefehler hindeuten.
Tabelle 9 fasst die Vorhersageleistung des Strukturmodells zusammen. Der Determinationskoeffizient (R2) zeigte, dass das Modell 45 % der Varianz der Motivation, 38 % der Varianz der FLCA und 42 % der Varianz der Kreativität erklärte. Die Q2-Predict-Werte für Motivation (0,42), FLCA (0,32) und Kreativität (0,48) lagen alle über null, was die Vorhersagerelevanz des Modells bestätigt. Die RMSE-Werte lagen zwischen 0,54 und 0,63, während die MAE-Werte zwischen 0,41 und 0,49 lagen, was die Vorhersagefehler für die endogenen Konstrukte angibt. Insgesamt unterstützen die Maße zur Vorhersageleistung die Vorhersagefähigkeit des Strukturmodells.
Abbildung 4 veranschaulicht die Vorhersageleistung der endogenen Konstrukte, indem der Determinationskoeffizient (R2), die prädiktive Relevanz (Q2 Predict) und die Maße für Vorhersagefehler (RMSE und MAE) dargestellt werden. Unter den endogenen Konstrukten wies Kreativität den höchsten Q2 Predict-Wert (0,48) zusammen mit den niedrigsten Vorhersagefehlern (RMSE = 0,54; MAE = 0,41) auf, während Motivation die höchste erklärte Varianz zeigte (R2 = 0,45) (Abbildung 4). Insgesamt zeigte die PLS-Predict-Analyse eine positive prädiktive Relevanz für alle endogenen Konstrukte. Die Ergebnisse für R2, Q2 Predict, RMSE und MAE unterstützen gemeinsam die Vorhersageleistung des Strukturmodells für Motivation, FLCA und Kreativität (Tabelle 9; Abbildung 4).

Abbildung 4. Vorhersageleistung des Strukturmodells. Das Diagramm zeigt die Bestimmtheitsmaße (R2), den mittleren quadratischen Fehler (RMSE), den mittleren absoluten Fehler (MAE) sowie die Q2-predict-Werte für die endogenen Konstrukte Motivation, Angst und Kreativität. Die Balken repräsentieren die Werte für R2, RMSE und MAE, während die Linie mit kreisförmigen Markierungen die Q2-predict-Werte darstellt. Höhere R2- und Q2-predict-Werte weisen auf eine größere Erklärungs- bzw. Vorhersageleistung hin, während niedrigere RMSE- und MAE-Werte auf einen geringeren Vorhersagefehler schließen lassen. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.
Datenverfügbarkeit:
Der anonymisierte Datensatz auf Teilnehmerebene, der die Ergebnisse dieser Studie unterstützt, ist als Zusätzliche Tabelle 1 verfügbar. Das Informationsblatt für die Teilnehmer und das Einwilligungsformular liegen in Zusätzliche Datei 1 vor, und der für die Datenerhebung verwendete Fragebogen ist in Zusätzliche Datei 2 enthalten.
Ergänzungstabelle 1. Rohdatensatz der Teilnehmer zur statistischen Analyse. Diese Tabelle enthält den anonymisierten Datensatz auf Teilnehmerebene, der für die statistischen Analysen verwendet wurde. Die Variablen umfassen demografische Informationen sowie Antwortdaten auf Ebene der Einzelitems zu Lehrstil, ChatGPT-Nutzung, digitale Kompetenz, Motivation, Fremdsprachenunterrichtsangst und Kreativität. Die Item-Bezeichnungen (z. B. TL1, CHATGPT1, DL1, M1, FLCA1, CR1) entsprechen den im Abschnitt „Werkzeuge und Messverfahren“ beschriebenen Fragebogenitems. Persönlich identifizierbare Informationen sind nicht enthalten.Bitte klicken Sie hier, um diese Datei herunterzuladen.
Zusatzdatei 1. Informationsblatt für Teilnehmer und Einwilligungserklärung. Diese Zusatzdatei enthält das Informationsblatt für Teilnehmer und die Einwilligungserklärung, die für die Rekrutierung der Teilnehmer verwendet wurden. Darin werden die Studienziele, die Teilnahmeberechtigung, die Studienabläufe, die freiwillige Teilnahme, mögliche Risiken und Vorteile, die Vertraulichkeit, der Datenschutz sowie die den Teilnehmern vor Abschluss des Fragebogens zur Verfügung gestellten Kontaktinformationen beschrieben.Bitte klicken Sie hier, um diese Datei herunterzuladen.
Zusatzdatei 2. Umfragefragebogen zur Datenerhebung. Diese Zusatzdatei enthält den vollständigen Fragebogen, der den Teilnehmenden vorgelegt wurde. Das Instrument umfasst Fragen zur Demografie sowie einzelne Items zur Erfassung des Unterrichtsstils, der Nutzung von ChatGPT, der digitalen Kompetenz, der Motivation, der Fremdsprachenunterrichtsangst und der Kreativität. Die Antworten wurden anhand einer 5-Punkte-Likert-Skala erfasst, die von 1 (Stimme überhaupt nicht zu) bis 5 (Stimme voll und ganz zu) reicht. Die Fragebogenitems entsprechen den in der Sektion „Werkzeuge und Messverfahren“ der Arbeit beschriebenen Messinstrumenten.Bitte klicken Sie hier, um diese Datei herunterzuladen.