$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Diseño y optimización del algoritmo FairEduNet
El estudio combina GAN y GBDT para construir el algoritmo FairEduNet, logrando los objetivos duales de corrección de equidad y corrección de precisión, en lugar del compromiso de la optimización unidireccional. FairEduNet adopta una arquitectura colaborativa de doble canal: el canal troncal GBDT es responsable del modelado estructurado de errores y la corrección precisa, mientras que el canal auxiliar GAN se centra en desacoplar atributos sensibles y ajustar dinámicamente la equidad. La arquitectura del algoritmo FairEduNet, que combina GAN y GBDT, se muestra en la Figura 1.

Figura 1: Arquitectura del algoritmo FairEduNet que combina GAN y GBDT. Por favor, haga clic aquí para ver una versión ampliada de esta figura.
Como se muestra en la Figura 1, FairEduNet primero recopila y preprocesa datos de evaluación multifuente. GBDT utiliza múltiples árboles de decisión para aprender iterativamente los patrones de error de evaluación, emite resultados iniciales de calibración y los pasa al módulo GAN. El GAN entrena al discriminador para aprender la relación entre los resultados iniciales de calibración y los atributos sensibles, mientras que el generador ajusta dinámicamente los parámetros de calibración. A través de múltiples rondas de entrenamiento adversarial y verificación de equidad, se optimiza el sesgo de equidad. Finalmente, los resultados calibrados por equidad se envían al módulo GBDT, que ajusta para precisión y equidad, generando la base de calibración de la evaluación docente y el informe. GBDT calcula los residuos como se muestra en la Ecuación (1).
(1)
En la ecuación (1),
representa el residuo de la i-ésima muestra en la t-ésima iteración, yi representa el valor verdadero, y
representa el valor de predicción de la t-1-ésima iteración. El proceso adversarial GAN se muestra en la Ecuación (2).
(2)
En la ecuación (2), x representa el resultado inicial de la calibración, z representa características de atributos sensibles, Pdata(x) representa la verdadera distribución de características no sensibles, Pz(z) representa la distribución de atributos sensibles, D representa el discriminador y G representa el generador15. La salida inicial de calibración de GBDT se muestra en la Ecuación (3).
(3)
En la ecuación (3),
representa la predicción de la i-ésima muestra por el árbol de decisión inicial, K representa el número total de árboles de decisión, γk representa el peso del k-ésimo árbol y hk(xi) representa la salida de predicción del k-ésimo árbol para el i-La muestra. El algoritmo FairEduNet puede proporcionar calibración precisa y garantía de equidad para la enseñanza de los datos de evaluación. Sin embargo, al procesar datos de evaluación no estructurados y adaptarse a escenarios dinámicos, FairEduNet muestra una capacidad débil de extracción de características para características no estructuradas, lo que resulta en sesgo de calibración. Además, los indicadores de equidad y parámetros de calibración de FairEduNet se establecen estáticamente, limitando su adaptabilidad a diferentes escenarios de enseñanza y afectando la calidad general de la calibración. La combinación de representaciones bidireccionales de codificadores de transformadores (BERT) y aprendizaje por refuerzo (RL), el algoritmo BERT-RL, puede extraer con precisión características profundas de texto no estructurado y adaptar dinámicamente parámetros de escenarios sin establecer manualmente umbrales estáticos, mejorando aún más la fiabilidad de las salidas del algoritmo enlos escenarios 16,17. Métodos tradicionales como TF-IDF se basan en la frecuencia de palabras pero carecen de un entendimiento contextual profundo y no pueden distinguir direcciones específicas de "equidad" en diferentes escenarios. Word2Vec produce vectores de palabras estáticos, que luchan por adaptarse a cambios contextuales complejos y reconocen sesgos indirectos. BERT utiliza autoatención multicapa para codificar contexto bidireccional, capturando tanto términos explícitos sesgados como lógica implícita sesgada. Los enfoques tradicionales requieren listas de palabras de sesgo construidas manualmente, dependen de la experiencia subjetiva y cubren escenarios limitados. Mediante aprendizaje preentrenado por transferencia de modelos, BERT aprende automáticamente características semánticas profundas sin un esfuerzo manual extenso, ofreciendo una mayor generalización para reconocer sesgos ambiguos. Además, los métodos tradicionales a menudo pierden información con textos largos, mientras que BERT soporta hasta 512 tokens, preservando relaciones contextuales, localizando con precisión características de sesgo y permitiendo una corrección de equidad de grano fino. El proceso de funcionamiento de BERT-RL se muestra en la Figura 2.

Figura 2: Diagrama de flujo de operaciones del algoritmo BERT-RL. Por favor, haga clic aquí para ver una versión ampliada de esta figura.
Como se muestra en la Figura 2, BERT-RL primero estandariza los datos de evaluación de texto no estructurados y los introduce en el modelo BERT. BERT utiliza un codificador Transformer para modelado semántico bidireccional para extraer características clave y construir una matriz de características. La matriz de características se introduce entonces en el módulo RL, que aprende la estrategia óptima a través de múltiples iteraciones. La configuración optimizada de parámetros finalmente se introduce en FairEduNet, mejorando su adaptabilidad. El cálculo del peso de la característica de autoatención BERT se muestra en la Ecuación (4).
(4)
En la ecuación (4), dk representa la dimensión del vector K. La función de recompensa multiobjetivo RL se expresa en la Ecuación (5).
(5)
En la ecuación (5), ω1, ω2 y ω3 representan coeficientes de peso,
el error de calibración, Dt es la desviación de equidad, Del objetivo es la desviación de equidad del objetivo, y Tt es el tiempode ejecución 18. Este estudio combina BERT-RL con FairEduNet para formar el algoritmo BERT-RL-FairEduNet, conocido como BFEN. BFEN logra calibración precisa y garantía de equidad en la enseñanza de los datos de evaluación mediante iteraciones de características GBDT y entrenamiento adversarial en tiempo real GAN, mientras que BERT-RL optimiza FairEduNet en el manejo de datos no estructurados y adaptándose dinámicamente a escenarios, abordando debilidades en la extracción de características y limitaciones estáticas de parámetros. El estudio utilizó el modelo BERT-base-chino y preentrenó el corpus de registros docentes reales, textos grabados en aula y documentos de política educativa de la Plataforma Nacional de Educación Inteligente para el curso académico 2024 a 2025, con un tamaño de vocabulario de 21128. La dimensión de capa oculta del modelo es 768, con 12 cabezas de atención y 12 capas. La profundidad del árbol GBDT se estableció en 8, el número de árboles era 200 y la tasa de aprendizaje era 0,1. El ciclo de entrenamiento de GAN es de 150 disparos, y el discriminador utiliza una red totalmente conectada de 3 capas con tamaños de 512, 256 y 1. El generador utiliza una red totalmente conectada de 4 capas con tamaños 1024, 512, 256 y 1. El número de unidades ocultas en LSTM es 128, y la longitud de la secuencia es 512. El GAT tiene 2 capas y 4 cabezas de atención. La temperatura para la destilación del conocimiento está fijada en 3,0. Los coeficientes de peso de recompensa en RL ω1 = 0,4, ω2 = 0,35 y ω3 = 0,25. Los criterios de selección de pesos son equilibrar el equilibrio frontal de Pareto de la optimización multiobjetivo con los requisitos de interpretabilidad de las prácticas de equidad educativa. Los experimentos se completaron mediante una división de datos del 50% mediante validación cruzada y ajuste de hiperparámetros. El proceso BFEN para la calibración de la evaluación docente se muestra en la Figura 3.

Figura 3: Proceso de corrección del algoritmo BFEN para la educación inteligente y la evaluación de la enseñanza. Por favor, haga clic aquí para ver una versión ampliada de esta figura.
Como se muestra en la Figura 3, BFEN primero preprocesa datos de evaluación docente multifuente. BERT optimiza la capacidad de extracción de características de FairEduNet calculando la similitud semántica del texto y los pesos profundos de características basándose en una ventana semántica, seleccionando características importantes para construir una matriz de características semánticas de alta dimensión. RL establece entonces una función de recompensa multiobjetivo y calcula los gradientes de adaptabilidad de escenarios y ajustes de parámetros para optimizar aún más los umbrales de equidad y los parámetros de calibración. FairEduNet calcula las desviaciones entre los datos de evaluación y los modelos de patrones de error, actualiza iterativamente los pesos del árbol de decisión y ajusta estrategias de calibración hasta que los errores se estabilizan dentro de umbrales preestablecidos. El resultado final incluye el modelo de calibración de errores y el informe de verificación de equidad. El modelo de calibración se aplica a los datos de evaluación docente, generando tablas comparativas pre y post-calibración, que se combinan con la biblioteca de estándares de equidad educativa inteligente para determinar los parámetros de calibración objetivo, proporcionando una base científica para la calibración de evaluaciones docentes en educación inteligente. Esta biblioteca estándar cubre tres dimensiones: equidad en oportunidades educativas, equidad en procesos y equidad en resultados, e incluye 12 indicadores principales. Estos indicadores incluyen el equilibrio de la asignación de recursos educativos entre regiones, la diferencia en la cobertura de infraestructura digital entre escuelas urbanas y rurales, el umbral de tolerancia para la respuesta tardía al diagnóstico de situaciones de aprendizaje (≤200 ms), la tolerancia a la falta de datos en la evaluación multimodal (≤3,5%), la sensibilidad a la detección de sesgos de algoritmos (desviación AUC para el etiquetado de género/región/etapa ≤ 0,02), el umbral de divergencia KL para la distribución de puntuaciones antes y después de la corrección (≤0,08), la puntuación de interpretabilidad de las sugerencias de intervención docente (≥4,2/5,0), la puntualidad de las actualizaciones del perfil de los estudiantes (completadas en T + 1 días), el coeficiente de consistencia del reconocimiento de créditos multiplataforma (≥0,93), la precisión del alineamiento semántico de las políticas educativas (puntuación BERT ≥ 0,86) y la completitud de la generación de informes de verificación de equidad (incluida la atribución de sesgos, intervalos de confianza y instantáneas de parámetros reproducibles), así como la tasa dinámica de validación de adaptación de escenarios que cubre tres escenarios típicos: aulas en vivo, tareas asíncronas y asistentes de enseñanza con IA. El cálculo de similitud semántica de características se muestra en la Ecuación (6).
(6)
En la ecuación (6), fi representa el valor de la i-ésima dimensión semántica de la característica, gi representa el valor de la i-ésima dimensión importante de la característica de evaluación, y n representa el número total de dimensiones de características. El cálculo del parámetro de adaptación del escenario RL se muestra en la Ecuación (7).
(7)
En la ecuación (7), θt representa el valor del parámetro en la t-ésima iteración, α representa la tasa de aprendizaje y
representa el gradiente de parámetros basado en la función de recompensa R(θt).
Construcción del modelo de calibración de evaluación docente
Aunque BFEN demuestra ciertas ventajas en la calibración de evaluaciones docentes, aún se enfrenta a baja eficiencia de integración para datos heterogéneos de evaluación multifuente y una adaptación dinámica insuficiente de la equidad en aplicaciones prácticas. El algoritmo AM-LSTM, que combina el Mecanismo de Atención (AM) y la Memoria a Corto Plazo Largo (LSTM), asigna pesos a características clave de los datos de evaluación multifuente a través de AM y captura los patrones dinámicos de cambio de los datos de evaluación a lo largo del tiempo utilizando la capacidad de memoria secuencial de LSTM. Este enfoque mejora eficazmente la eficiencia en la integración de datos multifuente y el aprendizaje dinámico de características19,20. El proceso operativo del AM-LSTM se muestra en la Figura 4.

Figura 4: Diagrama de flujo de operación AM-LSTM. Por favor, haga clic aquí para ver una versión ampliada de esta figura.
Como se muestra en la Figura 4, AM-LSTM primero preprocesa datos heterogéneos de evaluación docente multifuente para formar un conjunto de datos estandarizado. AM calcula los pesos de atención de características de diferentes fuentes de datos para seleccionar características importantes y construye una matriz ponderada de características. La matriz de características ponderada se introduce entonces en LSTM, que utiliza su mecanismo de acceso para aprender patrones dinámicos a lo largo del tiempo, capturando relaciones entre datos de evaluación en diferentes etapas y generando vectores dinámicos de características. Finalmente, estos vectores dinámicos de características se combinan con restricciones de equidad para generar resultados intermedios de calibración que se adaptan a la integración de datos multifuente y a escenarios dinámicos, proporcionando una base para la optimización posterior del modelo. El cálculo del peso de atención se muestra en la Ecuación (8).
(8)
En la ecuación (8), n representa la asignación de atención para la n-ésima característica, xn representa la similitud, q representa el vector de consulta y softmax representa la función de activación. La puerta de olvido del LSTM se expresa en la Ecuación (9).
(9)
En la ecuación (9), Wf es el peso de la puerta de olvido, bf es el sesgo de la puerta de olvido, xt es la entrada en el tiempo t, ht-1 es la variable de estado externa en el tiempo t-1, y σ representa la funciónsigmoide 21. Este estudio combina AM-LSTM con BFEN para construir el modelo de calibración de evaluación docente AM-LSTM-BFEN, conocido como FBFEN. En este modelo, AM-LSTM aborda las limitaciones de BFEN en la eficiencia de integración heterogénea de datos multifuente y la extracción dinámica de características. También integra restricciones de equidad para optimizar los resultados de calibración intermedia, permitiendo a BFEN lograr una calibración precisa y una garantía dinámica de equidad para la enseñanza de los datos de evaluación. El proceso de funcionamiento de FBFEN se muestra en la Figura 5.

Figura 5: Proceso operativo del modelo de evaluación y corrección de la enseñanza FBFEN. Por favor, haga clic aquí para ver una versión ampliada de esta figura.
Como se muestra en la Figura 5, FBFEN primero preprocesa los datos originales de evaluación docente multifuente e introduce el conjunto de datos estandarizado en el módulo AM-LSTM. AM calcula los pesos de atención de las características, mientras que LSTM aprende patrones dinámicos, generando resultados intermedios de calibración que integran información multifuente y características dinámicas. Los resultados intermedios se introducen entonces en el módulo BFEN. GBDT aprende iterativamente los patrones de error de los datos de evaluación basándose en los resultados intermedios y en el modelo de error preestablecido, generando resultados preliminares de calibración. Mientras tanto, GAN analiza el sesgo de equidad causado por atributos sensibles en los resultados preliminares mediante entrenamiento adversarial entre el generador y el discriminador, ajustando dinámicamente los parámetros de calibración para eliminar el sesgo. Finalmente, los parámetros de calibración optimizados para GAN se envían a GBDT para actualizar los pesos del árbol de decisión y las estrategias de calibración, produciendo un resultado de calibración secundario que equilibra precisión y equidad. La estandarización de datos se expresa en la Ecuación (10).
(10)
En la ecuación (10), z' representa el valor estandarizado, z representa el valor original, y zmin y zmax representan los valores mínimo y máximo. La función objetivo final del generador GAN se expresa en la Ecuación (11).
(11)
En la ecuación (11), N representa el número de iteraciones, λ representa el factor de peso de pérdida, ωi representa el factor de peso de la i-ésima iteración,
representa la función de pérdida adversarial y
representa la pérdida binaria de entropíacruzada 22.
Optimización del modelo de calibración de evaluación de la enseñanza de FBFEN
Aunque FBFEN demuestra una fuerte integración de datos multifuente y garantía dinámica de equidad en la calibración de evaluaciones docentes, sigue enfrentándose a una correlación de características débil y baja eficiencia en formación e inferencia debido a la compleja estructura del modelo en escenarios educativos complejos. El algoritmo GAT-KD, que combina la Red de Atención de Grafos (GAT) y la Destilación de Conocimiento (KD), construye dinámicamente un grafo de asociación semántica entre características a través del mecanismo de atención de GAT, mejorando la alineación semántica de datos multifuente. KD comprime el conocimiento del modelo complejo en una red ligera, mejorando significativamente la eficiencia de la inferencia mientras mantiene el rendimiento delmodelo 23,24. El proceso operativo de GAT-KD se muestra en la Figura 6.

Figura 6: Diagrama de flujo de operación GAT-KD. Haz clic aquí para ver una versión ampliada de esta figura.
Como se muestra en la Figura 6, GAT-KD construye un grafo semántico de asociación entre características a través del módulo GAT, agrega dinámicamente información de características vecinales usando el mecanismo de atención y mejora la representación semántica de características locales. KD utiliza entonces las etiquetas blandas de salida como señales de supervisión, minimizando la pérdida de divergencia entre las distribuciones de salida y la pérdida de entropía cruzada entre sus predicciones y etiquetas verdaderas, logrando la transferencia de conocimiento y compresión del modelo. La salida final es un modelo de calibración ligero con alta precisión y eficiencia. El cálculo del coeficiente de atención de la GAT se muestra en la ecuación (12).
(12)
En la ecuación (12),
y
representan los vectores de características de los nodos i y j, W representa la matriz de pesos aprendible, a representa el vector de pesos de atención,
representa la operación de concatenación y LeakyReLU representa la funciónde activación 25. El cálculo de la función de pérdida KD se muestra en la Ecuación (13).
(13)
En la ecuación (13), KL representa la pérdida por divergencia, T2 representa el balance de escalado del gradiente, pstudent representa la probabilidad de etiqueta blanda del modelo ligero, y pprofesor representa la probabilidad de etiqueta blanda del modelocomplejo 26. Al combinar la asociación de características mejorada por atención y la transferencia ligera de conocimiento, GAT-KD aborda eficazmente el sesgo semántico de características y la alta complejidad computacional. Este estudio integra GAT-KD en FBFEN para formar el modelo de calibración de evaluación docente GAT-KD-FBFEN, conocido como GFBFEN. GAT-KD optimiza las deficiencias de FBFEN en la captura incompleta de correlación de características multifuente y la baja eficiencia de inferencia. El proceso de funcionamiento de GFBFEN se muestra en la Figura 7.

Figura 7: Proceso de evaluación y corrección del modelo de evaluación y corrección de la enseñanza del GFBFEN. Por favor, haga clic aquí para ver una versión ampliada de esta figura.
Como se muestra en la Figura 7, GFBFEN estandariza los datos de evaluación docente de múltiples fuentes. La GAT modela relaciones complejas entre características y calcula dinámicamente los pesos de asociación semántica entre nodos utilizando mecanismos de atención. KD comprime el conocimiento del modelo complejo en una red ligera, mejorando significativamente la eficiencia de la inferencia manteniendo la precisión. El módulo AM-LSTM asigna pesos de importancia a características multifuente y captura patrones dinámicos temporales de los datos de evaluación, generando resultados intermedios de calibración que integran información de múltiples fuentes. Estos resultados se introducen en el módulo BFEN para su procesamiento profundo. Específicamente, BERT extrae características semánticas de texto no estructurado, RL optimiza dinámicamente umbrales de equidad y parámetros de calibración, GBDT aprende iterativamente patrones de error para la calibración preliminar, y GAN elimina sesgos causados por atributos sensibles mediante entrenamiento adversarial. El mecanismo dinámico de ajuste de parámetros calibra automáticamente la sensibilidad de respuesta y los pesos de equidad de cada módulo detectando en tiempo real los cambios temporales y la distribución de grupos en la escena docente, resolviendo así el problema de la insuficiente adaptabilidad causada por la configuración estática de parámetros y asegurando que el modelo pueda mantener robustez y equidad en diferentes etapas de enseñanza, grupos de estudiantes y escenarios de evaluación. El tipo de evaluación afecta directamente a la granularidad y al ciclo de retroalimentación del modelado de series temporales, mientras que la evaluación formativa enfatiza la naturaleza dinámica del proceso. Las diferencias en disciplinas determinan la asignación de características entre los módulos BERT y GBDT. Por lo tanto, adoptar un mecanismo de ajuste dinámico puede adaptarse eficazmente a diferentes tipos de evaluación y características disciplinares. Finalmente, a través de múltiples rondas de retroalimentación de parámetros y optimización iterativa, el modelo produce resultados precisos y justos de calibración de evaluaciones docentes. La función de optimización de restricciones de equidad dinámica se expresa en la Ecuación (14).
(14)
En la ecuación (14), S representa el conjunto de atributos sensibles,
representa el resultado de calibración de salida previsto,
representa la varianza de las predicciones dentro de los grupos, γ representa parámetros intergrupos y
representa el valor esperado global. El cálculo adaptativo de los pesos de fusión de características multifuente se muestra en la Ecuación (15).
(15)
En la ecuación (15), wk representa el peso de características de la k-ésima fuente de datos, β representa el parámetro de peso, Sim representa la función de medición de similitud de características, fk representa el vector de características extraído de la k-ésima fuente de datos, fglobal representa el centro global de características y K representa el número total de fuentes de datos. El estudio estableció los pesos de atributos sensibles, incluyendo género, etnia, región, situación económica familiar y origen en lengua materna. Los pesos se determinan en función de los resultados del análisis de correlación. El estudio utilizó el coeficiente de correlación de Pearson y el coeficiente de correlación de rango Spearman como indicadores duales para la evaluación conjunta, combinados con experiencia experta en el campo de la educación para calibración de peso. La determinación final de los pesos para cada atributo sensible arrojó valores de 0,18 para género, 0,22 para etnia, 0,25 para región, 0,19 para la situación económica familiar y 0,16 para el origen de lengua materna. Género: Identidad de género según registro legal y autoidentificación, binario (hombre/mujer) con opciones no binarias; Campo de datos "género". Etnia: Basada en la identificación étnica nacional de 56 grupos, compatibles con grupos no identificados y transfronterizos; Campo de datos "etnicidad". Región: División administrativa del registro de hogares o residencia a largo plazo, que abarca los niveles provincial, municipal y de condado, considerando la estructura dual urbano-rural y la población migrante; Campo de datos "región". Estado económico familiar: Según estándares estadísticos nacionales e indicadores de asistencia educativa, utilizando una clasificación de cinco niveles; Campo de datos "economic_status". Antecedentes de la lengua materna: Enseñanza primaria y comunicación familiar durante la educación básica, abarcando mandarín, lenguas minoritarias, dialectos y lenguas extranjeras, ponderados según la edad y frecuencia de adquisición; Campo de datos "mother_tongue."
El proceso de corrección adoptó un mecanismo dinámico de ponderación de tres etapas. La primera etapa implementó la identificación inicial de desviaciones basada en la matriz de pesos de atributos sensibles, marcando puntos de datos que se desviaban significativamente del centro global de características en dimensiones como género, etnia y región. La segunda etapa introduce restricciones educativas del contexto para recalificar la intensidad de la desviación de manera consciente del contexto. La tercera etapa verifica la estabilidad de corrección mediante pruebas de perturbación contrafactual, reemplazando sistemáticamente los valores de atributos sensibles manteniendo sin cambios las características no sensibles, y observando si el cambio en las puntuaciones de evaluación se mantiene dentro del umbral del ±±3,2%.