$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Projeto e otimização do algoritmo FairEduNet
O estudo combina GAN e GBDT para construir o algoritmo FairEduNet, alcançando os objetivos duplos de correção de justiça e correção de precisão, em vez do compromisso da otimização unidirecional. O FairEduNet adota uma arquitetura colaborativa de duplo canal: o canal backbone do GBDT é responsável pela modelagem estruturada de erros e correção precisa, enquanto o canal auxiliar GAN foca em desacoplar atributos sensíveis e ajustar dinamicamente a justiça. A arquitetura do algoritmo FairEduNet, combinando GAN e GBDT, é mostrada na Figura 1.

Figura 1: Arquitetura do algoritmo FairEduNet combinando GAN e GBDT. Por favor, clique aqui para ver uma versão maior desta figura.
Como mostrado na Figura 1, o FairEduNet primeiro coleta e pré-processa dados de avaliação multifonte. O GBDT utiliza múltiplas árvores de decisão para aprender iterativamente padrões de erro de avaliação, gera resultados iniciais de calibração e os encaminha para o módulo GAN. O GAN treina o discriminador para aprender a relação entre os resultados iniciais da calibração e atributos sensíveis, enquanto o gerador ajusta dinamicamente os parâmetros de calibração. Por meio de múltiplas rodadas de treinamento adversarial e verificação de justiça, o viés de justiça é otimizado. Por fim, os resultados calibrados pela justiça são enviados de volta ao módulo GBDT, que ajusta para precisão e justiça, fornecendo a base de calibração e o relatório da avaliação do ensino. O GBDT calcula os resíduos conforme mostrado na Equação (1).
(1)
Na Equação (1),
representa o resíduo da i-ésima amostra na t-ésima iteração, yi representa o valor verdadeiro, e
representa o valor de predição da t-1-ésima iteração. O processo adversarial da GAN é mostrado na Equação (2).
(2)
Na Equação (2), x representa o resultado inicial da calibração, z representa características de atributos sensíveis, Pdata(x) representa a verdadeira distribuição de características não sensíveis, Pz(z) representa a distribuição de atributos sensíveis, D representa o discriminador e G representa ogerador 15. A saída inicial de calibração do GBDT é mostrada na Equação (3).
(3)
Na Equação (3),
representa a previsão da i-ésima amostra pela árvore de decisão inicial, K representa o número total de árvores de decisão, γ k representa o peso da k-ésima árvore, e hk(xi) representa a saída de previsão da k-ésima árvore para a i -A amostra. O algoritmo FairEduNet pode fornecer calibração precisa e garantia de justiça para o ensino dos dados de avaliação. No entanto, ao processar dados de avaliação não estruturados e se adaptar a cenários dinâmicos, o FairEduNet apresenta fraca capacidade de extração de características para características não estruturadas, resultando em viés de calibração. Além disso, os indicadores de justiça e parâmetros de calibração do FairEduNet são definidos estaticamente, limitando sua adaptabilidade a diferentes cenários de ensino e afetando a qualidade geral da calibração. A combinação de representações bidirecionais dos codificadores de transformadores (BERT) e aprendizado por reforço (RL), o algoritmo BERT-RL, pode extrair com precisão características profundas de texto não estruturado e adaptar dinamicamente parâmetros de cenários sem definir manualmente limiares estáticos, melhorando ainda mais a confiabilidade das saídas dos algoritmos noscenários 16,17. Métodos tradicionais como TF-IDF dependem da frequência das palavras, mas carecem de compreensão contextual profunda e não conseguem distinguir direções específicas de "justiça" em diferentes cenários. Word2Vec produz vetores de palavras estáticos, que têm dificuldade em se adaptar a mudanças contextuais complexas e reconhecem viés indiretos. O BERT utiliza autoatenção multi-camada para codificar contexto bidirecional, capturando tanto termos explícitos enviesados quanto lógica implícita enviesada. Abordagens tradicionais exigem listas de palavras de viés construídas manualmente, dependem da experiência subjetiva e abrangem cenários limitados. Por meio de aprendizado de transferência de modelos pré-treinado, o BERT aprende automaticamente características semânticas profundas sem esforço manual extenso, oferecendo uma generalização mais forte no reconhecimento de viés ambíguo. Além disso, métodos tradicionais frequentemente perdem informações com textos longos, enquanto o BERT suporta até 512 tokens, preservando relações contextuais, localizando com precisão características de viés e permitindo correções de justiça detalhadas. O processo operacional do BERT-RL é mostrado na Figura 2.

Figura 2: Fluxograma de operações do algoritmo BERT-RL. Por favor, clique aqui para ver uma versão maior desta figura.
Como mostrado na Figura 2, o BERT-RL primeiro padroniza dados de avaliação de texto não estruturado e os insere no modelo BERT. O BERT utiliza um codificador Transformer para modelagem semântica bidirecional para extrair características-chave e construir uma matriz de características. A matriz de características é então inserida no módulo RL, que aprende a estratégia ótima por meio de múltiplas iterações. A configuração otimizada dos parâmetros é finalmente inserida no FairEduNet, melhorando sua adaptabilidade. O cálculo do peso das características de autoatenção do BERT é mostrado na Equação (4).
(4)
Na Equação (4), dk representa a dimensão do vetor K. A função de recompensa multiobjetivo RL é expressa na Equação (5).
(5)
Na Equação (5), ω1, ω2 e ω3 representam coeficientes de peso,
correspondem erro de calibração, Dt é desvio de justiça, D alvo é desvio de fairness target e Tt é tempode execução 18. Este estudo combina BERT-RL com FairEduNet para formar o algoritmo BERT-RL-FairEduNet, chamado de BFEN. O BFEN alcança calibração precisa e garantia de justiça no ensino dos dados de avaliação por meio da iteração de características do GBDT e treinamento adversarial em tempo real GAN, enquanto o BERT-RL otimiza o FairEduNet no manejo de dados não estruturados e na adaptação dinâmica a cenários, corrigindo fraquezas na extração de características e limitações estáticas de parâmetros. O estudo utilizou o modelo BERT-base-chinês e pré-treinou o corpus de registros reais de ensino, textos gravados em sala de aula e documentos de políticas educacionais da National Smart Education Platform para o ano letivo de 2024 a 2025, com um vocabulário de 21128. A dimensão da camada oculta do modelo é 768, com 12 cabeças de atenção e 12 camadas. A profundidade da árvore GBDT foi definida para 8, o número de árvores era 200 e a taxa de aprendizado era 0,1. O ciclo de treinamento do GAN é de 150 rodadas, e o discriminador utiliza uma rede totalmente conectada de 3 camadas com tamanhos de 512, 256 e 1. O gerador utiliza uma rede totalmente conectada de 4 camadas com tamanhos 1024, 512, 256 e 1. O número de unidades ocultas no LSTM é 128, e o comprimento da sequência é 512. O GAT tem 2 camadas e 4 cabeças de atenção. A temperatura para destilação do conhecimento é definida para 3,0. Coeficientes de peso de recompensa RL ω1 = 0,4, ω2 = 0,35 e ω3 = 0,25. Os critérios de seleção de pesos são para equilibrar o equilíbrio frontal de Pareto da otimização multiobjetivo com os requisitos de interpretabilidade das práticas de equidade educacional. Os experimentos foram concluídos usando uma divisão de 50% dos dados por meio de validação cruzada e ajuste de hiperparâmetros. O processo BFEN para calibração de avaliações de ensino é mostrado na Figura 3.

Figura 3: Processo de correção do algoritmo BFEN para educação inteligente e avaliação do ensino. Por favor, clique aqui para ver uma versão ampliada desta figura.
Como mostrado na Figura 3, o BFEN primeiro pré-processa dados de avaliação de ensino multi-fonte. O BERT otimiza a capacidade de extração de características do FairEduNet calculando similaridade semântica do texto e pesos profundos de características com base em uma janela semântica, selecionando características importantes para construir uma matriz semântica de alta dimensão. O RL então define uma função de recompensa multi-objetivo e calcula gradientes de adaptabilidade ao cenário e ajuste de parâmetros para otimizar ainda mais os limiares de justiça e parâmetros de calibração. O FairEduNet calcula desvios entre dados de avaliação e modelos de padrão de erro, atualiza iterativamente os pesos da árvore de decisão e ajusta estratégias de calibração até que os erros se estabilizem dentro de limites pré-definidos. O resultado final inclui o modelo de calibração de erros e o relatório de verificação de equidade. O modelo de calibração é aplicado aos dados de avaliação do ensino, gerando tabelas comparativas pré e pós-calibração, que são combinadas com a biblioteca de padrões de justiça educacional inteligente para determinar parâmetros de calibração alvo, fornecendo uma base científica para a calibração de avaliação do ensino na educação inteligente. Esta biblioteca padrão abrange três dimensões: equidade em oportunidades educacionais, equidade de processos e equidade de resultados, e inclui 12 indicadores principais. Esses indicadores incluem o equilíbrio da alocação de recursos educacionais entre regiões, a diferença na cobertura de infraestrutura digital entre escolas urbanas e rurais, o limiar de tolerância para resposta tardia ao diagnóstico de situações de aprendizagem (≤200 ms), a tolerância à ausência de dados na avaliação multimodal (≤3,5%), a sensibilidade à detecção de viés do algoritmo (desvio AUC para rotulagem gênero/região/estágio ≤ 0,02), o limiar de divergência do KL para distribuição de pontuação antes e depois da correção (≤0,08), a pontuação de interpretabilidade das sugestões de intervenção do professor (≥4,2/5,0), a pontualidade das atualizações do perfil dos alunos (concluídas em T + 1 dias), o coeficiente de consistência do reconhecimento de créditos multiplataforma (≥0,93), a precisão do alinhamento semântico da política educacional (pontuação BERT ≥ 0,86) e a completude da geração de relatórios de verificação de justiça (incluindo atribuição de viés, intervalos de confiança e snapshots de parâmetros reproduzíveis), além da taxa dinâmica de validação de adaptação de cenários que cobre três cenários típicos: sala de aula ao vivo, tarefas assíncronas e assistentes de ensino de IA. O cálculo de similaridade semântica de características é mostrado na Equação (6).
(6)
Na Equação (6), fi representa o valor da i-ésima dimensão semântica das características, gi representa o valor da i-ésima dimensão importante das características de avaliação, e n representa o número total de dimensões das características. O cálculo do parâmetro de adaptação do cenário RL é mostrado na Equação (7).
(7)
Na Equação (7), θt representa o valor do parâmetro na t-ésima iteração, α representa a taxa de aprendizado e
representa o gradiente de parâmetros baseado na função de recompensa R(θt).
Construção do modelo de calibração de avaliação do ensino
Embora o BFEN demonstre certas vantagens no ensino da calibração de avaliações, ele ainda enfrenta baixa eficiência de integração para dados heterogêneos de avaliação multi-fonte e adaptação dinâmica insuficiente da justiça em aplicações práticas. O algoritmo AM-LSTM, que combina Mecanismo de Atenção (AM) e Memória de Curto Prazo Longo (LSTM), atribui pesos às principais características dos dados de avaliação multifonte por meio do AM e captura os padrões dinâmicos de mudança dos dados de avaliação ao longo do tempo usando a capacidade de memória sequencial do LSTM. Essa abordagem melhora efetivamente a eficiência da integração de dados multi-fonte e o aprendizado dinâmico de recursos19,20. O processo operacional do AM-LSTM é mostrado na Figura 4.

Figura 4: Fluxograma de operação AM-LSTM. Por favor, clique aqui para ver uma versão ampliada desta figura.
Como mostrado na Figura 4, o AM-LSTM primeiro pré-processa dados de avaliação de ensino heterogêneos multi-fonte para formar um conjunto de dados padronizado. O AM calcula pesos de atenção para características de diferentes fontes de dados para selecionar características importantes e constrói uma matriz de características ponderada. A matriz de características ponderada é então inserida no LSTM, que utiliza seu mecanismo de controle para aprender padrões dinâmicos ao longo do tempo, capturando relações entre dados de avaliação em diferentes estágios e emitindo vetores dinâmicos de características. Por fim, esses vetores de características dinâmicas são combinados com restrições de justiça para gerar resultados intermediários de calibração que se adaptam à integração de dados multi-fonte e a cenários dinâmicos, fornecendo uma base para otimizações subsequentes do modelo. O cálculo do peso de atenção é mostrado na Equação (8).
(8)
Na Equação (8), a n representa a alocação de atenção para a n-ésima característica, xn representa a similaridade, q representa o vetor de consulta e softmax representa a função de ativação. O portão de esquecimento do LSTM é expresso na Equação (9).
(9)
Na Equação (9), Wf é o peso da porta de esquecimento, bf é o viés da porta de esquecimento, xt é a entrada no tempo t, ht-1 é a variável de estado externa no tempo t-1, e σ representa a funçãosigmoide 21. Este estudo combina AM-LSTM com BFEN para construir o modelo de calibração de avaliação de ensino AM-LSTM-BFEN, conhecido como FBFEN. Neste modelo, o AM-LSTM aborda as limitações do BFEN na eficiência de integração heterogênea de dados multi-fonte e extração dinâmica de características. Também integra restrições de justiça para otimizar os resultados de calibração intermediária, permitindo que o BFEN alcance ainda mais calibração precisa e garantia dinâmica de justiça para o ensino dos dados de avaliação. O processo operacional do FBFEN é mostrado na Figura 5.

Figura 5: Processo operacional do modelo de avaliação e correção do ensino FBFEN. Por favor, clique aqui para ver uma versão maior desta figura.
Como mostrado na Figura 5, o FBFEN primeiro pré-processa os dados originais de avaliação de ensino multifontes e insere o conjunto de dados padronizado no módulo AM-LSTM. O AM calcula os pesos de atenção das características, enquanto o LSTM aprende padrões dinâmicos, produzindo resultados intermediários de calibração que integram informações multifontes e características dinâmicas. Os resultados intermediários são então inseridos no módulo BFEN. O GBDT aprende iterativamente os padrões de erro dos dados de avaliação com base nos resultados intermediários e no modelo de erro pré-definido, gerando resultados preliminares de calibração. Enquanto isso, o GAN analisa o viés de justiça causado por atributos sensíveis nos resultados preliminares por meio de treinamento adversarial entre o gerador e o discriminador, ajustando dinamicamente os parâmetros de calibração para eliminar o viés. Por fim, os parâmetros de calibração otimizados para GAN são reenviados ao GBDT para atualizar os pesos da árvore de decisão e as estratégias de calibração, produzindo um resultado secundário de calibração que equilibra precisão e justiça. A padronização dos dados é expressa na Equação (10).
(10)
Na Equação (10), z' representa o valor padronizado, z representa o valor original, e zmin e zmax representam os valores mínimo e máximo. A função objetivo final do gerador GAN é expressa na Equação (11).
(11)
Na Equação (11), N representa o número de iterações, λ representa o fator de peso de perda, ωi representa o fator de peso da i-ésima iteração,
representa a função de perda adversarial e
representa a perda binária de entropiacruzada 22.
Otimização do modelo de calibração de avaliação de ensino FBFEN
Embora o FBFEN demonstre forte integração de dados multi-fonte e garantia dinâmica de justiça na calibração de avaliações do ensino, ele ainda enfrenta correlação fraca de características e baixa eficiência de treinamento e inferência devido à estrutura complexa do modelo em cenários educacionais complexos. O algoritmo GAT-KD, que combina Rede de Atenção em Grafos (GAT) e Destilação de Conhecimento (KD), constrói dinamicamente um grafo de associação semântica entre características por meio do mecanismo de atenção do GAT, aprimorando o alinhamento semântico de dados multifonte. O KD comprime o conhecimento do modelo complexo em uma rede leve, melhorando significativamente a eficiência da inferência enquanto mantém o desempenho domodelo 23,24. O processo operacional do GAT-KD é mostrado na Figura 6.

Figura 6: Fluxograma de operações GAT-KD. Por favor, clique aqui para ver uma versão maior desta figura.
Como mostrado na Figura 6, o GAT-KD constrói um grafo semântico de associação entre características por meio do módulo GAT, agrega dinamicamente informações de características de vizinhança usando o mecanismo de atenção e aprimora a representação semântica das características locais. O KD então utiliza os soft labels de saída como sinais de supervisão, minimizando a perda de divergência entre distribuições de saída e a perda de entropia cruzada entre suas previsões e os true labels, alcançando transferência de conhecimento e compressão do modelo. A saída final é um modelo de calibração leve, com alta precisão e eficiência. O cálculo do coeficiente de atenção da GAT é mostrado na Equação (12).
(12)
Na Equação (12),
e
representam os vetores de características dos nós i e j, W representa a matriz de pesos aprendível, a representa o vetor de pesos de atenção,
representa a operação de concatenação, e LeakyReLU representa a função deativação 25. O cálculo da função de perda KD é mostrado na Equação (13).
(13)
Na Equação (13), KL representa a perda de divergência, T2 representa o balanço de escala do gradiente, pstudent representa a probabilidade soft label do modelo leve, e pteacher representa a probabilidade soft label do modelocomplexo 26. Ao combinar associação de características aprimorada pela atenção e transferência leve de conhecimento, o GAT-KD aborda efetivamente o viés semântico de características e a alta complexidade computacional. Este estudo integra o GAT-KD ao FBFEN para formar o modelo de calibração de avaliação de ensino GAT-KD-FBFEN, conhecido como GFBFEN. O GAT-KD otimiza as limitações do FBFEN em captura incompleta de correlação de características multi-fonte e baixa eficiência de inferência. O processo operacional do GFBFEN é mostrado na Figura 7.

Figura 7: Processo de avaliação e correção do modelo de avaliação e correção do GFBFEN. Por favor, clique aqui para ver uma versão maior desta figura.
Como mostrado na Figura 7, o GFBFEN padroniza dados de avaliação de ensino multifonte. O GAT modela relações complexas entre características e calcula dinamicamente pesos de associação semântica entre nós usando mecanismos de atenção. O KD comprime o conhecimento do modelo complexo em uma rede leve, melhorando significativamente a eficiência da inferência enquanto mantém a precisão. O módulo AM-LSTM atribui pesos de importância a características multi-fonte e captura padrões dinâmicos temporais dos dados de avaliação, gerando resultados intermediários de calibração que integram informações multifonte. Esses resultados são inseridos no módulo BFEN para processamento profundo. Especificamente, o BERT extrai características semânticas de texto não estruturado, o RL otimiza dinamicamente limiares de justiça e parâmetros de calibração, o GBDT aprende iterativamente padrões de erro para calibração preliminar, e o GAN elimina vieses causados por atributos sensíveis por meio de treinamento adversarial. O mecanismo dinâmico de ajuste de parâmetros calibra automaticamente os pesos de sensibilidade e justiça de resposta de cada módulo, detectando as mudanças temporais e os deslocamentos de distribuição de grupos da cena de ensino em tempo real, resolvendo assim o problema da adaptabilidade insuficiente causada pela configuração estática dos parâmetros e garantindo que o modelo possa manter robustez e justiça em diferentes estágios de ensino, grupos de estudantes e cenários de avaliação. O tipo de avaliação afeta diretamente a granularidade e o ciclo de retroalimentação da modelagem de séries temporais, enquanto a avaliação formativa enfatiza a natureza dinâmica do processo. As diferenças entre as disciplinas determinam a alocação de características entre os módulos BERT e GBDT. Portanto, adotar um mecanismo de ajuste dinâmico pode se adaptar efetivamente a diferentes tipos de avaliação e características disciplinares. Por fim, por meio de múltiplas rodadas de feedback de parâmetros e otimização iterativa, o modelo produz resultados precisos e justos de calibração de avaliações de ensino. A função de otimização de restrições de justiça dinâmica é expressa na Equação (14).
(14)
Na Equação (14), S representa o conjunto de atributos sensíveis,
representa o resultado previsto da calibração de saída,
representa a variância das previsões dentro dos grupos, γ representa parâmetros intergrupos e
representa o valor esperado global. O cálculo adaptativo dos pesos de fusão de características multi-fonte é mostrado na Equação (15).
(15)
Na Equação (15), wk representa o peso das características da k-ésima fonte de dados, β representa o parâmetro de peso, Sim representa a função de medição de similaridade de características, fk representa o vetor de características extraído da k-ésima fonte de dados, fglobal representa o centro global de características, e K representa o número total de fontes de dados. O estudo definiu os pesos dos atributos sensíveis, incluindo gênero, etnia, região, situação econômica familiar e origem na língua materna. Os pesos são determinados com base nos resultados da análise de correlação. O estudo utilizou o coeficiente de correlação de Pearson e o coeficiente de correlação de rank Spearman como indicadores duplos para avaliação conjunta, combinados com experiência especializada na área de educação para calibração de peso. A determinação final dos pesos para cada atributo sensível resultou em valores de 0,18 para gênero, 0,22 para etnia, 0,25 para região, 0,19 para status econômico familiar e 0,16 para origem na língua materna. Gênero: Identidade de gênero por registro legal e autoidentificação, binário (masculino/feminino) com opções não binárias; Campo de dados "gênero". Etnia: Com base na identificação étnica nacional de 56 grupos, compatível com grupos não identificados e transfronteiriços; Campo de dados "etnia". Região: Divisão administrativa do registro domiciliar ou residência de longo prazo, abrangendo níveis provincial, municipal e de condado, considerando a estrutura dual urbano-rural e a população migrante; Campo de dados "região". Situação econômica familiar: De acordo com padrões estatísticos nacionais e indicadores de assistência educacional, utilizando uma classificação de cinco níveis; Campo de dados "economic_status". Antecedentes na língua materna: Ensino primário e língua de comunicação familiar durante a educação básica, abrangendo mandarim, línguas minoritárias, dialetos e línguas estrangeiras, ponderados pela idade e frequência de aquisição; Campo de dados "mother_tongue."
O processo de correção adotou um mecanismo de ponderação dinâmica em três estágios. A primeira etapa implementou a identificação inicial de desvio baseada na matriz de pesos dos atributos sensíveis, marcando pontos de dados que se desviaram significativamente do centro global de características em dimensões como gênero, etnia e região. A segunda etapa introduz restrições de contexto educacional para requalificar a intensidade do desvio de forma consciente do contexto. A terceira etapa verifica a estabilidade da correção por meio de testes de perturbação contrafactual, substituindo sistematicamente os valores dos atributos sensíveis enquanto mantém as características não sensíveis inalteradas, e observando se a mudança nas pontuações de avaliação está dentro do limiar de ±±3,2%.