Введение
Задачи прогнозирования динамики учебных и когнитивных показателей обучающихся в онлайн-средах в последние годы активно развиваются в рамках прикладных исследований образовательной аналитики. Однако большинство существующих работ ориентировано на предсказание академической успеваемости и агрегированных поведенческих метрик, а не на моделирование психологических состояний как непрерывных динамических процессов (Wang & Yu, 2025).
Цифровизация образования привела к возникновению нового психологического феномена — цифрового когнитивного выгорания (ЦКВ). Оно определяется как устойчивое сочетание истощаемости, дистанцирования и снижения эффективности в цифровых учебных средах (Soldatova, 2018). В отличие от кратковременной усталости, ЦКВ является хроническим состоянием, требующим ранней диагностики и профилактики (Kuppens & Verduyn, 2017; Юрьева, 2025).
Работа (Юрьева, 2025) была посвящена задаче классификации дискретных когнитивных состояний. Однако такой подход не позволяет анализировать динамику изменения психометрических показателей и выявлять ранние субклинические тренды, что существенно ограничивает возможности профилактики цифрового когнитивного выгорания.
Данное исследование переходит к более сложной задаче прогнозирования непрерывной многомерной траектории психометрического показателя (MBI-SS) на заданном временном горизонте. Фактически, это задача регрессионного анализа мультимодальных, неоднородных и зашумленных временных рядов.
1. Формальная постановка задачи и функционал потерь
1.1. Математическая формализация
-
Мультимодальные наблюдаемые переменные: , где — тип модальности, — размерность признаков, — длина временного ряда в окне (может различаться для разных модальностей).
-
Целевая переменная: — вектор баллов по трем субшкалам MBI-SS.
Следует отметить, что предполагаемая стационарность статистических свойств временных рядов на интервале наблюдения является приближением, допустимым лишь для относительно коротких временных окон, что накладывает ограничения на интерпретацию долгосрочных прогнозов.
1.2. Составной функционал потерь
Для совместного обучения модели регрессии и классификации вводится составной функционал:
-
Функция потерь прогноза (MSE):
Использование штрафа на резкие изменения согласуется с представлениями о динамике психических состояний как инерционных процессов (Выготский, 1982).
2.Функция потерь классификации:
-
3.L2-регуляризация параметров:
2. Математическая модель архитектуры
2.1. Модальные кодировщики: отображение сырых данных в пространство признаков
Использование мультимодальных данных для анализа и прогнозирования психических и аффективных состояний опирается на результаты исследований, демонстрирующих, что сочетание поведенческих, речевых и физиологических сигналов позволяет более полно описывать динамику внутренних состояний по сравнению с одномодальными подходами (D’Mello & Kory, 2015).
2.2. Кросс-модальный модуль интеграции данных на основе механизма внимания
Выбор кросс-модального подхода к объединению разнородных источников данных соответствует современным представлениям мультимодального машинного обучения, в рамках которых особое внимание уделяется согласованию представлений различных модальностей и явному моделированию их взаимодействий (Baltrušaitis et al., 2019).
Здесь:
-
— запрос, получаемый из токенов модальности . -
— ключи и значения из всех модальностей. -
— маска, позволяющая, например, текстовым токенам «видеть» только аудио и видео за тот же временной интервал, что эмпирически снижает количество некоррелированных межмодальных взаимодействий и упрощает интерпретацию матриц внимания.
Результаты всех голов конкатенируются и проходят через линейное преобразование:
Это позволяет каждой модальности «запрашивать» релевантную информацию из других модальностей.
Альтернативой кросс-модальному вниманию могли бы выступать методы тензорной интеграции или графовые модели взаимодействия модальностей, однако они либо существенно увеличивают размерность параметрического пространства, либо затрудняют интерпретацию межмодальных связей.
2.3. Прогнозный декодер и классификатор
3. Алгоритм обучения и оптимизация
Алгоритм 1. Обучение кросс-модальной прогнозной модели.
-
1.Вход: мультимодальный набор данных , гиперпараметры .
-
2.Инициализация: параметры инициализируются согласно He et al. (2015).
-
Для каждой эпохи:
-
1.Разбить на мини-пакеты .
-
2.Для каждого мини-пакета :
-
Прямой проход: вычислить .
-
Вычислить составную функцию потерь .
-
Обратный проход: вычислить градиенты .
-
Шаг оптимизации: обновить параметры с помощью AdamW: , где — скорость обучения.
-
-
-
Ранняя остановка: если значение функции потерь не улучшается эпох.
-
Выход: обученные параметры .
Использование оптимизатора AdamW с раздельным затуханием весов обусловлено его более стабильными обобщающими свойствами при обучении глубоких нейронных моделей по сравнению со стандартной версией Adam (Loshchilov & Hutter, 2019).
4. Экспериментальное моделирование и результаты
4.1. Синтетические данные и базовые модели
Для оценки эффективности предложенной архитектуры ее сравнивали с тремя классическими подходами (базовыми моделями):
-
BL1: линейная регрессионная модель с квадратичной регуляризацией (Ridge Regression), обученная на объединенном наборе признаков. Используется как простая интерпретируемая модель сравнения.
-
BL2: рекуррентная нейронная сеть с долговременной памятью (типа LSTM), обученная на объединенных временных рядах признаков, с учетом их последовательной структуры.
-
BL3: ансамблевая модель с раздельной обработкой модальностей и последующим объединением результатов (Late Fusion). Rомплексная модель, где для каждого типа данных (аудио, видео и т.д.) используется своя LSTM, а результаты их работы затем объединяются общим классификатором.
4.2. Метрики оценки
-
Для задач прогнозирования использовались следующие показатели: средняя абсолютная ошибка (MAE), среднеквадратичная ошибка (RMSE) и коэффициент детерминации (R²). -
Качество классификации оценивалось с использованием:
-
-
взвешенной F1-меры (weighted F1-score), учитывающей распределение классов; -
макроусреднённой площади под ROC-кривой (macro-averaged ROC-AUC).
-
Предыдущие исследования показывают, что анализ синхронизированных мультимодальных потоков данных позволяет выявлять скрытые закономерности, связанные с процессами обучения и вовлечённости, недоступные при анализе отдельных каналов информации (Grafsgaard et al., 2014).
4.3. Результаты и анализ
Таблица 1/ Table 1
Сравнение моделей по метрике MAE (прогноз) и F1 (классификация)
Comparison of models using the MAE (prediction) and F1 (classification) metrics
|
Модель / Model |
MAE (Истощение/ Exhaustion) |
MAE (Цинизм/ Cynicism) |
MAE (Эффект./ Effect.) |
MAE (Средн./ Average) |
F1-score |
|
BL1: Ridge |
3.21 |
2.98 |
2.75 |
2.98 |
0.65 |
|
BL2: LSTM |
2.45 |
2.67 |
2.30 |
2.47 |
0.72 |
|
BL3: Late Fusion |
2.20 |
2.31 |
2.05 |
2.19 |
0.78 |
|
Предложенная модель / The proposed model |
1.85 |
1.92 |
1.73 |
1.83 |
0.84 |
-
Аудио-токены проявляют высокое внимание к видео-токенам ( ), что соответствует интеграции голосового стресса и мимики.
-
Текстовые токены «циничных» высказываний сильно взаимодействуют с кинестетическими токенами замедления печати ( ), формируя паттерн поведенческой демотивации.
Следует отметить, что интерпретация матриц внимания и прямое трактование весов как свидетельства причинно-следственных связей не получила однозначного подтверждения и продолжает обсуждаться в научной литературе (Jain & Wallace, 2019).
Обсуждение, ограничения и заключение
Результаты исследований аффективных состояний в образовательных контекстах показывают, что эмоциональные и когнитивные компоненты обучения тесно взаимосвязаны и проявляются в динамике поведения обучающихся, что делает задачу их формального моделирования особенно сложной (Reis et al., 2018). Результаты прогнозирования цифрового когнитивного выгорания целесообразно рассматривать в более широком контексте регуляции психических состояний в учебной деятельности, где когнитивные, эмоциональные и поведенческие компоненты образуют взаимосвязанную динамическую систему. Современные исследования показывают, что устойчивые изменения в структуре учебной активности и саморегуляции обучающихся формируются постепенно и опосредуются как индивидуальными, так и средовыми факторами, что накладывает дополнительные ограничения на интерпретацию краткосрочных прогнозных моделей (Карташева, 2022).
Полученные результаты не следует интерпретировать как готовую диагностическую методику, а лишь как формальный и вычислительный каркас для последующей клинической и психометрической валидации. Подобное ограничение интерпретации соответствует современной методологической позиции в психологии, согласно которой прогнозные модели временной динамики психических состояний не могут рассматриваться как прямые инструменты каузального вывода или индивидуальной диагностики без дополнительной теоретической и эмпирической валидации (Hamaker et al., 2015; Карпов, 2021).
Основные ограничения
-
Вычислительная сложность модели составляет , что требует оптимизации для реального времени.
-
Ограниченная доступность больших размеченных образовательных наборов данных является общей проблемой исследований в области образовательной аналитики и интеллектуальных обучающих систем, что существенно влияет на устойчивость и воспроизводимость результатов моделей машинного обучения (Baker, 2019). -
Дополнительным ограничением практического применения прогнозных моделей в образовательных средах являются этические и нормативные аспекты использования методов искусственного интеллекта, включая вопросы интерпретации результатов, ответственности за принимаемые решения и защиты персональных данных обучающихся, что подчеркивается в современных обзорных работах по данной проблематике (Савгильдина, 2024).
Направления будущих исследований
Применение байесовских методов для количественной оценки неопределённости прогноза, что позволит получать не только точечные оценки траектории выгорания, но и доверительные интервалы .
Отдельным направлением является интеграция вариационных автоэнкодеров (VAE) в модальные кодировщики, что может повысить устойчивость моделей при работе с зашумлёнными и неполными данными.
Заключение
Разработанная в данной работе математическая модель служит теоретическим фундаментом и практическим инструментом для построения систем раннего обнаружения риска цифрового когнитивного выгорания (ЦКВ).
Формализация задачи как прогноза многомерных траекторий на основе гетерогенных временных рядов, а также предложенная кросс-модальная архитектура позволяют не только выявлять характерные изменения в динамике когнитивных и поведенческих показателей, но и рассматривать их во взаимосвязи, что принципиально важно для своевременной диагностики рисков снижения учебной и профессиональной эффективности.
Практическая значимость модели заключается в возможности её использования в качестве аналитического ядра интеллектуальных образовательных сред, ориентированных на поддержку обучающихся и профилактику перегрузки в условиях цифрового обучения. При этом модель рассматривается не как инструмент формального контроля, а как средство повышения адаптивности образовательных систем и более бережного отношения к когнитивным ресурсам человека.
Полученные на синтетических данных результаты подтверждают перспективность подхода, однако их нельзя напрямую экстраполировать на реальные образовательные контексты, поэтому дальнейшие исследования будут направлены на апробацию предложенной модели на масштабных эмпирических данных, собранных в условиях реальной цифровой образовательной среды. Особое внимание планируется уделить вопросам интерпретируемости результатов, корректной работы с неопределённостью прогнозов и строгому соблюдению этических принципов, включая прозрачность алгоритмов, защиту персональных данных и недопущение стигматизации обучающихся. Окончательной целью является создание на основе данной модели этичных, прозрачных и полезных инструментов, которые могут быть интегрированы в образовательные платформы.
В перспективе развитие данного направления может способствовать формированию нового класса интеллектуальных образовательных систем, ориентированных не только на оценку результатов обучения, но и на поддержку устойчивого когнитивного и психологического состояния участников образовательного процесса.