Details

Title Исследование систем глубокого обучения для распознавания эмоций людей: выпускная квалификационная работа бакалавра: направление 09.03.01 «Информатика и вычислительная техника» ; образовательная программа 09.03.01_01 «Разработка компьютерных систем» = Research of deep learning systems for human emotion recognition
Creators Хусейнзода Амир Хусейн
Scientific adviser Никитин Кирилл Вячеславович
Organization Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects распознавание эмоций ; глубокое обучение ; мультимодальный анализ ; компьютерное зрение ; обработка речи ; свёрточные нейронные сети ; трансформеры ; efficientnet ; wavlm ; кросс-модальное внимание ; слияние модальностей ; ravdess ; crema-d ; распознавание в реальном времени ; emotion recognition ; deep learning ; multimodal analysis ; computer vision ; speech processing ; convolutional neural networks ; transformers ; cross-modal attention ; modality fusion ; real-time recognition
Document type Bachelor graduation qualification work
Language Russian
Level of education Bachelor
Speciality code (FGOS) 09.03.01
Speciality group (FGOS) 090000 - Информатика и вычислительная техника
DOI 10.18720/SPBPU/3/2026/vr/vr26-4091
Rights Доступ по паролю из сети Интернет (чтение, печать, копирование)
Additionally New arrival
Record key ru\spstu\vkr\42709
Record create date 8/21/2026

Allowed Actions

Action 'Read' will be available if administrator prepare required files

Action 'Download' will be available if you login or access site from another network

Group Anonymous
Network Internet

Работа посвящена исследованию и разработке мультимодальной системы распознавания эмоций человека по видео- и аудиопотоку на основе методов глубокого обучения. Рассмотрены современные архитектуры анализа эмоций по отдельным модальностям и подходы к их слиянию, сформулированы требования к системе и критерии сравнения с аналогами. Предложена и реализована система, объединяющая видео-ветвь (EfficientNet-B0 с темпоральным трансформером) и аудио-ветвь (WavLM-Large со взвешенной агрегацией слоёв) через обучаемый модуль кросс-модального внимания, а также прототип распознавания эмоций в реальном времени с камеры и микрофона. Работа выполнена на базе СПбПУ. Использованы открытые мультимодальные датасеты RAVDESS и CREMA-D (6 классов эмоций, actor-independent разбиение). Полученная мультимодальная модель достигает на тестовой выборке точности 82,0 %, macro-F1 80,4 % и UAR 80,7 %, что существенно превосходит одномодальные видео- (62,8 %) и аудиоварианты (78,4 %). Прототип обеспечивает устойчивую работу в реальном времени и сохраняет работоспособность при отсутствии одной из модальностей.

The work is devoted to the study and development of a multimodal human emotion recognition system based on video and audio streams using deep learning methods. State-of-the-art architectures for single-modality emotion analysis and fusion strategies are reviewed, requirements for the system and criteria for comparison with analogues are formulated. A system is proposed and implemented that combines a video branch (EfficientNet-B0 with a temporal transformer) and an audio branch (WavLM-Large with weighted layer aggregation) through a trainable cross-modal attention fusion module, as well as a real-time emotion recognition prototype using a camera and a microphone. Open multimodal datasets RAVDESS and CREMA-D were used (6 emotion classes, actor-independent split). The resulting multimodal model achieves 82.0 % accuracy, 80.4 % macro-F1 and 80.7 % UAR on the test set, significantly outperforming the unimodal video (62.8 %) and audio (78.4 %) variants. The prototype provides stable real-time operation and remains functional when one of the modalities is missing.

Network User group Action
ILC SPbPU Local Network All
Download
Internet Authorized users SPbPU
Download
Internet Anonymous
...