Детальная информация

Название Нейросетевая модель для повышения качества представлений видео на основе глубокого обучения: выпускная квалификационная работа магистра: направление 02.04.03 «Математическое обеспечение и администрирование информационных систем» ; образовательная программа 02.04.03_01 «Разработка и математическое обеспечение интеллектуальных информационных систем» = Neural network model for improving the quality of video representations based on deep learning
Авторы Нахла Мажд
Научный руководитель Надер Бакир
Организация Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Выходные сведения Санкт-Петербург, 2026
Коллекция Выпускные квалификационные работы ; Общая коллекция
Тематика неявные нейронные представления ; NeRV ; остаточное обучение ; видеореконструкция ; квантование ; H.264 ; PSNR ; SSIM ; BPP ; implicit neural representations ; residual learning ; video reconstruction ; quantization
Тип документа Выпускная квалификационная работа магистра
Язык Русский
Уровень высшего образования Магистратура
Код специальности ФГОС 02.04.03
Группа специальностей ФГОС 020000 - Компьютерные и информационные науки
DOI 10.18720/SPBPU/3/2026/vr/vr26-5629
Права доступа Доступ по паролю из сети Интернет (чтение, печать, копирование)
Дополнительно Новинка
Ключ записи ru\spstu\vkr\44854
Дата создания записи 04.09.2026

Разрешенные действия

Действие 'Прочитать' будет возможно после подготовки администраторами необходимых файлов

Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Группа Анонимные пользователи
Сеть Интернет

Настоящая работа посвящена улучшению качества нейросетевого представления видео на основе архитектуры NeRV. Суть подхода INR (Implicit Neural Representations) — кодировать весь видеопоток в виде функции от времени, что даёт компактные веса и гибкое декодирование, — хорошо известна, однако базовая конфигурация NeRV стабильно проигрывает в высокочастотных зонах: границы объектов и мелкие текстуры восстанавливаются хуже всего. Решение — двухшаговая процедура. Сначала обычный MLP учится восстанавливать «грубую» картинку (низко- и среднечастотные составляющие). Затем вторая сеть смотрит на ошибку первой, умноженную на коэффициент α, и пытается её компенсировать; итог взвешенно складывается. Проверка велась на последовательностях DAVIS (1280×720, 20 кадров). Результаты показали рост PSNR на +5,96 дБ — с 25,19 до 31,16 дБ — и увеличение SSIM до 0,870 по сравнению с исходной конфигурацией. Динамическое квантование INT8 уменьшило объём весов модели в 3,9 раза (BPP снизился с 1238,49 до 316,83) практически без потери качества (ΔPSNR ≤ 0,04 дБ). Сопоставление с традиционным кодеком H.264 (CRF 23) показало, что по эффективности сжатия INR-модели уступают (BPP 316,83 против 0,276), однако располагают рядом принципиальных достоинств: непрерывным временным представлением, возможностью синтеза кадров при произвольном разрешении и отсутствием привязки к GOP-структуре. Созданный программный комплекс полностью воспроизводим и включает модули обучения, визуализации карт остаточных ошибок, автоматического расчёта метрик качества и построения кривых Rate-Distortion.

This work is devoted to improving the quality of neural network video representation based on the NeRV architecture. The essence of the INR (Implicit Neural Representations) approach — to encode the entire video stream as a function of time, which gives compact weights and flexible decoding — is well known, however, the basic configuration of NeRV consistently loses in high-frequency zones: object boundaries and fine textures are the worst restored. The solution is a two—step procedure. First, an ordinary MLP learns how to reconstruct a "rough" picture (low- and medium-frequency components). Then the second network looks at the error of the first one multiplied by the coefficient α and tries to compensate for it; the result is weighted. The test was performed on DAVIS sequences (1280x720, 20 frames). The results showed an increase in PSNR by +5.96 dB — from 25.19 to 31.16 dB — and an increase in SSIM to 0.870 compared to the initial configuration. Dynamic quantization of INT8 reduced the volume of the model weights by 3.9 times (BPP decreased from 1238.49 to 316.83) with virtually no loss of quality (DPSNR ≤ 0.04 dB). Comparison with the traditional H.264 codec (CRF 23) showed that INR models are inferior in terms of compression efficiency (BPP 316.83 versus 0.276), however, they have a number of fundamental advantages: continuous time representation, the ability to synthesize frames at arbitrary resolution and lack of binding to the GOP structure. The created software package is fully reproducible and includes training modules, visualization of residual error maps, automatic calculation of quality metrics and construction of Rate-Distortion curves.

Место доступа Группа пользователей Действие
Локальная сеть ИБК СПбПУ Все
Загрузить
Интернет Авторизованные пользователи СПбПУ
Загрузить
Интернет Анонимные пользователи
...