Details

Title Нейросетевая модель для повышения качества представлений видео на основе глубокого обучения: выпускная квалификационная работа магистра: направление 02.04.03 «Математическое обеспечение и администрирование информационных систем» ; образовательная программа 02.04.03_01 «Разработка и математическое обеспечение интеллектуальных информационных систем» = Neural network model for improving the quality of video representations based on deep learning
Creators Нахла Мажд
Scientific adviser Надер Бакир
Organization Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects неявные нейронные представления ; NeRV ; остаточное обучение ; видеореконструкция ; квантование ; H.264 ; PSNR ; SSIM ; BPP ; implicit neural representations ; residual learning ; video reconstruction ; quantization
Document type Master graduation qualification work
Language Russian
Level of education Master
Speciality code (FGOS) 02.04.03
Speciality group (FGOS) 020000 - Компьютерные и информационные науки
DOI 10.18720/SPBPU/3/2026/vr/vr26-5629
Rights Доступ по паролю из сети Интернет (чтение, печать, копирование)
Additionally New arrival
Record key ru\spstu\vkr\44854
Record create date 9/4/2026

Allowed Actions

Action 'Read' will be available if administrator prepare required files

Action 'Download' will be available if you login or access site from another network

Group Anonymous
Network Internet

Настоящая работа посвящена улучшению качества нейросетевого представления видео на основе архитектуры NeRV. Суть подхода INR (Implicit Neural Representations) — кодировать весь видеопоток в виде функции от времени, что даёт компактные веса и гибкое декодирование, — хорошо известна, однако базовая конфигурация NeRV стабильно проигрывает в высокочастотных зонах: границы объектов и мелкие текстуры восстанавливаются хуже всего. Решение — двухшаговая процедура. Сначала обычный MLP учится восстанавливать «грубую» картинку (низко- и среднечастотные составляющие). Затем вторая сеть смотрит на ошибку первой, умноженную на коэффициент α, и пытается её компенсировать; итог взвешенно складывается. Проверка велась на последовательностях DAVIS (1280×720, 20 кадров). Результаты показали рост PSNR на +5,96 дБ — с 25,19 до 31,16 дБ — и увеличение SSIM до 0,870 по сравнению с исходной конфигурацией. Динамическое квантование INT8 уменьшило объём весов модели в 3,9 раза (BPP снизился с 1238,49 до 316,83) практически без потери качества (ΔPSNR ≤ 0,04 дБ). Сопоставление с традиционным кодеком H.264 (CRF 23) показало, что по эффективности сжатия INR-модели уступают (BPP 316,83 против 0,276), однако располагают рядом принципиальных достоинств: непрерывным временным представлением, возможностью синтеза кадров при произвольном разрешении и отсутствием привязки к GOP-структуре. Созданный программный комплекс полностью воспроизводим и включает модули обучения, визуализации карт остаточных ошибок, автоматического расчёта метрик качества и построения кривых Rate-Distortion.

This work is devoted to improving the quality of neural network video representation based on the NeRV architecture. The essence of the INR (Implicit Neural Representations) approach — to encode the entire video stream as a function of time, which gives compact weights and flexible decoding — is well known, however, the basic configuration of NeRV consistently loses in high-frequency zones: object boundaries and fine textures are the worst restored. The solution is a two—step procedure. First, an ordinary MLP learns how to reconstruct a "rough" picture (low- and medium-frequency components). Then the second network looks at the error of the first one multiplied by the coefficient α and tries to compensate for it; the result is weighted. The test was performed on DAVIS sequences (1280x720, 20 frames). The results showed an increase in PSNR by +5.96 dB — from 25.19 to 31.16 dB — and an increase in SSIM to 0.870 compared to the initial configuration. Dynamic quantization of INT8 reduced the volume of the model weights by 3.9 times (BPP decreased from 1238.49 to 316.83) with virtually no loss of quality (DPSNR ≤ 0.04 dB). Comparison with the traditional H.264 codec (CRF 23) showed that INR models are inferior in terms of compression efficiency (BPP 316.83 versus 0.276), however, they have a number of fundamental advantages: continuous time representation, the ability to synthesize frames at arbitrary resolution and lack of binding to the GOP structure. The created software package is fully reproducible and includes training modules, visualization of residual error maps, automatic calculation of quality metrics and construction of Rate-Distortion curves.

Network User group Action
ILC SPbPU Local Network All
Download
Internet Authorized users SPbPU
Download
Internet Anonymous
...