Details

Title Разработка многослойной схемы семантического кодирования видепотока: выпускная квалификационная работа магистра: направление 09.04.01 «Информатика и вычислительная техника» ; образовательная программа 09.04.01_15 «Технологии проектирования системного и прикладного программного обеспечения» = Development of a multilayer semantic coding scheme for video stream
Creators Кобыжев Александр Михайлович
Scientific adviser Болсуновская Марина Владимировна
Organization Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Imprint Санкт-Петербург, 2024
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects кодирование видеопотока ; кодирование особенностей изображений ; глубокое обучение ; машинная аналитика ; кодирование видео для машин ; нейросетевые кодеки ; многослойные схемы кодирования ; video coding ; image feature coding ; deep learning ; machine analytics ; video coding for machines ; neural network codecs ; multilayer coding schemes
Document type Master graduation qualification work
Language Russian
Level of education Master
Speciality code (FGOS) 09.04.01
Speciality group (FGOS) 090000 - Информатика и вычислительная техника
DOI 10.18720/SPBPU/3/2024/vr/vr24-3917
Rights Доступ по паролю из сети Интернет (чтение, печать, копирование)
Record key ru\spstu\vkr\33136
Record create date 8/29/2024

Allowed Actions

Action 'Read' will be available if you login or access site from another network

Action 'Download' will be available if you login or access site from another network

Group Anonymous
Network Internet

Данная работа посвящена реализации многослойной схемы семантического кодирования видеопотока для сцен дорожного видеонаблюдения, а также оценке эффективности её работы. Проведён анализ существующих подходов к сжатию изображений и видео, сформулированы требования к схеме кодирования для решения поставленной задачи. Представлено описание разработанной многослойной схемы кодирования видеопотока и функции потерь для обучения нейросетевого кодека. Также разработана программная реализация обучения нейросетевого кодека, предложенной схемы кодирования и тестирования кодеков для сжатия видео на языке Python. По результатам тестирования схемы кодирования даны оценки эффективности сжатия для задач детектирования и распознавания, а также выбраны оптимальные параметры нейросетевого кодека.

This work is devoted to the realization of a multilayer semantic coding scheme for video stream for road surveillance scenes, as well as to the evaluation of its efficiency. The existing approaches to image and video compression are analyzed, and the requirements to the coding scheme for solving the problem are formulated. The description of the developed multilayer video stream coding scheme and loss function for neural network codec training is presented. Also, the program realization of training of neural network codec, the proposed coding scheme and testing of codecs for video compression in Python language is developed. Based on the results of testing the coding scheme, the compression efficiency for detection and recognition tasks is evaluated, and the optimal parameters of the neural network codec are selected.

Network User group Action
ILC SPbPU Local Network All
Read Print Download
Internet Authorized users SPbPU
Read Print Download
Internet Anonymous
  • Список обозначений и сокращений
  • Введение
  • Глава 1. Анализ предметной области
    • 1.1. Описание предметной области, обоснование актуальности
    • 1.2. Анализ существующих подходов к сжатию изображений и видео
    • 1.3. Постановка задачи
    • 1.4. Выводы
  • Глава 2. Разработка многослойной схемы семантического кодирования видеопотока
    • 2.
    • 2.1. Предлагаемый подход эффективного сжатия видеоданных
    • 2.1.1. Основной слой
    • 2.1.2. Улучшающий слой
    • 2.2. Выбор нейросетевого кодека для кодирования видео
    • 2.2.1. SSF2020
    • 2.2.2. DCVC-HEM
    • 2.2.3. DCVC-DC
    • 2.2.4. Сравнение и выбор нейросетевого кодека
    • 2.3. Анализ методов оптимизации нейросетевого кодека
    • 2.3.1. Анализ и выбор функции потерь для эффективного сжатия видео
    • 2.3.2. Анализ моделей для извлечения особенностей изображений
    • 2.4. Выводы
  • Глава 3. Разработка программного средства
    • 3.
    • 3.1. Используемые технологии для разработки программного средства
    • 3.2. Разработка программного средства обучения нейросетевого кодека
    • 3.2.1. Пакет config
    • 3.2.2. Пакет datasets
    • 3.2.3. Пакет transforms
    • 3.2.4. Пакет engine
    • 3.2.5. Пакет model
    • 3.2.6. Пакет solver
    • 3.2.7. Пакет utils
    • 3.2.8. Скрипты для обучения
    • 3.2.9. Конфигурационный файл для обучения
    • 3.2.10. Выходные файлы для Tensorboard
    • 3.3. Программная реализация многослойной схемы семантического кодирования видеопотока
    • 3.3.1. Структура программного средства
    • 3.3.2. Конфигурационный файл для схемы кодирования
    • 3.3.3. Структура выходных файлов
    • 3.4. Разработка программного средства для тестирования кодеков для сжатия видео
    • 3.4.1. Структура программы для кодирования и декодирования видео различными кодеками
    • 3.4.2. Конфигурационный файл для кодирования видео различными кодеками
    • 3.4.3. Структура программы для построения графиков
    • 3.4.4. Конфигурационный файл для построения графиков
    • 3.4.5. Выходные файлы в виде графиков
    • 3.5. Выводы
  • Глава 4. Проведение тестовых испытаний
    • 4.
    • 4.1. Особенности проведения тестовых испытаний
    • 4.1.1. Датасет
    • 4.1.2. Модели для машинно-ориентированной оптимизации
    • 4.1.3. Параметры обучения
    • 4.1.4. Условия тестирования
    • 4.2. Влияние параметров нейросетевого кодека на эффективность сжатия основного слоя
    • 4.2.1. Влияние размера GOP на эффективность сжатия
    • 4.2.2. Влияние модели для машинно-ориентированной оптимизации на эффективность сжатия
    • 4.2.3. Влияние весовых коэффициентов в функции потерь на эффективность сжатия
    • 4.3. Тестирование предложенной схемы кодирования
    • 4.3.1. Оценка эффективности сжатия для задачи детектирования
    • 4.3.2. Оценка эффективности сжатия для задачи распознавания
    • 4.3.3. Оценка скорости работы схемы и потребляемой памяти графического процессора
    • 4.3.4. Оценка визуального качества декодированного видео предложенной схемой
    • 4.4. Выводы
  • Заключение
  • Список использованных источников
    • Приложение 1
    • Приложение 2
    • Приложение 3
    • Приложение 4
...