Details
| Title | Разработка многослойной схемы семантического кодирования видепотока: выпускная квалификационная работа магистра: направление 09.04.01 «Информатика и вычислительная техника» ; образовательная программа 09.04.01_15 «Технологии проектирования системного и прикладного программного обеспечения» = Development of a multilayer semantic coding scheme for video stream |
|---|---|
| Creators | Кобыжев Александр Михайлович |
| Scientific adviser | Болсуновская Марина Владимировна |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2024 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | кодирование видеопотока ; кодирование особенностей изображений ; глубокое обучение ; машинная аналитика ; кодирование видео для машин ; нейросетевые кодеки ; многослойные схемы кодирования ; video coding ; image feature coding ; deep learning ; machine analytics ; video coding for machines ; neural network codecs ; multilayer coding schemes |
| Document type | Master graduation qualification work |
| Language | Russian |
| Level of education | Master |
| Speciality code (FGOS) | 09.04.01 |
| Speciality group (FGOS) | 090000 - Информатика и вычислительная техника |
| DOI | 10.18720/SPBPU/3/2024/vr/vr24-3917 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Record key | ru\spstu\vkr\33136 |
| Record create date | 8/29/2024 |
Allowed Actions
–
Action 'Read' will be available if you login or access site from another network
Action 'Download' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
Данная работа посвящена реализации многослойной схемы семантического кодирования видеопотока для сцен дорожного видеонаблюдения, а также оценке эффективности её работы. Проведён анализ существующих подходов к сжатию изображений и видео, сформулированы требования к схеме кодирования для решения поставленной задачи. Представлено описание разработанной многослойной схемы кодирования видеопотока и функции потерь для обучения нейросетевого кодека. Также разработана программная реализация обучения нейросетевого кодека, предложенной схемы кодирования и тестирования кодеков для сжатия видео на языке Python. По результатам тестирования схемы кодирования даны оценки эффективности сжатия для задач детектирования и распознавания, а также выбраны оптимальные параметры нейросетевого кодека.
This work is devoted to the realization of a multilayer semantic coding scheme for video stream for road surveillance scenes, as well as to the evaluation of its efficiency. The existing approaches to image and video compression are analyzed, and the requirements to the coding scheme for solving the problem are formulated. The description of the developed multilayer video stream coding scheme and loss function for neural network codec training is presented. Also, the program realization of training of neural network codec, the proposed coding scheme and testing of codecs for video compression in Python language is developed. Based on the results of testing the coding scheme, the compression efficiency for detection and recognition tasks is evaluated, and the optimal parameters of the neural network codec are selected.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|
- Список обозначений и сокращений
- Введение
- Глава 1. Анализ предметной области
- 1.1. Описание предметной области, обоснование актуальности
- 1.2. Анализ существующих подходов к сжатию изображений и видео
- 1.3. Постановка задачи
- 1.4. Выводы
- Глава 2. Разработка многослойной схемы семантического кодирования видеопотока
- 2.
- 2.1. Предлагаемый подход эффективного сжатия видеоданных
- 2.1.1. Основной слой
- 2.1.2. Улучшающий слой
- 2.2. Выбор нейросетевого кодека для кодирования видео
- 2.2.1. SSF2020
- 2.2.2. DCVC-HEM
- 2.2.3. DCVC-DC
- 2.2.4. Сравнение и выбор нейросетевого кодека
- 2.3. Анализ методов оптимизации нейросетевого кодека
- 2.3.1. Анализ и выбор функции потерь для эффективного сжатия видео
- 2.3.2. Анализ моделей для извлечения особенностей изображений
- 2.4. Выводы
- Глава 3. Разработка программного средства
- 3.
- 3.1. Используемые технологии для разработки программного средства
- 3.2. Разработка программного средства обучения нейросетевого кодека
- 3.2.1. Пакет config
- 3.2.2. Пакет datasets
- 3.2.3. Пакет transforms
- 3.2.4. Пакет engine
- 3.2.5. Пакет model
- 3.2.6. Пакет solver
- 3.2.7. Пакет utils
- 3.2.8. Скрипты для обучения
- 3.2.9. Конфигурационный файл для обучения
- 3.2.10. Выходные файлы для Tensorboard
- 3.3. Программная реализация многослойной схемы семантического кодирования видеопотока
- 3.3.1. Структура программного средства
- 3.3.2. Конфигурационный файл для схемы кодирования
- 3.3.3. Структура выходных файлов
- 3.4. Разработка программного средства для тестирования кодеков для сжатия видео
- 3.4.1. Структура программы для кодирования и декодирования видео различными кодеками
- 3.4.2. Конфигурационный файл для кодирования видео различными кодеками
- 3.4.3. Структура программы для построения графиков
- 3.4.4. Конфигурационный файл для построения графиков
- 3.4.5. Выходные файлы в виде графиков
- 3.5. Выводы
- Глава 4. Проведение тестовых испытаний
- 4.
- 4.1. Особенности проведения тестовых испытаний
- 4.1.1. Датасет
- 4.1.2. Модели для машинно-ориентированной оптимизации
- 4.1.3. Параметры обучения
- 4.1.4. Условия тестирования
- 4.2. Влияние параметров нейросетевого кодека на эффективность сжатия основного слоя
- 4.2.1. Влияние размера GOP на эффективность сжатия
- 4.2.2. Влияние модели для машинно-ориентированной оптимизации на эффективность сжатия
- 4.2.3. Влияние весовых коэффициентов в функции потерь на эффективность сжатия
- 4.3. Тестирование предложенной схемы кодирования
- 4.3.1. Оценка эффективности сжатия для задачи детектирования
- 4.3.2. Оценка эффективности сжатия для задачи распознавания
- 4.3.3. Оценка скорости работы схемы и потребляемой памяти графического процессора
- 4.3.4. Оценка визуального качества декодированного видео предложенной схемой
- 4.4. Выводы
- Заключение
- Список использованных источников
- Приложение 1
- Приложение 2
- Приложение 3
- Приложение 4