Details

Title Исследование и проектирование DevOps-инфраструктуры для развертывания RL-сервисов в интеллектуальных транспортных системах: выпускная квалификационная работа магистра: направление 27.04.04 «Управление в технических системах» ; образовательная программа 27.04.04_08 «Киберфизические системы и технологии» = Study and design of a DevOps infrastructure for deploying RL services in intelligent transportation systems
Creators Безверхий Константин Андреевич
Scientific adviser Потехин Вячеслав Витальевич
Organization Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects интеллектуальные транспортные системы ; обучение с подкреплением ; MLOps ; DevOps-инфраструктура ; микросервисная архитектура ; управление светофорными объектами ; Kubernetes ; Sumo ; intelligent transportation systems ; reinforcement learning ; DevOps infrastructure ; microservice architecture ; traffic signal control
Document type Master graduation qualification work
Language Russian
Level of education Master
Speciality code (FGOS) 27.04.04
Speciality group (FGOS) 270000 - Управление в технических системах
DOI 10.18720/SPBPU/3/2026/vr/vr26-4954
Rights Доступ по паролю из сети Интернет (чтение, печать, копирование)
Additionally New arrival
Record key ru\spstu\vkr\44747
Record create date 9/4/2026

Allowed Actions

Action 'Read' will be available if administrator prepare required files

Action 'Download' will be available if you login or access site from another network

Group Anonymous
Network Internet

Данная работа посвящена устранению инфраструктурного пробела между академическими разработками в области обучения с подкреплением и их промышленным внедрением в задачах управления светофорными объектами. Задачи, которые решались в ходе исследования: 1. Системный анализ предметной области и существующих MLOps-практик. 2. Сравнительное исследование архитектурных подходов к развёртыванию RL-сервисов. 3. Формулирование требований к DevOps-инфраструктуре и обоснование технологического стека. 4. Проектирование общей архитектуры системы и её подсистем. 5. Реализация прототипа и экспериментальная верификация архитектурных механизмов. 6. Оценка экономической целесообразности внедрения. На основании сравнения архитектурных подходов по восьми критериям, специфичным для интеллектуальных транспортных систем, обоснован выбор микросервисной архитектуры. Спроектированная DevOps-инфраструктура объединяет пять подсистем, обеспечивающих полный жизненный цикл RL-модели – от обучения в симуляторе до развёртывания на инференс и непрерывного дообучения. Прототип реализован на одноузловом сервере под управлением K3s с симуляционной средой SUMO; контур обучения построен на алгоритме PPO и библиотеке Stable-Baselines3, инференс реализован на FastAPI. Работоспособность ключевых механизмов подтверждена в шести экспериментальных сценариях. Выполнена оценка экономической целесообразности внедрения предложенной инфраструктуры, показавшая её применимость в условиях крупного мегаполиса.

This work is dedicated to bridging the infrastructure gap between academic research in reinforcement learning and its industrial deployment in traffic signal control tasks. The objectives addressed in the course of the research: 1. Systematic analysis of the subject area and existing MLOps practices. 2. Comparative study of architectural approaches to RL-service deployment. 3. Formulation of requirements for the DevOps infrastructure and justification of the technology stack. 4. Design of the overall system architecture and its subsystems. 5. Implementation of a prototype and experimental verification of architectural mechanisms. 6. Assessment of the economic feasibility of the proposed solution. Based on the comparison of architectural approaches against eight criteria specific to intelligent transportation systems, the microservice architecture was substantiated as the optimal solution. The designed DevOps infrastructure integrates five subsystems that support the complete life cycle of an RL model – from training in a simulator to inference deployment and continuous learning. The prototype was implemented on a single-node server Running K3s with the SUMO simulation environment; the training pipeline is built on the PPO algorithm and the Stable-Baselines3 library, while inference is implemented in FastAPI. The performance of the key mechanisms was confirmed in six experimental scenarios. An assessment of the economic feasibility of the proposed infrastructure was carried out, demonstrating its applicability in the context of a large metropolitan area.

Network User group Action
ILC SPbPU Local Network All
Download
Internet Authorized users SPbPU
Download
Internet Anonymous
...