Details
| Title | Исследование и проектирование DevOps-инфраструктуры для развертывания RL-сервисов в интеллектуальных транспортных системах: выпускная квалификационная работа магистра: направление 27.04.04 «Управление в технических системах» ; образовательная программа 27.04.04_08 «Киберфизические системы и технологии» = Study and design of a DevOps infrastructure for deploying RL services in intelligent transportation systems |
|---|---|
| Creators | Безверхий Константин Андреевич |
| Scientific adviser | Потехин Вячеслав Витальевич |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | интеллектуальные транспортные системы ; обучение с подкреплением ; MLOps ; DevOps-инфраструктура ; микросервисная архитектура ; управление светофорными объектами ; Kubernetes ; Sumo ; intelligent transportation systems ; reinforcement learning ; DevOps infrastructure ; microservice architecture ; traffic signal control |
| Document type | Master graduation qualification work |
| Language | Russian |
| Level of education | Master |
| Speciality code (FGOS) | 27.04.04 |
| Speciality group (FGOS) | 270000 - Управление в технических системах |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-4954 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\44747 |
| Record create date | 9/4/2026 |
Allowed Actions
–
Action 'Read' will be available if administrator prepare required files
Action 'Download' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
Данная работа посвящена устранению инфраструктурного пробела между академическими разработками в области обучения с подкреплением и их промышленным внедрением в задачах управления светофорными объектами. Задачи, которые решались в ходе исследования: 1. Системный анализ предметной области и существующих MLOps-практик. 2. Сравнительное исследование архитектурных подходов к развёртыванию RL-сервисов. 3. Формулирование требований к DevOps-инфраструктуре и обоснование технологического стека. 4. Проектирование общей архитектуры системы и её подсистем. 5. Реализация прототипа и экспериментальная верификация архитектурных механизмов. 6. Оценка экономической целесообразности внедрения. На основании сравнения архитектурных подходов по восьми критериям, специфичным для интеллектуальных транспортных систем, обоснован выбор микросервисной архитектуры. Спроектированная DevOps-инфраструктура объединяет пять подсистем, обеспечивающих полный жизненный цикл RL-модели – от обучения в симуляторе до развёртывания на инференс и непрерывного дообучения. Прототип реализован на одноузловом сервере под управлением K3s с симуляционной средой SUMO; контур обучения построен на алгоритме PPO и библиотеке Stable-Baselines3, инференс реализован на FastAPI. Работоспособность ключевых механизмов подтверждена в шести экспериментальных сценариях. Выполнена оценка экономической целесообразности внедрения предложенной инфраструктуры, показавшая её применимость в условиях крупного мегаполиса.
This work is dedicated to bridging the infrastructure gap between academic research in reinforcement learning and its industrial deployment in traffic signal control tasks. The objectives addressed in the course of the research: 1. Systematic analysis of the subject area and existing MLOps practices. 2. Comparative study of architectural approaches to RL-service deployment. 3. Formulation of requirements for the DevOps infrastructure and justification of the technology stack. 4. Design of the overall system architecture and its subsystems. 5. Implementation of a prototype and experimental verification of architectural mechanisms. 6. Assessment of the economic feasibility of the proposed solution. Based on the comparison of architectural approaches against eight criteria specific to intelligent transportation systems, the microservice architecture was substantiated as the optimal solution. The designed DevOps infrastructure integrates five subsystems that support the complete life cycle of an RL model – from training in a simulator to inference deployment and continuous learning. The prototype was implemented on a single-node server Running K3s with the SUMO simulation environment; the training pipeline is built on the PPO algorithm and the Stable-Baselines3 library, while inference is implemented in FastAPI. The performance of the key mechanisms was confirmed in six experimental scenarios. An assessment of the economic feasibility of the proposed infrastructure was carried out, demonstrating its applicability in the context of a large metropolitan area.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|