Details
| Title | Исследование алгоритма автоматического принятия решения об обгоне на основе улучшенного иерархического обучения с подкреплением: выпускная квалификационная работа магистра: направление 09.04.01 «Информатика и вычислительная техника» ; образовательная программа 09.04.01_17 «Интеллектуальные системы (международная образовательная программа) / Intelligent Systems (International Educational Program)» = Research on Automatic Overtaking Decision Algorithm based on Improved Hierarchical Reinforcement Learning |
|---|---|
| Creators | Чжоу Шэнтэн |
| Scientific adviser | Кожубаев Юрий Нургалиевич |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | автономное вождение ; принятие решений об обгоне ; иерархическое обучение с подкреплением ; динамическая зона безопасности ; обучение по учебной программе ; autonomous driving ; overtaking decision ; hierarchical reinforcement learning ; dynamic safety zone ; curriculum learning |
| Document type | Master graduation qualification work |
| Language | Russian |
| Level of education | Master |
| Speciality code (FGOS) | 09.04.01 |
| Speciality group (FGOS) | 090000 - Информатика и вычислительная техника |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-5610 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\44850 |
| Record create date | 9/4/2026 |
Allowed Actions
–
Action 'Read' will be available if administrator prepare required files
Action 'Download' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
Цель – разработка безопасной и эффективной модели принятия решений об обгоне для автономных автомобилей в многополосном смешанном движении. Предмет – современные автоматизированные методы принятия решений для автономного вождения на основе иерархического обучения с подкреплением. Задачи: 1. Изучить архитектуру систем принятия решений об обгоне. 2. Проанализировать исследования по обучению с подкреплением и иерархическому RL. 3. Разработать метод обгона на основе иерархического SAC со вспомогательной V-функцией (HAV-SAC) 4. Реализовать программно верхний и нижний уровни, модуль переключения стратегий и динамическую зону безопасности. 5.Оценить эффективность, безопасность и робастность в имитационном моделировании. Результаты – разработана модель HAV-SAC для оптимального обгона в сложных многополосных средах. Модель показывает удовлетворительную частоту обгона (80.52%), среднюю скорость (53.69 км/ч) и безопасность (0.14 столкновений за эпизод). Динамическая зона безопасности снижает частоту столкновений до 0.011. Вывод: иерархическое RL с обновлением нижнего уровня по вспомогательной V-функции и динамическим вмешательством значительно улучшает эффективность и безопасность обгона.
The purpose of the study is to develop a safe and efficient overtaking decision model for autonomous vehicles in multi-lane mixed traffic. The subject of the work is modern automated decision-making methods for autonomous driving based on hierarchical reinforcement learning. The research set the following goals: 1. Studying autonomous overtaking decision system architecture. 2. Analyzing reinforcement learning and hierarchical RL algorithms for autonomous driving. 3. Developing an overtaking decision method based on hierarchical SAC with auxiliary V-value function (HAV-SAC). 4. Software implementation including upper/lower networks, policy switching, and dynamic safety zone. 5. Assessing overtaking performance, safety, and robustness via simulation. The work resulted in a tool (HAV-SAC) for optimal overtaking decisions in complex multi-lane environments. The tool shows satisfactory overtaking rate (80.52%), average speed (53.69 km/h), and safety (0.14 ollisions/episode). Dynamic safety zone further reduces collisions to 0.011/episode. The study concludes that hierarchical RL with auxiliary V-value updates and dynamic safety intervention significantly improves overtaking performance and safety. The results can be used as a base for designing intelligent decision-making for autonomous vehicles, especially safe overtaking in mixed traffic.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|