Details
| Title | Моделирование офлайн-последовательного принятия решений для мета-оптимизации чёрного ящика на основе усиленного консервативного Q-обучения: выпускная квалификационная работа магистра: направление 09.04.03 «Прикладная информатика» ; образовательная программа 09.04.03_04 «Интеллектуальные технологии управления знаниями и данными» = Modeling offline sequential decision making for black-box meta-optimization based on reinforced conservative Q-learning |
|---|---|
| Creators | Цай Цзяцзюнь |
| Scientific adviser | Хитров Егор Германович |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | офлайн-обучение с подкреплением ; консервативное Q-обучение ; модель пространства состояний Mamba ; адаптация гиперпараметров ; оптимизация чёрного ящика ; offline reinforcement learning ; conservative Q-learning ; mamba state space model ; hyperparameter self-adaptation ; black-box optimization |
| Document type | Master graduation qualification work |
| Language | Russian |
| Level of education | Master |
| Speciality code (FGOS) | 09.04.03 |
| Speciality group (FGOS) | 090000 - Информатика и вычислительная техника |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-5796 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\45185 |
| Record create date | 9/4/2026 |
Allowed Actions
–
Action 'Read' will be available if administrator prepare required files
| Group | Anonymous |
|---|---|
| Network | Internet |
Объект: процесс управления гиперпараметрами дифференциальной эволюции в задачах оптимизации чёрного ящика. Предмет: методы и алгоритмы офлайн-обучения с подкреплением на основе моделей пространства состояний для адаптивного управления параметрами эволюционных алгоритмов. Методы и методология проведения ВКР: методы дифференциальной эволюции; офлайн-обучение с подкреплением; консервативное Q-обучение (CQL); модели пространства состояний (Mamba); метод Монте-Карло Dropout; двухбазисное экспоненциальное скользящее среднее (EMA); бенчмаркинг BBOB; язык Python, PyTorch. В связи с высокой вычислительной стоимостью целевой функции и отсутствием аналитического дифференцирования в задачах оптимизации чёрного ящика в настоящей работе предлагается фреймворк адаптивного управления гиперпараметрами Q‑Mamba, основанный на моделях пространства состояний и офлайн-обучении с подкреплением. В рамках фреймворка задача управления гиперпараметрами дифференциальной эволюции формулируется как задача офлайн-метаобучения с подкреплением: в качестве магистральной сети используется селективная модель пространства состояний Mamba, обеспечивающая моделирование зависимостей в длинных оптимизационных траекториях с линейной вычислительной сложностью. Для решения характерных для офлайн-обучения проблем смещения распределения и завышения оценок Q-функции разработан алгоритм адаптивного консервативного Q-обучения Adaptive CQL с двухбазисной экспоненциальной скользящей средней. В алгоритме задействована оценка неопределённости методом Монте-Карло Dropout, что позволяет динамически регулировать коэффициент консервативной регуляризации λ, реализуя принцип «разумной осторожности»: поддержание высокой консервативности в областях с разреженными данными и ослабление ограничений в областях с высокой плотностью данных для усиления исследовательской способности стратегии. Эксперименты на эталонных функциях BBOB и синтетических задачах нейроэволюции показали, что по сравнению со стандартным CQL алгоритм Adaptive CQL позволяет снизить потери при обучении до 8,4% в низкоразмерном пространстве действий (K=3) и повысить производительность на задачах вне распределения до 118,4%. При этом оптимальная конфигурация Alg1_ACQL (K=10) достигла нормированной производительности 0,8546 при zero-shot переносе. Экспериментально также установлено, что при чрезмерно высокой размерности пространства действий (K=16) адаптивный механизм проявляет тенденцию к вырождению, что указывает на существование оптимальной размерности действий. Результаты исследования предоставляют интерпретируемое, пригодное для повторного использования и робастное интеллектуальное решение для дорогостоящей оптимизации чёрного ящика.
Object: process of hyperparameter control of differential evolution in black-box optimization problems. Subject: methods and algorithms of offline reinforcement learning based on state-space models for adaptive parameter control of evolutionary algorithms. Methods and methodology of the thesis: differential evolution methods; offline reinforcement learning; conservative Q-learning (CQL); state-space models (Mamba); Monte Carlo Dropout method; dual-baseline exponential moving average (EMA); BBOB benchmarking; Python language, PyTorch. Due to the high computational cost of the objective function and the absence of analytical differentiation in black-box optimization problems, this work proposes a framework for adaptive hyperparameter control Q-Mamba, based on state-space models and offline reinforcement learning. Within the framework, the problem of controlling differential evolution hyperparameters is formulated as an offline meta-reinforcement learning problem: the selective state-space model Mamba is used as a backbone network, providing modeling of dependencies in long optimization trajectories with linear computational complexity. To address the problems typical of offline learning, namely distribution shift and overestimation of Q-function values, an adaptive conservative Q-learning algorithm Adaptive CQL with a dual-baseline exponential moving average is developed. The algorithm employs uncertainty estimation via Monte Carlo Dropout, which allows dynamic adjustment of the conservative regularization coefficient λ, implementing the principle of ``reasonable caution: maintaining high conservativeness in data-sparse regions and relaxing constraints in data-dense regions to enhance the strategys exploration capability. Experiments on BBOB benchmark functions and synthetic neuroevolution tasks showed that compared to standard CQL, the Adaptive CQL algorithm reduces training loss by up to 8.4% in low-dimensional action spaces (K=3) and improves performance on out-of-distribution tasks by up to 118.4%. At the same time, the optimal configuration Alg1_ACQL (K=10) achieved a normalized performance of 0.8546 in zero-shot transfer. It was also experimentally found that with an excessively high action space dimensionality (K=16), the adaptive mechanism tends to degenerate, indicating the existence of an optimal action dimensionality. The research results provide an interpretable, reusable, and robust intelligent solution for expensive black-box optimization.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|