Детальная информация
| Название | Обучение с подкреплением для настройки параметров разностной эволюции: выпускная квалификационная работа бакалавра: направление 01.03.02 «Прикладная математика и информатика» ; образовательная программа 01.03.02_04 «Биоинформатика» = Reinforcement Learning for Differential Evolution Parameter Tuning |
|---|---|
| Авторы | Данилова Арина Андреевна |
| Научный руководитель | Козлов Константин Николаевич |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Физико-механический институт |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | разностная эволюция ; deep ; обучение с подкреплением ; адаптивная настройка параметров ; глубокое q-обучение ; dqn ; ppo ; генная регуляторная сеть ; meyer model 1 ; differential evolution ; reinforcement learning ; adaptive parameter control ; deep q-learning ; gene regulatory network |
| Тип документа | Выпускная квалификационная работа бакалавра |
| Язык | Русский |
| Уровень высшего образования | Бакалавриат |
| Код специальности ФГОС | 01.03.02 |
| Группа специальностей ФГОС | 010000 - Математика и механика |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-3308 |
| Права доступа | Доступ по паролю из сети Интернет (чтение) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\41415 |
| Дата создания записи | 31.07.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет возможно после подготовки администраторами необходимых файлов
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
В работе решается задача адаптивной настройки управляющих параметров метода разностной эволюции DEEP. Эффективность данного метода существенно зависит от выбора коэффициента разности F, вероятности кроссовера CR, размера популяции NP и стратегии рекомбинации. Фиксированные значения параметров не всегда одинаково хорошо подходят для различных задач и этапов процесса оптимизации. Целью работы является разработка и исследование подхода, позволяющего динамически выбирать значения управляющих параметров на основе текущего состояния популяции с использованием методов обучения с подкреплением. Для решения поставленной задачи разработана модификация программной системы DEEP. В конвейер оптимизации добавлена новая стадия rlupdate, предназначенная для передачи статистик текущего состояния популяции RL-агенту и применения выбранного им действия. Реализована клиент-серверная архитектура: оптимизатор DEEP работает на языке C, а обучение агентов и выбор действий выполняются на отдельном Python-сервере. В качестве действий рассматриваются значения F и CR, изменение размера популяции NP и выбор стратегии рекомбинации. В ходе работы реализованы и исследованы три варианта RL-агента: классический DQN, DQN с раздельными выходами для компонент действия (MultiHead DQN) и алгоритм PPO. Для ускорения вычислительных экспериментов реализован режим прямого вызова целевой функции из динамической библиотеки .so без запуска отдельного Python-процесса при каждой оценке индивида. Это позволило сократить время выполнения одного эпизода приблизительно в 15 раз. Проведены вычислительные эксперименты на наборе стандартных синтетических тестовых функций, а также на прикладной задаче оценивания параметров динамической биологической модели Meyer Model 1. В данной задаче требуется подобрать 45 параметров модели генной регуляторной сети таким образом, чтобы рассчитанные траектории концентраций информационных РНК и белков соответствовали наблюдаемым данным. Поскольку каждое вычисление целевой функции требует численного решения системы обыкновенных дифференциальных уравнений, для проведения экспериментов дополнительно реализован сервер вычисления целевой функции. Эксперименты показали, что адаптивный выбор параметров с использованием обучения с подкреплением позволяет получать результаты, сопоставимые с результатами фиксированных конфигураций DEEP, а на ряде задач превосходить их. На синтетических тестовых функциях наиболее эффективным оказался агент PPO. На прикладной задаче Meyer Model 1 наиболее устойчивые результаты показал агент MultiHead DQN. Разработанная модификация может служить основой для дальнейшего исследования адаптивных методов управления параметрами разностной эволюции.
The study addresses adaptive control of the parameters of the DEEP differential evolution method. The efficiency of this method substantially depends on the selection of the differential weight F, crossover probability CR, population size NP, and recombination strategy. Fixed parameter values are not equally suitable for different problems and different stages of the optimization process. The aim of the work is to develop and investigate an approach that dynamically selects control parameters according to the current population state using reinforcement learning methods. To solve this problem, a modification of the DEEP software framework is developed. A new rlupdate stage is added to the optimization pipeline to transfer statistics describing the current population state to an RL agent and apply the selected action. A client-server architecture is implemented: the DEEP optimizer remains a C program, while agent training and action selection are performed by a separate Python server. The available actions include the values of F and CR, a change in the population size NP, and the selection of a recombination strategy. Three RL-agent variants are implemented and investigated: a conventional DQN, a DQN with separate output heads for the action components (MultiHead DQN), and PPO. To accelerate the computational experiments, a mode for direct evaluation of the objective function from a shared .so library is implemented. This avoids launching a separate Python process for every candidate evaluation and reduces the duration of a single episode by approximately a factor of 15. Computational experiments are conducted on a set of standard synthetic benchmark functions and on the applied problem of estimating the parameters of the Meyer Model 1 dynamic biological model. This problem requires fitting 45 parameters of a gene regulatory network model so that the simulated trajectories of messenger RNA and protein concentrations agree with the observed data. Since every objective-function evaluation requires the numerical solution of a system of ordinary differential equations, an additional objective-function evaluation server is implemented for the experiments. The experiments show that adaptive parameter selection using reinforcement learning provides results comparable to fixed DEEP configurations and outperforms them on several problems. PPO demonstrates the strongest performance on the synthetic benchmark functions. On the applied Meyer Model 1 problem, the MultiHead DQN agent provides the most stable results. The developed modification can serve as a basis for further investigation of adaptive parameter-control methods for differential evolution.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|