Details
| Title | Модели машинного обучения для прогноза времени выполнения задач в центре коллективного пользования СКЦ Политехнический: выпускная квалификационная работа магистра: направление 02.04.03 «Математическое обеспечение и администрирование информационных систем» ; образовательная программа 02.04.03_01 «Разработка и математическое обеспечение интеллектуальных информационных систем» = Machine learning models for predicting task completion times at the SCC Polytechnic shared use center |
|---|---|
| Creators | Забирова Адель Ринатовна |
| Scientific adviser | Заборовский Владимир Сергеевич |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | анализ выживаемости ; случайный лес выживаемости ; модель Кокса ; иерархическая кластеризация ; HDBSCAN ; расстояние Махаланобиса ; прогнозирование времени выполнения ; суперкомпьютерный центр ; цензурированные данные ; survival analysis ; random survival forest ; Сox model ; hierarchical clustering ; Mahalanobis distance ; runtime prediction ; supercomputer center ; censored data |
| Document type | Master graduation qualification work |
| Language | Russian |
| Level of education | Master |
| Speciality code (FGOS) | 02.04.03 |
| Speciality group (FGOS) | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-5490 |
| Rights | Доступ по паролю из сети Интернет (чтение) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\45165 |
| Record create date | 9/4/2026 |
Allowed Actions
–
Action 'Read' will be available if administrator prepare required files
| Group | Anonymous |
|---|---|
| Network | Internet |
Объектом исследования являются модели диспетчеризации ресурсов высокопроизводительного вычислителя суперкомпьютерного центра «Политехнический». Целью работы являлась разработка и программная реализация гибридной модели прогнозирования времени выполнения прикладных задач в суперкомпьютерном центре коллективного пользования на основе методов анализа выживаемости, иерархической кластеризации и адаптивного ансамблирования. В процессе исследования выполнена обработка и анализ логов планировщика SLURM суперкомпьютерного центра «Политехнический» за период с июня по ноябрь 2022 года (общий объём – 1 013 697 записей). Проведён обзор и сравнительный анализ существующих методов прогнозирования времени выполнения задач, включая классические эвристики, регрессионные модели, методы анализа выживаемости (модель Кокса, случайный лес выживаемости RSF, глубокий лес выживаемости), а также подходы на основе трансформеров и механизмов внимания. Выявлены преимущества и ограничения каждого подхода, обоснован выбор гибридной архитектуры. Разработана математическая модель, включающая двухуровневую иерархическую кластеризацию с применением HDBSCAN (12 аппаратных и 61 поведенческий кластер на ограниченном наборе), метод главных компонент для устранения мультиколлинеарности (снижение числа обусловленности ковариационной матрицы с 2,5×10¹³ до 6,1), расстояние Махаланобиса для вычисления весов близости кластеров. Предложена обобщённая модель выживания как взвешенное суммирование логарифмов функций выживания кластер-специфичных моделей – модификация модели Кокса, адаптированная к гетерогенным данным. Реализован программный комплекс на языке Python с использованием библиотек scikit-learn, lifelines, scikit-survival, hdbscan, PySpark. Разработан конвейер предобработки данных (фильтрация, парсинг временных форматов, конструирование признакового пространства из 7 признаков). Реализована трёхуровневая система стратегий прогнозирования: эмпирические квантили (для кластеров с долей цензуры менее 1%), модель Кокса с откатом на RSF (при 1–5% цензуры), глобальная модель Кокса для длинных задач (медиана > 10 часов). Гибридная модель (V7) адаптивно выбирает стратегию для каждого из 94 кластеров. Экспериментальное тестирование проведено на полном наборе данных (892 400 задач после фильтрации). Внедрение гибридной модели позволило сократить долю задач, снимаемых по тайм-ауту, с 4,7% до 1,9% – относительное снижение на 59,6%. На полном наборе дополнительно 24 900 задач завершаются успешно, потери процессорного времени сокращены на 667 000 процессоро-часов (78,9%). Для наиболее проблемной категории длинных задач доля снимаемых задач сокращена с 31,2% до 11,8% (снижение на 62,2%). Достигнута общая успешность прогноза 95,2%, успешность прогноза для длинных задач – 74,3%, что в 2,4 раза выше пользовательского уровня. Время обучения на полном наборе составило 512 секунд, что соответствует критерию успешности (менее 600 секунд). Результаты работы могут быть использованы в системах планирования задач суперкомпьютерных центров коллективного пользования, а также в любых высокопроизводительных вычислительных системах, где требуется прогнозирование времени выполнения задач с учётом цензурированных наблюдений.
The subject of the research is resource scheduling models of the high-performance computing system of the Polytechnic Supercomputer Center. The purpose of the work is to develop and implement a hybrid model for predicting the runtime of application tasks in a shared-use supercomputer center based on survival analysis methods, hierarchical clustering, and adaptive ensembling. During the research, processing and analysis of SLURM scheduler logs of the Polytechnic Supercomputer Center for the period from June to November 2022 (total volume of 1,013,697 records) was performed. A review and comparative analysis of existing methods for predicting task runtime was conducted, including classical heuristics, regression models, survival analysis methods (Cox model, Random Survival Forest, Deep Survival Forest), as well as approaches based on transformers and attention mechanisms. The advantages and limitations of each approach are identified, and the choice of hybrid architecture is justified. A mathematical model is developed, including two-level hierarchical HDBSCAN clustering (12 hardware clusters and 61 behavioral clusters), principal component analysis for multicollinearity elimination (condition number reduction from 2.5×10¹³ to 6.1), Mahalanobis distance for cluster proximity weight calculation. A generalized survival model is proposed as a weighted summation of logarithms of cluster-specific survival functions – a modification of the Cox model adapted to heterogeneous data. A software package is implemented in Python using scikit-learn, lifelines, scikit-survival, hdbscan, and PySpark libraries. A data preprocessing pipeline is developed (filtering, time format parsing, feature engineering with 7 features). A three-level prediction strategy system is implemented: empirical quantiles (for clusters with censoring rate less than 1%), Cox model with fallback to RSF (for 1–5% censoring), global Cox model for long jobs (median > 10 hours). The hybrid model (V7) adaptively selects the strategy for each of the 94 clusters. Experimental testing was conducted on the full dataset (892,400 tasks after filtering). Implementation of the hybrid model reduced the share of tasks terminated by timeout from 4.7% to 1.9% – a relative reduction of 59.6%. On the full dataset, an additional 24,900 tasks complete successfully, CPU time losses are reduced by 667,000 core-hours (78.9%). For the most problematic category of long tasks, the share of terminated tasks is reduced from 31.2% to 11.8% (a reduction of 62.2%). Overall prediction success reached 95.2%, prediction success for long tasks – 74.3%, which is 2.4 times higher than the user level. Training time on the full dataset was 512 seconds, meeting the success criterion (less than 600 seconds). The results of the work can be used in job scheduling systems of shared-use supercomputer centers, as well as in any high-performance computing systems requiring runtime prediction with censored observations.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|