Details
| Title | Метод автоматического обнаружения и классификации вредоносного программного обеспечения с применением машинного обучения и алгоритма хеширования TLSH: выпускная квалификационная работа магистра: направление 02.04.03 «Математическое обеспечение и администрирование информационных систем» ; образовательная программа 02.04.03_01 «Разработка и математическое обеспечение интеллектуальных информационных систем» = A method for automatic detection and classification of malicious software using machine learning and the TLSH hashing algorithm |
|---|---|
| Creators | Царев Михаил Евгеньевич |
| Scientific adviser | Пак Вадим Геннадьевич |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | машинное обучение ; TLSH ; обнаружение вредоносного программного обеспечения ; нечёткое хеширование ; модификация k-NN ; метрика Минковского ; machine learning ; malware detection ; fuzzy hashing ; k-NN modification ; Minkowski metric |
| Document type | Master graduation qualification work |
| Language | Russian |
| Level of education | Master |
| Speciality code (FGOS) | 02.04.03 |
| Speciality group (FGOS) | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-4336 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\44707 |
| Record create date | 9/4/2026 |
Allowed Actions
–
Action 'Read' will be available if you login or access site from another network
Action 'Download' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
Актуальность темы исследования обусловлена стремительной эволюцией угроз информационной безопасности, характеризующейся ростом количества полиморфных и метаморфных вредоносных образцов. Традиционные сигнатурные методы детектирования, опирающиеся на точное совпадение криптографических хеш-сумм, демонстрируют критическую неэффективность в условиях незначительных модификаций бинарного кода. В связи с этим возникает острая необходимость в разработке адаптивных подходов к анализу исполняемых файлов, способных оценивать структурное сходство образцов и обеспечивать высокую надёжность классификации. Целью данной выпускной квалификационной работы является разработка и экспериментальная апробация модифицированного алгоритма классификации исполняемых файлов на основе нечёткого хеширования TLSH и метода k-ближайших соседей с динамически обучаемыми весами признаков. Для преодоления ограничений работы со строковыми хеш-суммами предложен подход к векторизации данных через построение матрицы расстояний до фиксированного набора “якорных” образцов. В архитектуру классификатора интегрирован механизм обучения весов признаков на основе градиентной оптимизации и контрастивной функции потерь, направленной на максимизацию межклассовой дистанции в признаковом пространстве. Дополнительно исследовано влияние параметра степени метрики Минковского на устойчивость модели к эффекту разреженности данных и качеству разделения классов. В ходе экспериментальной части проведено многократное тестирование на сбалансированном датасете. Выполнено сравнение разработанной модификации Attention-kNN с классическими алгоритмами: Random Forest, стандартным и взвешенным k-NN, SVM, логистической регрессией и MLP. Результаты демонстрируют, что предложенный алгоритм достигает общей точности классификации на уровне сопоставимом с ансамблевым методом Random Forest, однако обеспечивает статистически значимое снижение количества ложно-отрицательных срабатываний по сравнению с базовыми моделями. Практическая значимость работы заключается в создании работоспособного прототипа классификатора, пригодного для интеграции в многоуровневые контуры защиты в качестве модуля первичной проверки файловых объектов. Ключевым преимуществом алгоритма является сохранение интерпретируемости за счёт анализа обученных весов якорных образцов, позволяющего выявлять наиболее репрезентативные структурные паттерны вредоносного ПО. Результаты исследования формируют методологическую основу для дальнейшего развития гибридных систем детектирования угроз, сочетающих метрические методы машинного обучения с требованиями к скорости обработки, масштабируемости и минимизации рисков информационной безопасности.
The relevance of the research topic is due to the rapid evolution of information security threats, characterized by an increasing number of polymorphic and metamorphic malware samples. Traditional signature detection methods based on an exact match of cryptographic hash amounts demonstrate critical inefficiency in the context of minor modifications of the binary code. In this regard, there is an urgent need to develop adaptive approaches to analyzing executable files that can assess the structural similarity of samples and ensure high classification reliability. The purpose of this final thesis is to develop and experimentally test a modified algorithm for classifying executable files based on TLSH fuzzy hashing and the k-nearest neighbor method with dynamically trained feature weights. To overcome the limitations of working with string hash sums, an approach to data vectorization is proposed by constructing a matrix of distances to a fixed set of "anchor" samples. The classifier architecture integrates a mechanism for learning feature weights based on gradient optimization and a contrastive loss function aimed at maximizing the interclass distance in the feature space. Additionally, the influence of the degree parameter of the Minkowski metric on the stability of the model to the effect of sparsity of data and the quality of class separation is investigated. During the experimental part, multiple tests were carried out on a balanced dataset. The developed Attention-kNN modification is compared with classical algorithms: Random Forest, standard and weighted k-NN, SVM, logistic regression and MLP. The results demonstrate that the proposed algorithm achieves overall classification accuracy at a level comparable to the Random Forest ensemble method, but provides a statistically significant reduction in the number of false-negative positives compared to the basic models. The practical significance of the work lies in the creation of a workable prototype classifier suitable for integration into multi-level protection circuits as a module for primary verification of file objects. The key advantage of the algorithm is to preserve interpretability by analyzing the trained weights of anchor samples, which makes it possible to identify the most representative structural patterns of malware. The research results form a methodological basis for the further development of hybrid threat detection systems that combine metric machine learning methods with requirements for processing speed, scalability, and minimizing information security risks.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|
- РЕФЕРАТ
- ABSTRACT
- СОДЕРЖАНИЕ
- ВВЕДЕНИЕ
- ГЛАВА 1. ИССЛЕДОВАНИЕ ПРИМЕНЕНИЯ ML В ОБЛАСТИ ИНФОРМАЦИОННОЙ БЕЗОПАСНОСТИ
- 1.1. Виды вредоносного программного обеспечения
- 1.2. Содержание исполняемых файлов
- 1.3. Способы выявления и распознавания вредоносного программного обеспечения
- 1.4. Четкие алгоритмы хэширования
- 1.5. Нечеткие алгоритмы хэширования
- 1.6. Выводы
- ГЛАВА 2. РАЗРАБОТКА АЛГОРИТМА КЛАССИФИКАЦИИ ИСПОЛНЯЕМЫХ ФАЙЛОВ
- 2.1. Требования к разрабатываемой системе
- 2.2. Создание собственного набора данных
- 2.3. Алгоритм обработки данных и формирование векторов признаков
- 2.4. Выбор модели машинного обучения
- 2.5. Алгоритм работы разрабатываемой модификации
- 2.6. Методология использования разрабатываемого алгоритма
- 2.7. Выводы
- ГЛАВА 3. ПРОГРАММНАЯ РЕАЛИЗАЦИЯ МОДИФИКАЦИИ АЛГОРИТМА МАШИННОГО ОБУЧЕНИЯ
- 3.1. Выбор языка программирования и инструментов
- 3.2. Принцип работы расстояний TLSH хеш-сумм
- 3.3. Теоретическое обоснование и визуализация работы алгоритма векторизации
- 3.4. Выбор оптимальной размерности вектора признаков
- 3.5. Реализация модификации алгоритма машинного обучения k-NN
- 3.6. Влияние различных метрик расстояний на качество классификации
- 3.7. Выводы
- ГЛАВА 4. ТЕСТИРОВАНИЕ И АПРОБАЦИЯ РАЗРАБОТАННОЙ МОДИФИКАЦИИ В СРАВНЕНИИ С КЛАССИЧЕСКИМИ МОДЕЛЯМИ
- 4.1. Данные для тестирования
- 4.2. Сравнение классических моделей при различных значениях параметра метрики минковского
- 4.3. Сравнение модифицированных моделей при различных гиперпараметрах
- 4.4. Сравнительное тестирование
- 4.5. Выводы
- ЗАКЛЮЧЕНИЕ
- СПИСОК ИСПОЛЬЗОВАННЫХ ИСТОЧНИКОВ
- Приложение 1
- Класс реализация модифицированной k-NN
- Приложение 2
- Код проведения многократного тестирования