Details
| Title | Разработка и реализация алгоритмов повышения точности семантического поиска в области кибербезопасности с применением моделей реранжирования: выпускная квалификационная работа бакалавра: направление 02.03.01 «Математика и компьютерные науки» ; образовательная программа 02.03.01_01 «Системы искусственного интеллекта и суперкомпьютерные технологии» = Development and implementation of algorithms to enhance semantic search accuracy in the cybersecurity domain using reranking models |
|---|---|
| Creators | Астафьев Игорь Евгеньевич |
| Scientific adviser | Лукашин Алексей Андреевич |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | семантический поиск ; кибербезопасность ; реранжирование ; cross-encoder ; bi-encoder ; transformer ; векторный поиск ; rag ; learning to rank ; semantic search ; cybersecurity ; reranking ; vector search |
| Document type | Bachelor graduation qualification work |
| Language | Russian |
| Level of education | Bachelor |
| Speciality code (FGOS) | 02.03.01 |
| Speciality group (FGOS) | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-2580 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\42751 |
| Record create date | 8/21/2026 |
Allowed Actions
–
Action 'Read' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
Работа посвящена разработке и реализации алгоритма повышения точности семантического поиска в области кибербезопасности с использованием моделей реранжирования. Актуальность исследования обусловлена ростом объемов данных по информационной безопасности и необходимостью повышения качества поиска релевантных документов в профессиональных базах знаний. Целью работы является разработка и экспериментальная оценка алгоритма семантического поиска, обеспечивающего повышение качества ранжирования документов за счет применения дообученной модели реранжирования. Для достижения поставленной цели выполнен анализ современных подходов информационного и семантического поиска, методов обучения моделей представления текста, алгоритмов ранжирования и архитектур Retrieval-Augmented Generation. В ходе работы выполнен сбор и объединение наборов данных по кибербезопасности с их последующим дополнением. Разработан двухэтапный алгоритм, включающий поиск кандидатов по эмбеддингам документов и последующее реранжирование найденных результатов. Проведено экспериментальное исследование качества поиска для различных комбинаций bi-encoder и cross-encoder моделей. Полученные результаты показали, что применение дообученной модели реранжирования позволяет повысить значение метрики MRR@15 на 12,9% по сравнению с базовым семантическим поиском без реранжирования при сохранении приемлемого времени обработки запросов. Практическая значимость работы заключается в возможности использования разработанного алгоритма в поисковых системах и RAG-приложениях, ориентированных на обработку специализированной информации в области кибербезопасности.
This thesis is devoted to the development and implementation of an algorithm for improving semantic search accuracy in the cybersecurity domain using reranking models. The relevance of the research is determined by the growing amount of cybersecurity information and the increasing demand for accurate retrieval of relevant documents from specialized knowledge bases. The objective of the work is to develop and experimentally evaluate a semantic search algorithm that improves ranking quality through the use of a fine-tuned reranking model. To achieve this objective, modern approaches to information retrieval, semantic search, text representation learning, ranking algorithms, and Retrieval-Augmented Generation architectures were analyzed. The work involved collecting and merging cybersecurity datasets, followed by their augmentation. A two-stage semantic search algorithm was developed. At the first stage, candidate documents are retrieved using dense vector representations. At the second stage, the retrieved candidates are reranked using a cross-encoder model. An extensive experimental evaluation was conducted for different combinations of bi-encoder and reranking models. The experimental results demonstrate that the proposed approach significantly improves search quality. The best configuration achieved a 12.9% improvement in MRR@15 compared to the baseline semantic search system without reranking while maintaining low query processing latency. The practical value of the work lies in the possibility of applying the proposed algorithm in cybersecurity search systems and Retrieval-Augmented Generation applications requiring accurate retrieval of domain-specific information.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|
- Список сокращений и обозначений
- Введение
- Анализ подходов в семантическом поиске и ранжировании
- Классические подходы информационного поиска
- Подходы семантического поиска
- Сравнение плотных методов
- Обучение трансформерных моделей
- Меры близости
- Ранжирование в поиске
- RAG-система
- Вывод к главе
- Формальная постановка задачи
- Разработка алгоритма
- Общее описание алгоритма
- Получение данных для дообучения
- Обучение моделей реранжирования
- Итоговый вариант алгоритма
- Вывод к главе
- Экспериментальное исследование и оценка алгоритма повышения точности семантического поиска на основе моделей реранжирования
- Сравнение bi-encoder моделей
- Сравнение моделей реранжирования
- Оценка влияния данных и функций потерь на дообучение
- Сравнение различных конфигураций
- Оценка улучшения поиска
- Заключение
- Список использованных источников
- Приложение А. Исходный код