Детальная информация

Название Разработка и реализация алгоритмов повышения точности семантического поиска в области кибербезопасности с применением моделей реранжирования: выпускная квалификационная работа бакалавра: направление 02.03.01 «Математика и компьютерные науки» ; образовательная программа 02.03.01_01 «Системы искусственного интеллекта и суперкомпьютерные технологии» = Development and implementation of algorithms to enhance semantic search accuracy in the cybersecurity domain using reranking models
Авторы Астафьев Игорь Евгеньевич
Научный руководитель Лукашин Алексей Андреевич
Организация Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Выходные сведения Санкт-Петербург, 2026
Коллекция Выпускные квалификационные работы ; Общая коллекция
Тематика семантический поиск ; кибербезопасность ; реранжирование ; cross-encoder ; bi-encoder ; transformer ; векторный поиск ; rag ; learning to rank ; semantic search ; cybersecurity ; reranking ; vector search
Тип документа Выпускная квалификационная работа бакалавра
Язык Русский
Уровень высшего образования Бакалавриат
Код специальности ФГОС 02.03.01
Группа специальностей ФГОС 020000 - Компьютерные и информационные науки
DOI 10.18720/SPBPU/3/2026/vr/vr26-2580
Права доступа Доступ по паролю из сети Интернет (чтение, печать)
Дополнительно Новинка
Ключ записи ru\spstu\vkr\42751
Дата создания записи 21.08.2026

Разрешенные действия

Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Группа Анонимные пользователи
Сеть Интернет

Работа посвящена разработке и реализации алгоритма повышения точности семантического поиска в области кибербезопасности с использованием моделей реранжирования. Актуальность исследования обусловлена ростом объемов данных по информационной безопасности и необходимостью повышения качества поиска релевантных документов в профессиональных базах знаний. Целью работы является разработка и экспериментальная оценка алгоритма семантического поиска, обеспечивающего повышение качества ранжирования документов за счет применения дообученной модели реранжирования. Для достижения поставленной цели выполнен анализ современных подходов информационного и семантического поиска, методов обучения моделей представления текста, алгоритмов ранжирования и архитектур Retrieval-Augmented Generation. В ходе работы выполнен сбор и объединение наборов данных по кибербезопасности с их последующим дополнением. Разработан двухэтапный алгоритм, включающий поиск кандидатов по эмбеддингам документов и последующее реранжирование найденных результатов. Проведено экспериментальное исследование качества поиска для различных комбинаций bi-encoder и cross-encoder моделей. Полученные результаты показали, что применение дообученной модели реранжирования позволяет повысить значение метрики MRR@15 на 12,9% по сравнению с базовым семантическим поиском без реранжирования при сохранении приемлемого времени обработки запросов. Практическая значимость работы заключается в возможности использования разработанного алгоритма в поисковых системах и RAG-приложениях, ориентированных на обработку специализированной информации в области кибербезопасности.

This thesis is devoted to the development and implementation of an algorithm for improving semantic search accuracy in the cybersecurity domain using reranking models. The relevance of the research is determined by the growing amount of cybersecurity information and the increasing demand for accurate retrieval of relevant documents from specialized knowledge bases. The objective of the work is to develop and experimentally evaluate a semantic search algorithm that improves ranking quality through the use of a fine-tuned reranking model. To achieve this objective, modern approaches to information retrieval, semantic search, text representation learning, ranking algorithms, and Retrieval-Augmented Generation architectures were analyzed. The work involved collecting and merging cybersecurity datasets, followed by their augmentation. A two-stage semantic search algorithm was developed. At the first stage, candidate documents are retrieved using dense vector representations. At the second stage, the retrieved candidates are reranked using a cross-encoder model. An extensive experimental evaluation was conducted for different combinations of bi-encoder and reranking models. The experimental results demonstrate that the proposed approach significantly improves search quality. The best configuration achieved a 12.9% improvement in MRR@15 compared to the baseline semantic search system without reranking while maintaining low query processing latency. The practical value of the work lies in the possibility of applying the proposed algorithm in cybersecurity search systems and Retrieval-Augmented Generation applications requiring accurate retrieval of domain-specific information.

Место доступа Группа пользователей Действие
Локальная сеть ИБК СПбПУ Все
Прочитать Печать
Интернет Авторизованные пользователи СПбПУ
Прочитать Печать
Интернет Анонимные пользователи
  • Список сокращений и обозначений
  • Введение
  • Анализ подходов в семантическом поиске и ранжировании
    • Классические подходы информационного поиска
    • Подходы семантического поиска
    • Сравнение плотных методов
    • Обучение трансформерных моделей
    • Меры близости
    • Ранжирование в поиске
    • RAG-система
    • Вывод к главе
  • Формальная постановка задачи
  • Разработка алгоритма
    • Общее описание алгоритма
    • Получение данных для дообучения
    • Обучение моделей реранжирования
    • Итоговый вариант алгоритма
    • Вывод к главе
  • Экспериментальное исследование и оценка алгоритма повышения точности семантического поиска на основе моделей реранжирования
    • Сравнение bi-encoder моделей
    • Сравнение моделей реранжирования
    • Оценка влияния данных и функций потерь на дообучение
    • Сравнение различных конфигураций
    • Оценка улучшения поиска
  • Заключение
  • Список использованных источников
  • Приложение А. Исходный код
...