Детальная информация

Название Разработка интеллектуальных алгоритмов поиска похожих документов с использованием семантических кластеров в задаче патентной экспертизы: выпускная квалификационная работа магистра: направление 02.04.01 «Математика и компьютерные науки» ; образовательная программа 02.04.01_03 «Искусственный интеллект и машинное обучение» = The development of intelligent algorithms for finding similar documents using semantic clusters in the task of patent examination
Авторы Мутовкина Екатерина Дмитриевна
Научный руководитель Лукашин Алексей Андреевич
Организация Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Выходные сведения Санкт-Петербург, 2026
Коллекция Выпускные квалификационные работы ; Общая коллекция
Тематика патентный поиск ; семантический поиск ; метрическое обучение ; реранжирование ; патентная экспертиза ; граф ; triplet loss ; patent search ; semantic search ; metric learning ; reranking ; patent examination ; graph
Тип документа Выпускная квалификационная работа магистра
Язык Русский
Уровень высшего образования Магистратура
Код специальности ФГОС 02.04.01
Группа специальностей ФГОС 020000 - Компьютерные и информационные науки
DOI 10.18720/SPBPU/3/2026/vr/vr26-4863
Права доступа Доступ по паролю из сети Интернет (чтение, печать)
Дополнительно Новинка
Ключ записи ru\spstu\vkr\45036
Дата создания записи 04.09.2026

Разрешенные действия

Действие 'Прочитать' будет возможно после подготовки администраторами необходимых файлов

Группа Анонимные пользователи
Сеть Интернет

Предмет исследования – методы и модели машинного обучения для построения векторных представлений патентных документов и повышения качества ранжирования результатов поиска. Тема работы – разработка интеллектуальных алгоритмов поиска похожих документов с использованием семантических кластеров в задаче патентной экспертизы. Цель – повышение качества поиска патентных аналогов. Работа включает анализ предметной области патентной экспертизы, обзор современных методов представления текстов (трансформеры, метрическое обучение). Разработан двухэтапный алгоритм: на первом этапе выполняется семантический поиск кандидатов с помощью модели, обученной на Triplet loss, на втором этапе отобранные кандидаты переранжируются ансамблем деревье. Эксперименты проведены на выборке патентных документов с оценкой качества по метрикам Recall@20 и MAP@20. Метрическое обучение повысило Recall@20 на 4.36 % и MAP@20 на 5.05 % относительно базового подхода. Двухэтапный алгоритм с реранжированием LightGBM дал итоговый прирост Recall@20 на 8.38 % и MAP@20 на 14.49 %. С помощью SHAP-анализа установлено, что наиболее важными признаками являются временная разница публикаций и косинусная близость термвекторов. Разработанный подход может быть использован в системах автоматизированной поддержки патентной экспертизы, а также адаптирован для поиска релевантных документов в других областях.

The subject of the research is methods and models of machine learning for constructing vector representations of patent documents and improving the quality of search result ranking. The topic of the work is the development of intelligent algorithms for finding similar documents using semantic clusters in the task of patent examination. The aim is to improve the quality of prior art search. The work includes an analysis of the patent examination domain, a review of modern text representation methods (transformers, metric learning). A two-stage algorithm is developed: at the first stage, semantic candidate search is performed using a model trained with Triplet loss; at the second stage, the selected candidates are reranked by an ensemble of trees. Experiments are conducted on a sample of patent documents with quality assessment using Recall@20 and MAP@20 metrics. Metric learning improved Recall@20 by 4.36 % and MAP@20 by 5.05 % relative to the baseline approach. The two-stage algorithm with LightGBM reranking yielded a final improvement in Recall@20 of 8.38 % and in MAP@20 of 14.49 %. SHAP analysis revealed that the most important features are the time difference between publication years and the cosine similarity of term vectors. The developed approach can be used in automated patent examination support systems and can also be adapted for relevant document search in other domains.

Место доступа Группа пользователей Действие
Локальная сеть ИБК СПбПУ Все
Интернет Авторизованные пользователи СПбПУ
Интернет Анонимные пользователи
...