Details
| Title | Разработка интеллектуальных алгоритмов поиска похожих документов с использованием семантических кластеров в задаче патентной экспертизы: выпускная квалификационная работа магистра: направление 02.04.01 «Математика и компьютерные науки» ; образовательная программа 02.04.01_03 «Искусственный интеллект и машинное обучение» = The development of intelligent algorithms for finding similar documents using semantic clusters in the task of patent examination |
|---|---|
| Creators | Мутовкина Екатерина Дмитриевна |
| Scientific adviser | Лукашин Алексей Андреевич |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | патентный поиск ; семантический поиск ; метрическое обучение ; реранжирование ; патентная экспертиза ; граф ; triplet loss ; patent search ; semantic search ; metric learning ; reranking ; patent examination ; graph |
| Document type | Master graduation qualification work |
| Language | Russian |
| Level of education | Master |
| Speciality code (FGOS) | 02.04.01 |
| Speciality group (FGOS) | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-4863 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\45036 |
| Record create date | 9/4/2026 |
Allowed Actions
–
Action 'Read' will be available if administrator prepare required files
| Group | Anonymous |
|---|---|
| Network | Internet |
Предмет исследования – методы и модели машинного обучения для построения векторных представлений патентных документов и повышения качества ранжирования результатов поиска. Тема работы – разработка интеллектуальных алгоритмов поиска похожих документов с использованием семантических кластеров в задаче патентной экспертизы. Цель – повышение качества поиска патентных аналогов. Работа включает анализ предметной области патентной экспертизы, обзор современных методов представления текстов (трансформеры, метрическое обучение). Разработан двухэтапный алгоритм: на первом этапе выполняется семантический поиск кандидатов с помощью модели, обученной на Triplet loss, на втором этапе отобранные кандидаты переранжируются ансамблем деревье. Эксперименты проведены на выборке патентных документов с оценкой качества по метрикам Recall@20 и MAP@20. Метрическое обучение повысило Recall@20 на 4.36 % и MAP@20 на 5.05 % относительно базового подхода. Двухэтапный алгоритм с реранжированием LightGBM дал итоговый прирост Recall@20 на 8.38 % и MAP@20 на 14.49 %. С помощью SHAP-анализа установлено, что наиболее важными признаками являются временная разница публикаций и косинусная близость термвекторов. Разработанный подход может быть использован в системах автоматизированной поддержки патентной экспертизы, а также адаптирован для поиска релевантных документов в других областях.
The subject of the research is methods and models of machine learning for constructing vector representations of patent documents and improving the quality of search result ranking. The topic of the work is the development of intelligent algorithms for finding similar documents using semantic clusters in the task of patent examination. The aim is to improve the quality of prior art search. The work includes an analysis of the patent examination domain, a review of modern text representation methods (transformers, metric learning). A two-stage algorithm is developed: at the first stage, semantic candidate search is performed using a model trained with Triplet loss; at the second stage, the selected candidates are reranked by an ensemble of trees. Experiments are conducted on a sample of patent documents with quality assessment using Recall@20 and MAP@20 metrics. Metric learning improved Recall@20 by 4.36 % and MAP@20 by 5.05 % relative to the baseline approach. The two-stage algorithm with LightGBM reranking yielded a final improvement in Recall@20 of 8.38 % and in MAP@20 of 14.49 %. SHAP analysis revealed that the most important features are the time difference between publication years and the cosine similarity of term vectors. The developed approach can be used in automated patent examination support systems and can also be adapted for relevant document search in other domains.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|