Details

Title Оптимизация семантического поиска в базе произведений искусства с помощью больших языковых моделей (на примере коллекции Русского музея): выпускная квалификационная работа магистра: направление 45.04.04 «Интеллектуальные системы в гуманитарной среде» ; образовательная программа 45.04.04_02 «Цифровая лингвистика» = Optimization of Semantic Search in an Artworks Database Using Large Language Models: A Case Study of the Russian Museum Collection
Creators Полищук Руслан Витальевич
Scientific adviser Белов Вадим Алексеевич
Organization Санкт-Петербургский политехнический университет Петра Великого. Гуманитарный институт
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects семантический поиск ; большие языковые модели ; RAG ; LightRAG ; музейные коллекции ; искусствоведческие описания ; Русский музей ; semantic search ; large language models ; museum ; collections ; art historical descriptions ; Russian Museum
Document type Master graduation qualification work
Language Russian
Level of education Master
Speciality code (FGOS) 45.04.04
Speciality group (FGOS) 450000 - Языкознание и литературоведение
DOI 10.18720/SPBPU/3/2026/vr/vr26-5346
Rights Доступ по паролю из сети Интернет (чтение, печать)
Additionally New arrival
Record key ru\spstu\vkr\45725
Record create date 9/10/2026

Allowed Actions

Action 'Read' will be available if you login or access site from another network

Group Anonymous
Network Internet

В данной работе рассматривается проблема организации семантического поиска по цифровой базе произведений искусства на материале коллекции Государственного Русского музея. Особое внимание уделяется ограничениям традиционных музейных каталогов, которые эффективно работают с формальными метаданными, но недостаточно полно раскрывают смысловые, контекстуальные и интерпретационные связи между произведениями. В качестве решения рассматривается применение больших языковых моделей и архитектуры RetrievalAugmented Generation, позволяющей формировать ответы не только на основе внутренних знаний модели, но и с опорой на заранее подготовленный корпус музейных данных. В ходе работы был сформирован корпус искусствоведческих описаний произведений живописи первой половины XX века из цифровой коллекции Русского музея, выполнена его очистка, структурирование и подготовка к индексации. Для реализации системы была выбрана гибридная архитектура LightRAG, сочетающая векторное представление текстов и графовое представление связей между сущностями. Был разработан программный прототип системы семантического поиска RuMusRAG, реализован диалоговый интерфейс и предусмотрены сценарии фактографических, контекстуальных, сравнительных и интерпретационных запросов. Экспериментальная оценка качества ответов проводилась с использованием подхода LLM-as-a-Judge. В результате было установлено, что использование гибридной RAG-архитектуры позволяет повысить проверяемость и релевантность ответов, а также расширить возможности работы с музейной информацией за счет выявления смысловых связей между авторами, произведениями, художественными направлениями и историко-культурными контекстами. Предложенный подход может быть использован при разработке интеллектуальных поисковых систем для музейных коллекций и цифровых ресурсов культурного наследия.

This work examines the problem of organizing semantic search in a digital database of artworks based on the collection of the State Russian Museum. Special attention is given to the limitations of traditional museum catalogues, which are effective in processing formal metadata but do not sufficiently reveal semantic, contextual, and interpretative relations between artworks. As a possible solution, the study considers the use of large language models and Retrieval-Augmented Generation architecture, which makes it possible to generate answers not only from the model’s internal knowledge, but also on the basis of a prepared corpus of verified museum data. In the course of the research, a corpus of art historical descriptions of paintings from the first half of the twentieth century in the digital collection of the Russian Museum was formed, cleaned, structured, and prepared for indexing. The hybrid LightRAG architecture was selected for the system implementation, as it combines vector representation of texts with graph-based representation of relations between entities. A software prototype of the RuMusRAG semantic search system was developed, a dialogue interface was implemented, and user scenarios for factual, contextual, comparative, and interpretative queries were designed. The experimental evaluation of answer quality was carried out using the LLMas-a-Judge approach. The results showed that the use of a hybrid RAG architecture improves the verifiability and relevance of generated answers and expands the possibilities of working with museum information by identifying semantic relations between artists, artworks, artistic movements, and historical and cultural contexts. The proposed approach can be applied to the development of intelligent search systems for museum collections and digital cultural heritage resources.

Network User group Action
ILC SPbPU Local Network All
Read Print
Internet Authorized users SPbPU
Read Print
Internet Anonymous
  • f9cf3ddd20314a9fc579e66d8f5083930cfedf59a77833ff321108966b3df9f0.pdf
  • f9cf3ddd20314a9fc579e66d8f5083930cfedf59a77833ff321108966b3df9f0.pdf
  • f9cf3ddd20314a9fc579e66d8f5083930cfedf59a77833ff321108966b3df9f0.pdf
...