Детальная информация
| Название | Оптимизация семантического поиска в базе произведений искусства с помощью больших языковых моделей (на примере коллекции Русского музея): выпускная квалификационная работа магистра: направление 45.04.04 «Интеллектуальные системы в гуманитарной среде» ; образовательная программа 45.04.04_02 «Цифровая лингвистика» = Optimization of Semantic Search in an Artworks Database Using Large Language Models: A Case Study of the Russian Museum Collection |
|---|---|
| Авторы | Полищук Руслан Витальевич |
| Научный руководитель | Белов Вадим Алексеевич |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Гуманитарный институт |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | семантический поиск ; большие языковые модели ; RAG ; LightRAG ; музейные коллекции ; искусствоведческие описания ; Русский музей ; semantic search ; large language models ; museum ; collections ; art historical descriptions ; Russian Museum |
| Тип документа | Выпускная квалификационная работа магистра |
| Язык | Русский |
| Уровень высшего образования | Магистратура |
| Код специальности ФГОС | 45.04.04 |
| Группа специальностей ФГОС | 450000 - Языкознание и литературоведение |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-5346 |
| Права доступа | Доступ по паролю из сети Интернет (чтение, печать) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\45725 |
| Дата создания записи | 10.09.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
В данной работе рассматривается проблема организации семантического поиска по цифровой базе произведений искусства на материале коллекции Государственного Русского музея. Особое внимание уделяется ограничениям традиционных музейных каталогов, которые эффективно работают с формальными метаданными, но недостаточно полно раскрывают смысловые, контекстуальные и интерпретационные связи между произведениями. В качестве решения рассматривается применение больших языковых моделей и архитектуры RetrievalAugmented Generation, позволяющей формировать ответы не только на основе внутренних знаний модели, но и с опорой на заранее подготовленный корпус музейных данных. В ходе работы был сформирован корпус искусствоведческих описаний произведений живописи первой половины XX века из цифровой коллекции Русского музея, выполнена его очистка, структурирование и подготовка к индексации. Для реализации системы была выбрана гибридная архитектура LightRAG, сочетающая векторное представление текстов и графовое представление связей между сущностями. Был разработан программный прототип системы семантического поиска RuMusRAG, реализован диалоговый интерфейс и предусмотрены сценарии фактографических, контекстуальных, сравнительных и интерпретационных запросов. Экспериментальная оценка качества ответов проводилась с использованием подхода LLM-as-a-Judge. В результате было установлено, что использование гибридной RAG-архитектуры позволяет повысить проверяемость и релевантность ответов, а также расширить возможности работы с музейной информацией за счет выявления смысловых связей между авторами, произведениями, художественными направлениями и историко-культурными контекстами. Предложенный подход может быть использован при разработке интеллектуальных поисковых систем для музейных коллекций и цифровых ресурсов культурного наследия.
This work examines the problem of organizing semantic search in a digital database of artworks based on the collection of the State Russian Museum. Special attention is given to the limitations of traditional museum catalogues, which are effective in processing formal metadata but do not sufficiently reveal semantic, contextual, and interpretative relations between artworks. As a possible solution, the study considers the use of large language models and Retrieval-Augmented Generation architecture, which makes it possible to generate answers not only from the model’s internal knowledge, but also on the basis of a prepared corpus of verified museum data. In the course of the research, a corpus of art historical descriptions of paintings from the first half of the twentieth century in the digital collection of the Russian Museum was formed, cleaned, structured, and prepared for indexing. The hybrid LightRAG architecture was selected for the system implementation, as it combines vector representation of texts with graph-based representation of relations between entities. A software prototype of the RuMusRAG semantic search system was developed, a dialogue interface was implemented, and user scenarios for factual, contextual, comparative, and interpretative queries were designed. The experimental evaluation of answer quality was carried out using the LLMas-a-Judge approach. The results showed that the use of a hybrid RAG architecture improves the verifiability and relevance of generated answers and expands the possibilities of working with museum information by identifying semantic relations between artists, artworks, artistic movements, and historical and cultural contexts. The proposed approach can be applied to the development of intelligent search systems for museum collections and digital cultural heritage resources.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|
- f9cf3ddd20314a9fc579e66d8f5083930cfedf59a77833ff321108966b3df9f0.pdf
- f9cf3ddd20314a9fc579e66d8f5083930cfedf59a77833ff321108966b3df9f0.pdf
- f9cf3ddd20314a9fc579e66d8f5083930cfedf59a77833ff321108966b3df9f0.pdf