Details
| Title | Разработка и исследование методов комбинированного анализа качества работы систем генерации ответов с дополненным поиском: выпускная квалификационная работа бакалавра: направление 02.03.01 «Математика и компьютерные науки» ; образовательная программа 02.03.01_01 «Системы искусственного интеллекта и суперкомпьютерные технологии» = Developement and study of combined methods for evaluating the quality of retrieval-augmented generation systems |
|---|---|
| Creators | Золоев Георгий Асланбекович |
| Scientific adviser | Мулюха Владимир Александрович |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | генерация с дополненным поиском (RAG) ; вопросно-ответные системы ; информационный поиск ; LLM-судья (LLM-AS-A-JUDGE) ; комбинированная оценка поиска ; достаточность и релевантность контекста ; retrieval-augmented generation (RAG) ; question asnwering ; information retrieval ; large language model as a judge (LLM-AS-A-JUDGE) ; combined retrieval quality evaluation ; context sufficiency and relevance |
| Document type | Bachelor graduation qualification work |
| Language | Russian |
| Level of education | Bachelor |
| Speciality code (FGOS) | 02.03.01 |
| Speciality group (FGOS) | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-2582 |
| Rights | Доступ по паролю из сети Интернет (чтение) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\42753 |
| Record create date | 8/21/2026 |
Allowed Actions
–
Action 'Read' will be available if administrator prepare required files
| Group | Anonymous |
|---|---|
| Network | Internet |
Тема ВКР: «Разработка и исследование методов комбинированного анализа качества работы систем генерации ответов с дополненным поиском». В таких системах генерации с дополненным поиском (RAG) ответ формирует большая языковая модель (LLM) по найденным модулем поиска фрагментам. Объект исследования — модуль поиска RAG-системы (представлен четырьмя вариантами поиска); предмет исследования — методы оценки качества этого модуля и их связь с корректностью ответа для русскоязычной вопросно-ответной задачи в открытом домене. Цель — построить методику, которая объединяет классические метрики качества поиска с оценками достаточности и релевантности контекста от LLM- судьи. Метод — воспроизводимая последовательность этапов с четырьмя вариантами поиска по открытому русскоязычному набору данных; для контроля смещения в пользу собственных ответов выполнены два запуска эксперимента (прохода) с зеркальной сменой модели-генератора. Результат — комбинированный показатель предсказывает корректность ответа точнее, чем метрики поиска или оценка контекста по отдельности; оценки судьи устойчивы по повторам, а модели-судьи разных семейств согласованы между собой. Методика применима для автоматизированного контроля качества поиска без массовой ручной разметки.
Topic of the thesis: “Development and study of combined methods for evaluating the quality of retrieval-augmented generation systems”. In such retrieval-augmented generation (RAG) systems the answer is produced by a large language model (LLM) from the fragments found by a retrieval module. The object of study is the RAG re- trieval module (represented by four retrieval configurations); the subject is the set of methods for assessing the quality of this module and their relation to answer correct- ness for Russian-language open-domain question answering. The objective is to build a methodology that joins classical retrieval-quality met- rics with context-sufficiency and context-relevance scores from a large language model acting as a judge (LLM-as-a-Judge). Method: a reproducible pipeline with four retrieval configurations over an open Russian-language dataset; to control self- preference bias, two mirrored passes were run with a swapped answer-generating model. Result: the combined predictor estimates answer correctness more accurately than the retrieval metrics or the LLM score taken alone; the judge scores are stable, and judges from different families agree. The methodology is applicable to auto- mated quality control of retrieval without large-scale manual annotation.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|