Детальная информация
| Название | Разработка и исследование методов комбинированного анализа качества работы систем генерации ответов с дополненным поиском: выпускная квалификационная работа бакалавра: направление 02.03.01 «Математика и компьютерные науки» ; образовательная программа 02.03.01_01 «Системы искусственного интеллекта и суперкомпьютерные технологии» = Developement and study of combined methods for evaluating the quality of retrieval-augmented generation systems |
|---|---|
| Авторы | Золоев Георгий Асланбекович |
| Научный руководитель | Мулюха Владимир Александрович |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | генерация с дополненным поиском (RAG) ; вопросно-ответные системы ; информационный поиск ; LLM-судья (LLM-AS-A-JUDGE) ; комбинированная оценка поиска ; достаточность и релевантность контекста ; retrieval-augmented generation (RAG) ; question asnwering ; information retrieval ; large language model as a judge (LLM-AS-A-JUDGE) ; combined retrieval quality evaluation ; context sufficiency and relevance |
| Тип документа | Выпускная квалификационная работа бакалавра |
| Язык | Русский |
| Уровень высшего образования | Бакалавриат |
| Код специальности ФГОС | 02.03.01 |
| Группа специальностей ФГОС | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-2582 |
| Права доступа | Доступ по паролю из сети Интернет (чтение) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\42753 |
| Дата создания записи | 21.08.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет возможно после подготовки администраторами необходимых файлов
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
Тема ВКР: «Разработка и исследование методов комбинированного анализа качества работы систем генерации ответов с дополненным поиском». В таких системах генерации с дополненным поиском (RAG) ответ формирует большая языковая модель (LLM) по найденным модулем поиска фрагментам. Объект исследования — модуль поиска RAG-системы (представлен четырьмя вариантами поиска); предмет исследования — методы оценки качества этого модуля и их связь с корректностью ответа для русскоязычной вопросно-ответной задачи в открытом домене. Цель — построить методику, которая объединяет классические метрики качества поиска с оценками достаточности и релевантности контекста от LLM- судьи. Метод — воспроизводимая последовательность этапов с четырьмя вариантами поиска по открытому русскоязычному набору данных; для контроля смещения в пользу собственных ответов выполнены два запуска эксперимента (прохода) с зеркальной сменой модели-генератора. Результат — комбинированный показатель предсказывает корректность ответа точнее, чем метрики поиска или оценка контекста по отдельности; оценки судьи устойчивы по повторам, а модели-судьи разных семейств согласованы между собой. Методика применима для автоматизированного контроля качества поиска без массовой ручной разметки.
Topic of the thesis: “Development and study of combined methods for evaluating the quality of retrieval-augmented generation systems”. In such retrieval-augmented generation (RAG) systems the answer is produced by a large language model (LLM) from the fragments found by a retrieval module. The object of study is the RAG re- trieval module (represented by four retrieval configurations); the subject is the set of methods for assessing the quality of this module and their relation to answer correct- ness for Russian-language open-domain question answering. The objective is to build a methodology that joins classical retrieval-quality met- rics with context-sufficiency and context-relevance scores from a large language model acting as a judge (LLM-as-a-Judge). Method: a reproducible pipeline with four retrieval configurations over an open Russian-language dataset; to control self- preference bias, two mirrored passes were run with a swapped answer-generating model. Result: the combined predictor estimates answer correctness more accurately than the retrieval metrics or the LLM score taken alone; the judge scores are stable, and judges from different families agree. The methodology is applicable to auto- mated quality control of retrieval without large-scale manual annotation.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|