Детальная информация

Название Разработка RAG-системы для онлайн-курсов по подготовке к ЕГЭ по английскому языку: выпускная квалификационная работа бакалавра: направление 45.03.04 «Интеллектуальные системы в гуманитарной сфере» ; образовательная программа 45.03.04_01 «Цифровые технологии и иностранные языки» = Development of a RAG-system for online courses on Unified State Exam preparation in English
Авторы Острая Александра Владиславовна
Научный руководитель Гаврилик Дарья Александровна
Другие авторы Агафонова Марина Павловна
Организация Санкт-Петербургский политехнический университет Петра Великого. Гуманитарный институт
Выходные сведения Санкт-Петербург, 2026
Коллекция Выпускные квалификационные работы ; Общая коллекция
Тематика Retrieval-Augmented Generation (RAG) ; большие языковые модели ; кодовое переключение ; автоматическое распознавание речи ; гибридный поиск ; обработка естественного языка (ЕЯ) ; онлайн-образование ; RAG ; LLM ; code-switching ; automatic speech recognition ; hybrid retrieval ; NLP ; online education
Тип документа Выпускная квалификационная работа бакалавра
Язык Русский
Уровень высшего образования Бакалавриат
Код специальности ФГОС 45.03.04
Группа специальностей ФГОС 450000 - Языкознание и литературоведение
DOI 10.18720/SPBPU/3/2026/vr/vr26-3075
Права доступа Доступ по паролю из сети Интернет (чтение)
Дополнительно Новинка
Ключ записи ru\spstu\vkr\41924
Дата создания записи 12.08.2026

Разрешенные действия

Действие 'Прочитать' будет возможно после подготовки администраторами необходимых файлов

Группа Анонимные пользователи
Сеть Интернет

Объект исследования – корпус видеоуроков курса по подготовке к ЕГЭ по английскому языку со смешанной русско-английской речью. Предмет исследования – методы и архитектурные решения RAG-систем для интеллектуального поиска и генерации ответов по мультиязычному корпусу видеоматериалов. Цель работы – разработка и оценка системы интеллектуального поиска на основе архитектуры RAG. В ходе работы решен ряд задач: проанализирована научная литература; дано описание методов обработки ЕЯ, архитектуры RAG и инструментов ее реализации; определены ключевые характеристики мультиязычных данных; сформирован и сегментирован корпус данных; построена векторная БД и реализован гибридный поиск с переранжированием; интегрирована LLM для генерации ответов; проведена оценка качества с RAGAS; разработан веб-интерфейс. В результате создана RAG-система, реализующая полный пайплайн обработки данных. Сравнение двух конфигураций на корпусе ограниченного объема показало, что архитектурное усложнение не приводит к измеримому приросту по метрикам, однако улучшает качество ответов на отдельных типах запросов. Выявленные ограничения формируют стратегию возможной доработки для коммерческой реализации. В работе использованы: модель ASR Whisper large-v3, модель эмбеддинга multilingual-e5-large-instruct, реранкер Cross-Encoder, LLM GigaChat Pro, векторная БД ChromaDB, фреймворки LangChain и RAGAS, библиотека Gradio, среда разработки Google Colaboratory.

The object of the research is a corpus of video lessons from an online course on Unified State Exam preparation in English, featuring mixed Russian-English speech. The subject of the research is the methods and architectural design choices of RAG systems applied to intelligent retrieval and answer generation over a multilingual video corpus. The objective of the work is to design and evaluate an intelligent retrieval system based on the RAG architecture. The following tasks were addressed: the relevant scientific literature was reviewed; a theoretical description of NLP methods, the RAG architecture, and its implementation tools was provided; the key properties of multilingual educational data were identified; a textual corpus was compiled and segmented; a vector database was built and hybrid retrieval with reranking was implemented; LLM for context-grounded answer generation was integrated; system quality was evaluated using RAGAS metrics; a demonstration web interface was developed. As a result, a RAG system was developed, covering the end-to-end pipeline for multilingual spoken-language data processing. A comparison of two system configurations on a corpus of limited size showed that increased architectural complexity does not yield a measurable gain in metrics, but does improve answer quality on certain query types. The identified limitations outline a strategy for possible development towards commercial deployment. The following technologies were used: the Whisper large-v3 ASR model, the multilingual-e5-large-instruct embedding model, the Cross-Encoder reranker, the GigaChat Pro LLM, the ChromaDB vector store, the LangChain and RAGAS frameworks, the Gradio library, and the Google Colaboratory cloud-based IDE.

Место доступа Группа пользователей Действие
Локальная сеть ИБК СПбПУ Все
Интернет Авторизованные пользователи СПбПУ
Интернет Анонимные пользователи
...