Details

Title Разработка RAG-системы для онлайн-курсов по подготовке к ЕГЭ по английскому языку: выпускная квалификационная работа бакалавра: направление 45.03.04 «Интеллектуальные системы в гуманитарной сфере» ; образовательная программа 45.03.04_01 «Цифровые технологии и иностранные языки» = Development of a RAG-system for online courses on Unified State Exam preparation in English
Creators Острая Александра Владиславовна
Scientific adviser Гаврилик Дарья Александровна
Other creators Агафонова Марина Павловна
Organization Санкт-Петербургский политехнический университет Петра Великого. Гуманитарный институт
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects Retrieval-Augmented Generation (RAG) ; большие языковые модели ; кодовое переключение ; автоматическое распознавание речи ; гибридный поиск ; обработка естественного языка (ЕЯ) ; онлайн-образование ; RAG ; LLM ; code-switching ; automatic speech recognition ; hybrid retrieval ; NLP ; online education
Document type Bachelor graduation qualification work
Language Russian
Level of education Bachelor
Speciality code (FGOS) 45.03.04
Speciality group (FGOS) 450000 - Языкознание и литературоведение
DOI 10.18720/SPBPU/3/2026/vr/vr26-3075
Rights Доступ по паролю из сети Интернет (чтение)
Additionally New arrival
Record key ru\spstu\vkr\41924
Record create date 8/12/2026

Allowed Actions

Action 'Read' will be available if administrator prepare required files

Group Anonymous
Network Internet

Объект исследования – корпус видеоуроков курса по подготовке к ЕГЭ по английскому языку со смешанной русско-английской речью. Предмет исследования – методы и архитектурные решения RAG-систем для интеллектуального поиска и генерации ответов по мультиязычному корпусу видеоматериалов. Цель работы – разработка и оценка системы интеллектуального поиска на основе архитектуры RAG. В ходе работы решен ряд задач: проанализирована научная литература; дано описание методов обработки ЕЯ, архитектуры RAG и инструментов ее реализации; определены ключевые характеристики мультиязычных данных; сформирован и сегментирован корпус данных; построена векторная БД и реализован гибридный поиск с переранжированием; интегрирована LLM для генерации ответов; проведена оценка качества с RAGAS; разработан веб-интерфейс. В результате создана RAG-система, реализующая полный пайплайн обработки данных. Сравнение двух конфигураций на корпусе ограниченного объема показало, что архитектурное усложнение не приводит к измеримому приросту по метрикам, однако улучшает качество ответов на отдельных типах запросов. Выявленные ограничения формируют стратегию возможной доработки для коммерческой реализации. В работе использованы: модель ASR Whisper large-v3, модель эмбеддинга multilingual-e5-large-instruct, реранкер Cross-Encoder, LLM GigaChat Pro, векторная БД ChromaDB, фреймворки LangChain и RAGAS, библиотека Gradio, среда разработки Google Colaboratory.

The object of the research is a corpus of video lessons from an online course on Unified State Exam preparation in English, featuring mixed Russian-English speech. The subject of the research is the methods and architectural design choices of RAG systems applied to intelligent retrieval and answer generation over a multilingual video corpus. The objective of the work is to design and evaluate an intelligent retrieval system based on the RAG architecture. The following tasks were addressed: the relevant scientific literature was reviewed; a theoretical description of NLP methods, the RAG architecture, and its implementation tools was provided; the key properties of multilingual educational data were identified; a textual corpus was compiled and segmented; a vector database was built and hybrid retrieval with reranking was implemented; LLM for context-grounded answer generation was integrated; system quality was evaluated using RAGAS metrics; a demonstration web interface was developed. As a result, a RAG system was developed, covering the end-to-end pipeline for multilingual spoken-language data processing. A comparison of two system configurations on a corpus of limited size showed that increased architectural complexity does not yield a measurable gain in metrics, but does improve answer quality on certain query types. The identified limitations outline a strategy for possible development towards commercial deployment. The following technologies were used: the Whisper large-v3 ASR model, the multilingual-e5-large-instruct embedding model, the Cross-Encoder reranker, the GigaChat Pro LLM, the ChromaDB vector store, the LangChain and RAGAS frameworks, the Gradio library, and the Google Colaboratory cloud-based IDE.

Network User group Action
ILC SPbPU Local Network All
Internet Authorized users SPbPU
Internet Anonymous
...