Details
| Title | Разработка RAG-системы для онлайн-курсов по подготовке к ЕГЭ по английскому языку: выпускная квалификационная работа бакалавра: направление 45.03.04 «Интеллектуальные системы в гуманитарной сфере» ; образовательная программа 45.03.04_01 «Цифровые технологии и иностранные языки» = Development of a RAG-system for online courses on Unified State Exam preparation in English |
|---|---|
| Creators | Острая Александра Владиславовна |
| Scientific adviser | Гаврилик Дарья Александровна |
| Other creators | Агафонова Марина Павловна |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Гуманитарный институт |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | Retrieval-Augmented Generation (RAG) ; большие языковые модели ; кодовое переключение ; автоматическое распознавание речи ; гибридный поиск ; обработка естественного языка (ЕЯ) ; онлайн-образование ; RAG ; LLM ; code-switching ; automatic speech recognition ; hybrid retrieval ; NLP ; online education |
| Document type | Bachelor graduation qualification work |
| Language | Russian |
| Level of education | Bachelor |
| Speciality code (FGOS) | 45.03.04 |
| Speciality group (FGOS) | 450000 - Языкознание и литературоведение |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-3075 |
| Rights | Доступ по паролю из сети Интернет (чтение) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\41924 |
| Record create date | 8/12/2026 |
Allowed Actions
–
Action 'Read' will be available if administrator prepare required files
| Group | Anonymous |
|---|---|
| Network | Internet |
Объект исследования – корпус видеоуроков курса по подготовке к ЕГЭ по английскому языку со смешанной русско-английской речью. Предмет исследования – методы и архитектурные решения RAG-систем для интеллектуального поиска и генерации ответов по мультиязычному корпусу видеоматериалов. Цель работы – разработка и оценка системы интеллектуального поиска на основе архитектуры RAG. В ходе работы решен ряд задач: проанализирована научная литература; дано описание методов обработки ЕЯ, архитектуры RAG и инструментов ее реализации; определены ключевые характеристики мультиязычных данных; сформирован и сегментирован корпус данных; построена векторная БД и реализован гибридный поиск с переранжированием; интегрирована LLM для генерации ответов; проведена оценка качества с RAGAS; разработан веб-интерфейс. В результате создана RAG-система, реализующая полный пайплайн обработки данных. Сравнение двух конфигураций на корпусе ограниченного объема показало, что архитектурное усложнение не приводит к измеримому приросту по метрикам, однако улучшает качество ответов на отдельных типах запросов. Выявленные ограничения формируют стратегию возможной доработки для коммерческой реализации. В работе использованы: модель ASR Whisper large-v3, модель эмбеддинга multilingual-e5-large-instruct, реранкер Cross-Encoder, LLM GigaChat Pro, векторная БД ChromaDB, фреймворки LangChain и RAGAS, библиотека Gradio, среда разработки Google Colaboratory.
The object of the research is a corpus of video lessons from an online course on Unified State Exam preparation in English, featuring mixed Russian-English speech. The subject of the research is the methods and architectural design choices of RAG systems applied to intelligent retrieval and answer generation over a multilingual video corpus. The objective of the work is to design and evaluate an intelligent retrieval system based on the RAG architecture. The following tasks were addressed: the relevant scientific literature was reviewed; a theoretical description of NLP methods, the RAG architecture, and its implementation tools was provided; the key properties of multilingual educational data were identified; a textual corpus was compiled and segmented; a vector database was built and hybrid retrieval with reranking was implemented; LLM for context-grounded answer generation was integrated; system quality was evaluated using RAGAS metrics; a demonstration web interface was developed. As a result, a RAG system was developed, covering the end-to-end pipeline for multilingual spoken-language data processing. A comparison of two system configurations on a corpus of limited size showed that increased architectural complexity does not yield a measurable gain in metrics, but does improve answer quality on certain query types. The identified limitations outline a strategy for possible development towards commercial deployment. The following technologies were used: the Whisper large-v3 ASR model, the multilingual-e5-large-instruct embedding model, the Cross-Encoder reranker, the GigaChat Pro LLM, the ChromaDB vector store, the LangChain and RAGAS frameworks, the Gradio library, and the Google Colaboratory cloud-based IDE.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|