Details
| Title | Автоматическое реферирование академических текстов с применением технологий глубокого обучения: выпускная квалификационная работа бакалавра: направление 02.03.03 «Математическое обеспечение и администрирование информационных систем» ; образовательная программа 02.03.03_01 «Интеллектуальные информационные системы и обработка данных» = Automatic summarization of academic texts using deep learning technologies |
|---|---|
| Creators | Ликола Мишек |
| Scientific adviser | Пак Вадим Геннадьевич |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | автоматическое реферирование текстов ; глубокое обучение ; архитектура трансформера ; иерархическое внимание ; обработка естественного языка ; русскоязычные научные тексты ; BPE-токенизация ; метрики ROUGE ; automatic text summarization ; deep learning ; transformer architecture ; hierarchical attention ; natural language processing ; russian scientific texts ; BPE tokenization ; ROUGE metrics |
| Document type | Bachelor graduation qualification work |
| Language | Russian |
| Level of education | Bachelor |
| Speciality code (FGOS) | 02.03.03 |
| Speciality group (FGOS) | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-3901 |
| Rights | Доступ по паролю из сети Интернет (чтение) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\42847 |
| Record create date | 8/21/2026 |
Allowed Actions
–
Action 'Read' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
Тема выпускной квалификационной работы: «Автоматическое реферирование академических текстов с применением технологий глубокого обучения». В данной работе изложена концепция создания и экспериментального исследования иерархической модели трансформера для абстрактивной суммаризации русскоязычных научных текстов. Проведён анализ существующих подходов к автоматической суммаризации и выявлены ограничения современных трансформерных моделей (ruT5, mBART) при обработке длинных научных документов. Сформулированы требования к специализированной архитектуре, включающие механизмы обработки длинного контекста, внимания с памятью и доменно-специфичной токенизации. Спроектирована и реализована с нуля на PyTorch иерархическая архитектура трансформера типа encoder-decoder с интеграцией замороженных эмбеддингов FastText и пользовательского BPE-токенизатора, обученного на научном корпусе. Собран и предобработан набор данных из примерно 3000 русскоязычных научных статей из различных предметных областей (физика, математика, биология, медицина, информатика) из открытых источников (КиберЛенинка, Хабр-Наука). Экспериментальная оценка на тестовой выборке из 150 документов показала, что предложенная модель превосходит существующие модели ruT5 и mBART. Пользовательский токенизатор сократил количество токенов на 1000 символов на 13–19% и снизил показатель unknown-rate в 2,5–3,4 раза. Модель содержит 54 миллиона параметров, в 7,3 раза быстрее на CPU-инференсе по сравнению с mBART и обеспечивает лучшее покрытие длинных документов (>2048 токенов) 74%. Качество суммаризации, измеренное метриками ROUGE, достигло ROUGE-1 = 34,8%, ROUGE-2 = 16,2% и ROUGE-L = 30,1%, что подтверждает эффективность предложенной иерархической архитектуры для задачи автоматического реферирования русскоязычных научных текстов.
The subject of the graduate qualification work: «Automatic summarization of academic texts using deep learning technologies». This paper describes the concept of creating and experimentally researching a hierarchical transformer model for abstractive summarization of Russian-language scientific texts. An analysis of existing approaches to automatic summarization is conducted, and the limitations of modern transformer models (ruT5, mBART) when processing long scientific documents are identified. Requirements for a specialized architecture are formulated, including mechanisms for handling long context, memory-based attention, and domain-specific tokenization. A hierarchical encoder-decoder transformer architecture was designed and implemented from scratch using PyTorch, integrating frozen FastText embeddings and a custom Byte-Pair Encoding (BPE) tokenizer trained on a scientific corpus. A dataset of approximately 3,000 Russian-language scientific articles from various subject domains (physics, mathematics, biology, medicine, computer science) was collected and preprocessed from open sources (CyberLeninka, Habr Science). Experimental evaluation on a test set of 150 documents showed that the proposed model outperforms existing ruT5 and mBART models. The custom tokenizer reduced the number of tokens per 1000 characters by 13–19% and decreased the unknown-rate by 2,5–3,4 times. The model contains 54 million parameters, is 7,3 times faster on CPU inference compared to mBART, and achieves better coverage of long documents (>2048 tokens) at 74%. Summarization quality, measured by ROUGE metrics, reached ROUGE-1 = 34,8%, ROUGE-2 = 16,2%, and ROUGE-L = 30,1%, which confirms the effectiveness of the proposed hierarchical architecture for the task of automatic summarization of Russian-language scientific text.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|