Details
| Title | Разработка интеллектуальных алгоритмов анализа выразительности чтения по текстам с учетом пунктуации: выпускная квалификационная работа магистра: направление 02.04.01 «Математика и компьютерные науки» ; образовательная программа 02.04.01_03 «Искусственный интеллект и машинное обучение» = Development of Intelligent Algorithms for Reading Prosody Analysis Based on Text and Punctuation |
|---|---|
| Creators | Бакастов Иван Андреевич |
| Scientific adviser | Лукашин Алексей Андреевич |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | выразительность чтения ; просодика русской речи ; пунктуация ; multi-task обучение ; ruRoBERTa-large ; reading expressiveness ; russian speech prosody ; punctuation ; multi-task learning |
| Document type | Master graduation qualification work |
| Language | Russian |
| Level of education | Master |
| Speciality code (FGOS) | 02.04.01 |
| Speciality group (FGOS) | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-4412 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\44714 |
| Record create date | 9/4/2026 |
Allowed Actions
–
Action 'Read' will be available if administrator prepare required files
Action 'Download' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
Работа посвящена разработке интеллектуальных алгоритмов анализа выразительности чтения вслух по текстам с учетом пунктуации. Объект исследования просодические характеристики русскоязычного художественного чтения, предмет алгоритмы прогноза временных и акустических параметров речи по пунктуационной структуре текста и оценки выразительности аудиозаписи. Методология включает форсированное выравнивание текста и аудио системой WhisperX, извлечение основного тона и энергии библиотекой librosa, per-speaker z-нормализацию и предобученную языковую модель ruRoBERTa-large. Сформирован корпус LibriVox-12 объемом 533160 токенов из 440 глав 12 произведений русской классики, дополненный для обратной задачи 24 TTS-озвучками 12 глав test-сплита (два голоса Silero v4). Обучены три модели прямой задачи: бинарная (Test ROC-AUC=0.842), мульти-классовая по длительности паузы (F1macro =0.399) и multi-task FastSpeech 2-style с четырьмя выходными головами (Test ROC-AUC=0.853, Recall=78%, MAE прогноза 𝐹0 в z-шкале0.899). Для обратной задачи предложен и валидирован метод прокси-разметки «живое чтение vs TTS»: LightGBM-классификатор на 11 сводных статистиках просодики целого фрагмента чтения (IQR энергии, std длительности, доля длинных пауз и др.) с Leave-One-Group-Out CV дает accuracy=0.972 и эмпирически подтверждает, что выразительность речи сосредоточена в ширине распределений просодических признаков. Результаты применимы в тренажерах выразительного чтения, образовательных технологиях и при разработке русскоязычных TTS-систем актерского уровня.
This thesis develops intelligent algorithms for analyzing reading expressiveness from text and punctuation. The research object is the prosodic characteristics of Russian artistic reading; the subject is algorithms for predicting temporal and acoustic speech parameters from punctuation structure and for evaluating audio expressiveness. The methodology combines forced text-to-audio alignment with WhisperX, F0 and energy extraction via librosa, per-speaker z-normalization, and the pretrained language model ruRoBERTa-large. A LibriVox-12 corpus of 533,160 tokens covering 440 chapters of 12 Russian classical works was assembled and augmented, for the inverse task, with 24 TTS readings of 12 test-split chapters (two Silero v4 voices). Three direct-task models were trained: a binary pause detector (Test ROC-AUC=0.842), a multi-class pause-duration classifier (macro-F1=0.399), and a FastSpeech 2-style multi-task model with four output heads (Test ROC-AUC=0.853, Recall=78%, MAE of F0 prediction in z-scale = 0.899). For the inverse task, a proxy labeling method “live reading vs TTS” was proposed and validated: a LightGBM classifier on 11 summary per-reading prosodic statistics (energy IQR, duration std, fraction of long pauses, etc.) with Leave-One-Group-Out cross-validation reached accuracy=0.972, empirically confirming that reading expressiveness is concentrated in the spread of prosodic distributions rather than in their means. The results are applicable to expressive-reading training tools, educational technology, and the development of expressive Russian TTS systems.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|