Details

Title Разработка интеллектуальных алгоритмов анализа выразительности чтения по текстам с учетом пунктуации: выпускная квалификационная работа магистра: направление 02.04.01 «Математика и компьютерные науки» ; образовательная программа 02.04.01_03 «Искусственный интеллект и машинное обучение» = Development of Intelligent Algorithms for Reading Prosody Analysis Based on Text and Punctuation
Creators Бакастов Иван Андреевич
Scientific adviser Лукашин Алексей Андреевич
Organization Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects выразительность чтения ; просодика русской речи ; пунктуация ; multi-task обучение ; ruRoBERTa-large ; reading expressiveness ; russian speech prosody ; punctuation ; multi-task learning
Document type Master graduation qualification work
Language Russian
Level of education Master
Speciality code (FGOS) 02.04.01
Speciality group (FGOS) 020000 - Компьютерные и информационные науки
DOI 10.18720/SPBPU/3/2026/vr/vr26-4412
Rights Доступ по паролю из сети Интернет (чтение, печать, копирование)
Additionally New arrival
Record key ru\spstu\vkr\44714
Record create date 9/4/2026

Allowed Actions

Action 'Read' will be available if administrator prepare required files

Action 'Download' will be available if you login or access site from another network

Group Anonymous
Network Internet

Работа посвящена разработке интеллектуальных алгоритмов анализа выразительности чтения вслух по текстам с учетом пунктуации. Объект исследования просодические характеристики русскоязычного художественного чтения, предмет алгоритмы прогноза временных и акустических параметров речи по пунктуационной структуре текста и оценки выразительности аудиозаписи. Методология включает форсированное выравнивание текста и аудио системой WhisperX, извлечение основного тона и энергии библиотекой librosa, per-speaker z-нормализацию и предобученную языковую модель ruRoBERTa-large. Сформирован корпус LibriVox-12 объемом 533160 токенов из 440 глав 12 произведений русской классики, дополненный для обратной задачи 24 TTS-озвучками 12 глав test-сплита (два голоса Silero v4). Обучены три модели прямой задачи: бинарная (Test ROC-AUC=0.842), мульти-классовая по длительности паузы (F1macro =0.399) и multi-task FastSpeech 2-style с четырьмя выходными головами (Test ROC-AUC=0.853, Recall=78%, MAE прогноза 𝐹0 в z-шкале0.899). Для обратной задачи предложен и валидирован метод прокси-разметки «живое чтение vs TTS»: LightGBM-классификатор на 11 сводных статистиках просодики целого фрагмента чтения (IQR энергии, std длительности, доля длинных пауз и др.) с Leave-One-Group-Out CV дает accuracy=0.972 и эмпирически подтверждает, что выразительность речи сосредоточена в ширине распределений просодических признаков. Результаты применимы в тренажерах выразительного чтения, образовательных технологиях и при разработке русскоязычных TTS-систем актерского уровня.

This thesis develops intelligent algorithms for analyzing reading expressiveness from text and punctuation. The research object is the prosodic characteristics of Russian artistic reading; the subject is algorithms for predicting temporal and acoustic speech parameters from punctuation structure and for evaluating audio expressiveness. The methodology combines forced text-to-audio alignment with WhisperX, F0 and energy extraction via librosa, per-speaker z-normalization, and the pretrained language model ruRoBERTa-large. A LibriVox-12 corpus of 533,160 tokens covering 440 chapters of 12 Russian classical works was assembled and augmented, for the inverse task, with 24 TTS readings of 12 test-split chapters (two Silero v4 voices). Three direct-task models were trained: a binary pause detector (Test ROC-AUC=0.842), a multi-class pause-duration classifier (macro-F1=0.399), and a FastSpeech 2-style multi-task model with four output heads (Test ROC-AUC=0.853, Recall=78%, MAE of F0 prediction in z-scale = 0.899). For the inverse task, a proxy labeling method “live reading vs TTS” was proposed and validated: a LightGBM classifier on 11 summary per-reading prosodic statistics (energy IQR, duration std, fraction of long pauses, etc.) with Leave-One-Group-Out cross-validation reached accuracy=0.972, empirically confirming that reading expressiveness is concentrated in the spread of prosodic distributions rather than in their means. The results are applicable to expressive-reading training tools, educational technology, and the development of expressive Russian TTS systems.

Network User group Action
ILC SPbPU Local Network All
Download
Internet Authorized users SPbPU
Download
Internet Anonymous
...