Детальная информация

Название Разработка интеллектуальных алгоритмов анализа выразительности чтения по текстам с учетом пунктуации: выпускная квалификационная работа магистра: направление 02.04.01 «Математика и компьютерные науки» ; образовательная программа 02.04.01_03 «Искусственный интеллект и машинное обучение» = Development of Intelligent Algorithms for Reading Prosody Analysis Based on Text and Punctuation
Авторы Бакастов Иван Андреевич
Научный руководитель Лукашин Алексей Андреевич
Организация Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Выходные сведения Санкт-Петербург, 2026
Коллекция Выпускные квалификационные работы ; Общая коллекция
Тематика выразительность чтения ; просодика русской речи ; пунктуация ; multi-task обучение ; ruRoBERTa-large ; reading expressiveness ; russian speech prosody ; punctuation ; multi-task learning
Тип документа Выпускная квалификационная работа магистра
Язык Русский
Уровень высшего образования Магистратура
Код специальности ФГОС 02.04.01
Группа специальностей ФГОС 020000 - Компьютерные и информационные науки
DOI 10.18720/SPBPU/3/2026/vr/vr26-4412
Права доступа Доступ по паролю из сети Интернет (чтение, печать, копирование)
Дополнительно Новинка
Ключ записи ru\spstu\vkr\44714
Дата создания записи 04.09.2026

Разрешенные действия

Действие 'Прочитать' будет возможно после подготовки администраторами необходимых файлов

Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Группа Анонимные пользователи
Сеть Интернет

Работа посвящена разработке интеллектуальных алгоритмов анализа выразительности чтения вслух по текстам с учетом пунктуации. Объект исследования просодические характеристики русскоязычного художественного чтения, предмет алгоритмы прогноза временных и акустических параметров речи по пунктуационной структуре текста и оценки выразительности аудиозаписи. Методология включает форсированное выравнивание текста и аудио системой WhisperX, извлечение основного тона и энергии библиотекой librosa, per-speaker z-нормализацию и предобученную языковую модель ruRoBERTa-large. Сформирован корпус LibriVox-12 объемом 533160 токенов из 440 глав 12 произведений русской классики, дополненный для обратной задачи 24 TTS-озвучками 12 глав test-сплита (два голоса Silero v4). Обучены три модели прямой задачи: бинарная (Test ROC-AUC=0.842), мульти-классовая по длительности паузы (F1macro =0.399) и multi-task FastSpeech 2-style с четырьмя выходными головами (Test ROC-AUC=0.853, Recall=78%, MAE прогноза 𝐹0 в z-шкале0.899). Для обратной задачи предложен и валидирован метод прокси-разметки «живое чтение vs TTS»: LightGBM-классификатор на 11 сводных статистиках просодики целого фрагмента чтения (IQR энергии, std длительности, доля длинных пауз и др.) с Leave-One-Group-Out CV дает accuracy=0.972 и эмпирически подтверждает, что выразительность речи сосредоточена в ширине распределений просодических признаков. Результаты применимы в тренажерах выразительного чтения, образовательных технологиях и при разработке русскоязычных TTS-систем актерского уровня.

This thesis develops intelligent algorithms for analyzing reading expressiveness from text and punctuation. The research object is the prosodic characteristics of Russian artistic reading; the subject is algorithms for predicting temporal and acoustic speech parameters from punctuation structure and for evaluating audio expressiveness. The methodology combines forced text-to-audio alignment with WhisperX, F0 and energy extraction via librosa, per-speaker z-normalization, and the pretrained language model ruRoBERTa-large. A LibriVox-12 corpus of 533,160 tokens covering 440 chapters of 12 Russian classical works was assembled and augmented, for the inverse task, with 24 TTS readings of 12 test-split chapters (two Silero v4 voices). Three direct-task models were trained: a binary pause detector (Test ROC-AUC=0.842), a multi-class pause-duration classifier (macro-F1=0.399), and a FastSpeech 2-style multi-task model with four output heads (Test ROC-AUC=0.853, Recall=78%, MAE of F0 prediction in z-scale = 0.899). For the inverse task, a proxy labeling method “live reading vs TTS” was proposed and validated: a LightGBM classifier on 11 summary per-reading prosodic statistics (energy IQR, duration std, fraction of long pauses, etc.) with Leave-One-Group-Out cross-validation reached accuracy=0.972, empirically confirming that reading expressiveness is concentrated in the spread of prosodic distributions rather than in their means. The results are applicable to expressive-reading training tools, educational technology, and the development of expressive Russian TTS systems.

Место доступа Группа пользователей Действие
Локальная сеть ИБК СПбПУ Все
Загрузить
Интернет Авторизованные пользователи СПбПУ
Загрузить
Интернет Анонимные пользователи
...