Детальная информация
| Название | Исследование и реализация методов акустической оценки темпа речи: выпускная квалификационная работа бакалавра: направление 02.03.01 «Математика и компьютерные науки» ; образовательная программа 02.03.01_01 «Системы искусственного интеллекта и суперкомпьютерные технологии» = Development of a software complex for the acoustic evaluation of Russian speech tempo based on neural network models |
|---|---|
| Авторы | Григорьев Пётр Михайлович |
| Научный руководитель | Мулюха Владимир Александрович |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | темп речи ; машинное обучение ; акустический анализ ; распознавание речи ; скорость артикуляции ; скорость речи ; whisper ; принудительное выравнивание ; динамическое окно ; вейвлет-преобразование ; speech tempo ; articulation rate ; speech rate ; acoustic analysis ; speech recognition ; forced alignment ; dynamic window ; wavelet transform |
| Тип документа | Выпускная квалификационная работа бакалавра |
| Язык | Русский |
| Уровень высшего образования | Бакалавриат |
| Код специальности ФГОС | 02.03.01 |
| Группа специальностей ФГОС | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-1940 |
| Права доступа | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\42518 |
| Дата создания записи | 21.08.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
Целью работы является исследование и реализация методов акустической оценки темпа речи с последующим созданием программного продукта для автоматизации этого процесса. Объектом исследования выступают аудиозаписи спонтанной и читаемой русской речи. Предметом исследования являются алгоритмы автоматического распознавания речи (ASR), методы принудительного выравнивания (Forced Alignment) и подходы к вычислению локальных и глобальных темповых характеристик. Практическая значимость работы заключается в создании автономного оффлайн-инструмента, способного с высокой точностью оценивать скорость артикуляции (AR) и скорость речи (SR) с возможностью интерактивного визуального и спектрального анализа. В работе предложена и реализована двухэтапная архитектура конвейера обработки, использующая акустическую модель Whisper для получения черновой транскрипции и модель WhisperX для точного посимвольного выравнивания на базе эталонного текста, скорректированного пользователем. Исследовано влияние размера динамического временного окна на сглаживание графика темпа. Описан алгоритм событийного расчета темпа речи (Event-based), позволяющий проводить микрофонетический анализ на уровне слогов и фонем. Реализован интерактивный веб-интерфейс, предоставляющий возможности анализа тепловой карты текста и ритмической структуры посредством быстрого преобразования Фурье и непрерывного вейвлет-преобразования. Экспериментально подтверждена вычислительная эффективность системы, показатель Real-Time Factor (RTF) составил 0.23 на графическом ускорителе.
The purpose of the work is the research and implementation of methods for the acoustic evaluation of speech tempo, followed by the creation of a software product to automate this process. The object of the study is audio recordings of spontaneous and read Russian speech. The subject of the study includes automatic speech recognition (ASR) algorithms, forced alignment methods, and approaches to calculating local and global tempo characteristics. The practical significance of the work lies in the creation of an autonomous offline tool capable of highly accurate estimation of articulation rate (AR) and speech rate (SR) with the possibility of interactive visual and spectral analysis. The paper proposes and implements a two-stage processing pipeline architecture using the Whisper acoustic model to obtain a draft transcription and the WhisperX model for accurate character-level alignment based on a reference text corrected by the user. The influence of the dynamic time window size on the smoothing of the tempo graph is investigated. An event-based algorithm for calculating speech tempo is described, which allows micro-phonetic analysis at the level of syllables and phonemes. An interactive web interface has been implemented, providing capabilities for analyzing text heatmaps and rhythmic structure through the Fast Fourier Transform and Continuous Wavelet Transform. The computational efficiency of the system was experimentally confirmed; the Real-Time Factor (RTF) was 0.23 on a graphics accelerator.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|
- Введение
- Глава 1. Анализ литературных источников и постановка задачи исследования
- Эволюция методов оценки темпа речи: историческая справка
- Обзор понятий и метрик темпа речи
- Фонологические особенности русского слога и теория сонорности
- Характеристики аудиозаписей речи, влияющие на оценку темпа
- Обзор алгоритмических подходов к оценке темпа
- Анализ существующих программных решений
- Анализ требований к разрабатываемой системе
- Постановка задачи и план экспериментов
- Глава 2. Модели и алгоритмические подходы
- Общая архитектура программного конвейера
- Математическое описание предобработки аудио и детекции речи
- Математический аппарат моделей транскрибации
- Алгоритм Витерби и принудительное выравнивание
- Алгоритм расчета метрик и сглаживания временных рядов
- Частотно-временной анализ рядов темпа
- Глава 3. Проектирование и реализация программного конвейера
- Выбор и обоснование технологического стека
- Проектирование базы данных и объектно-реляционное отображение
- Паттерн «Адаптер» и архитектура абстрактных интерфейсов
- Математическая реализация ядра конвейера (SpeechTempoPipeline)
- Программный интерфейс (REST API) и маршрутизация
- Сценарии использования и интерфейс веб-приложения
- Глава 4. Реализация и анализ результатов экспериментов
- Описание аппаратно-программной среды
- Подготовка тестового набора данных
- Эксперимент 1: Исследование длины временного окна при анализе поэтического текста
- Эксперимент 2: Фонетический анализ в событийном режиме (Event-based)
- Эксперимент 3: Оценка производительности (Real-Time Factor)
- Эксперимент 4: Спектральный анализ временного ряда темпа
- Выводы по четвертой главе
- Заключение
- Список использованных источников