Details
| Title | Разработка нейросетевой модели обнаружения речевой активности в акустическом сигнале с применением архитектуры трансформеров: выпускная квалификационная работа магистра: направление 09.04.01 «Информатика и вычислительная техника» ; образовательная программа 09.04.01_15 «Технологии проектирования системного и прикладного программного обеспечения» = Development of a neural network model for detecting speech activity in an acoustic signal using the transformer architecture |
|---|---|
| Creators | Киселев Александр Андреевич |
| Scientific adviser | Богач Наталья Владимировна |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2024 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | обнаружение речевой активности ; архитектура трансформеров ; акустический сигнал ; мел-частотные кепстральные коэффициенты ; фильтры спектро-временной модуляции ; voice activity detection ; transformer architecture ; acoustic signal ; mel-frequency cepstral coefficients ; filters of spectro-temporal modulation |
| Document type | Master graduation qualification work |
| Language | Russian |
| Level of education | Master |
| Speciality code (FGOS) | 09.04.01 |
| Speciality group (FGOS) | 090000 - Информатика и вычислительная техника |
| DOI | 10.18720/SPBPU/3/2024/vr/vr24-3920 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Record key | ru\spstu\vkr\33139 |
| Record create date | 8/29/2024 |
Allowed Actions
–
Action 'Read' will be available if you login or access site from another network
Action 'Download' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
Целью работы является создание нейросетевой модели обнаружения речевой активности с применением архитектуры трансформеров. Для достижения цели были поставлены следующие задачи: описание проблемы разделения речи и звука, обзор особенностей акустических признаков аудиосигнала, выбор архитектуры трансформеров и акустических признаков для модели, обзор аналогов для задачи обнаружения речевой активности, а также сравнение полученной модели обнаружения речевой активности с аналогами. В работе приведено описание проблемы разделения речи и звука, выполнен обзор особенностей акустических признаков аудиосигнала. Обоснован выбор архитектуры трансформеров и акустических признаков для модели. Для модели подобраны глобальные параметры и метрики оценки качества. В результате сравнения модели с существующими аналогами оказалось, что модель обладает высокими показателями метрики F1, равной 0.94, метрики ROC AUC, равной 0.94, и низким значением метрики SDT, равной 19 мс. Модель может быть использована для начального этапа задачи распознавания речи, а также в голосовых помощниках и в системах голосового управления.
The aim of the work is to create a neural network model for detecting speech activity using the transformer architecture. To achieve this goal, the following tasks were set: a description of the problem of separation of speech and sound, an overview of the features of acoustic features of the audio signal, the choice of transformer architecture and acoustic features for the model, an overview of analogues for the task of detecting speech activity, as well as a comparison of the obtained model of detecting speech activity with analogues. The paper describes the problem of separation of speech and sound, and provides an overview of the features of the acoustic features of the audio signal. The choice of transformer architecture and acoustic features for the model is justified. Global parameters and quality assessment metrics have been selected for the model. As a result of comparing the model with existing analogues, it turned out that the model has high values of the F1 metric equal to 0.94, the ROC AUC metric equal to 0.94, and a low value of the SDT metric equal to 19 ms. The model can be used as an initial stage of the speech recognition task, as well as in voice assistants and voice control systems.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|