Детальная информация

Название Разработка интеллектуальной системы идентификации по голосу с элементами речевой проверки подлинности: выпускная квалификационная работа магистра: направление 09.04.04 «Программная инженерия» ; образовательная программа 09.04.04_02 «Основы анализа и разработки приложений с большими объемами распределенных данных» = Development of an intelligent voice identification system with elements of speech authenticity verification
Авторы Норец Денис Игоревич
Научный руководитель Молодяков Сергей Александрович
Организация Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Выходные сведения Санкт-Петербург, 2026
Коллекция Выпускные квалификационные работы ; Общая коллекция
Тематика идентификация по голосу ; биометрия ; распознавание диктора ; проверка подлинности речи ; anti-spoofing ; challenge-response ; глубокое ; обучение ; аудио-дипфейк ; voice identification ; biometrics ; speaker recognition ; speech ; authenticity ; deep learning ; audio deepfake
Тип документа Выпускная квалификационная работа магистра
Язык Русский
Уровень высшего образования Магистратура
Код специальности ФГОС 09.04.04
Группа специальностей ФГОС 090000 - Информатика и вычислительная техника
DOI 10.18720/SPBPU/3/2026/vr/vr26-4910
Права доступа Доступ по паролю из сети Интернет (чтение, печать, копирование)
Дополнительно Новинка
Ключ записи ru\spstu\vkr\45083
Дата создания записи 04.09.2026

Разрешенные действия

Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Группа Анонимные пользователи
Сеть Интернет

Объект исследования — системы биометрической идентификации по голосу и проверки подлинности речи. Цель работы — разработать масштабируемую модульную систему идентификации диктора с элементами речевой проверки подлинности и экспериментально оценить её качество. В работе спроектирована и реализована система, объединяющая три рубежа защиты — идентификацию диктора по нейросетевым эмбеддингам ECAPATDNN, анти-спуфинг на самообучаемом детекторе SSL-AASIST и текстозависимую проверку по случайной фразе (challenge-response) — в единый каскад принятия решения, работающий в пределах 4 ГБ видеопамяти. Проведено экспериментальное исследование на открытых корпусах: равная вероятность ошибок идентификации составила 0,90 % на VoxCeleb, перенос детектора на реальные аудио-дипфейки дал 10,46 %, сквозной допуск каскада — 80,8 %. Выполнены сравнение моделей по принципу «рассмотрено — выбрано — почему» и техникоэкономическое обоснование. Научная новизна состоит в методике каскадной проверки подлинности говорящего и её проверке на независимых данных, включая реальные аудиодипфейки; определены направления повышения устойчивости голосовой биометрии к современному синтезу речи. Область применения — системы контроля доступа, банковская и телефонная аутентификация, кол-центры, антифрод и форензика, противодействие аудио-дипфейкам. В работе использованы следующие информационные технологии и программные средства: язык программирования Python 3.11; библиотеки глубокого обучения PyTorch, SpeechBrain и Hugging Face Transformers; веб-фреймворк FastAPI; средства контейнеризации и публикации Docker и Caddy; система управления базами данных SQLite; виртуальный сервер (VPS), размещённый на территории России.

The object of research is voice biometric identification and speech authenticity verification. The aim of the work is to develop a scalable modular system for speaker identification with elements of speech authenticity verification and to evaluate its quality experimentally. A system has been designed and implemented that combines three protection stages — speaker identification via ECAPA-TDNN neural embeddings, anti-spoofing based on the self-supervised SSL-AASIST detector, and a text-dependent randomphrase check (challenge-response) — into a single decision cascade running within 4 GB of video memory. Experimental evaluation on public corpora yielded an identification equal error rate of 0.90 % on VoxCeleb, a cross-dataset error of 10.46% on real audio deepfakes, and an end-to-end cascade acceptance of 80.8 %. A model comparison following the «considered — chosen — why» approach and a feasibility study were carried out. The scientific novelty lies in the cascade methodology for speaker authenticity verification and its assessment on independent data, including real audio deepfakes; directions for improving the robustness of voice biometrics against modern speech synthesis are identified. Application areas include access control, banking and telephone authentication, call centres, anti-fraud and forensics, and countering audio deepfakes. The following information technologies and software tools were used: the Python 3.11 programming language; the deep-learning libraries PyTorch, SpeechBrain, and Hugging Face Transformers; the FastAPI web framework; the Docker and Caddy tools for containerisation and publishing; the SQLite database management system; and a virtual private server (VPS) located in Russia.

Место доступа Группа пользователей Действие
Локальная сеть ИБК СПбПУ Все
Прочитать Печать Загрузить
Интернет Авторизованные пользователи СПбПУ
Прочитать Печать Загрузить
Интернет Анонимные пользователи
...