Details

Title Разработка интеллектуальной системы идентификации по голосу с элементами речевой проверки подлинности: выпускная квалификационная работа магистра: направление 09.04.04 «Программная инженерия» ; образовательная программа 09.04.04_02 «Основы анализа и разработки приложений с большими объемами распределенных данных» = Development of an intelligent voice identification system with elements of speech authenticity verification
Creators Норец Денис Игоревич
Scientific adviser Молодяков Сергей Александрович
Organization Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects идентификация по голосу ; биометрия ; распознавание диктора ; проверка подлинности речи ; anti-spoofing ; challenge-response ; глубокое ; обучение ; аудио-дипфейк ; voice identification ; biometrics ; speaker recognition ; speech ; authenticity ; deep learning ; audio deepfake
Document type Master graduation qualification work
Language Russian
Level of education Master
Speciality code (FGOS) 09.04.04
Speciality group (FGOS) 090000 - Информатика и вычислительная техника
DOI 10.18720/SPBPU/3/2026/vr/vr26-4910
Rights Доступ по паролю из сети Интернет (чтение, печать, копирование)
Additionally New arrival
Record key ru\spstu\vkr\45083
Record create date 9/4/2026

Allowed Actions

Action 'Read' will be available if you login or access site from another network

Action 'Download' will be available if you login or access site from another network

Group Anonymous
Network Internet

Объект исследования — системы биометрической идентификации по голосу и проверки подлинности речи. Цель работы — разработать масштабируемую модульную систему идентификации диктора с элементами речевой проверки подлинности и экспериментально оценить её качество. В работе спроектирована и реализована система, объединяющая три рубежа защиты — идентификацию диктора по нейросетевым эмбеддингам ECAPATDNN, анти-спуфинг на самообучаемом детекторе SSL-AASIST и текстозависимую проверку по случайной фразе (challenge-response) — в единый каскад принятия решения, работающий в пределах 4 ГБ видеопамяти. Проведено экспериментальное исследование на открытых корпусах: равная вероятность ошибок идентификации составила 0,90 % на VoxCeleb, перенос детектора на реальные аудио-дипфейки дал 10,46 %, сквозной допуск каскада — 80,8 %. Выполнены сравнение моделей по принципу «рассмотрено — выбрано — почему» и техникоэкономическое обоснование. Научная новизна состоит в методике каскадной проверки подлинности говорящего и её проверке на независимых данных, включая реальные аудиодипфейки; определены направления повышения устойчивости голосовой биометрии к современному синтезу речи. Область применения — системы контроля доступа, банковская и телефонная аутентификация, кол-центры, антифрод и форензика, противодействие аудио-дипфейкам. В работе использованы следующие информационные технологии и программные средства: язык программирования Python 3.11; библиотеки глубокого обучения PyTorch, SpeechBrain и Hugging Face Transformers; веб-фреймворк FastAPI; средства контейнеризации и публикации Docker и Caddy; система управления базами данных SQLite; виртуальный сервер (VPS), размещённый на территории России.

The object of research is voice biometric identification and speech authenticity verification. The aim of the work is to develop a scalable modular system for speaker identification with elements of speech authenticity verification and to evaluate its quality experimentally. A system has been designed and implemented that combines three protection stages — speaker identification via ECAPA-TDNN neural embeddings, anti-spoofing based on the self-supervised SSL-AASIST detector, and a text-dependent randomphrase check (challenge-response) — into a single decision cascade running within 4 GB of video memory. Experimental evaluation on public corpora yielded an identification equal error rate of 0.90 % on VoxCeleb, a cross-dataset error of 10.46% on real audio deepfakes, and an end-to-end cascade acceptance of 80.8 %. A model comparison following the «considered — chosen — why» approach and a feasibility study were carried out. The scientific novelty lies in the cascade methodology for speaker authenticity verification and its assessment on independent data, including real audio deepfakes; directions for improving the robustness of voice biometrics against modern speech synthesis are identified. Application areas include access control, banking and telephone authentication, call centres, anti-fraud and forensics, and countering audio deepfakes. The following information technologies and software tools were used: the Python 3.11 programming language; the deep-learning libraries PyTorch, SpeechBrain, and Hugging Face Transformers; the FastAPI web framework; the Docker and Caddy tools for containerisation and publishing; the SQLite database management system; and a virtual private server (VPS) located in Russia.

Network User group Action
ILC SPbPU Local Network All
Read Print Download
Internet Authorized users SPbPU
Read Print Download
Internet Anonymous
...