Details
| Title | Разработка интеллектуальной системы идентификации по голосу с элементами речевой проверки подлинности: выпускная квалификационная работа магистра: направление 09.04.04 «Программная инженерия» ; образовательная программа 09.04.04_02 «Основы анализа и разработки приложений с большими объемами распределенных данных» = Development of an intelligent voice identification system with elements of speech authenticity verification |
|---|---|
| Creators | Норец Денис Игоревич |
| Scientific adviser | Молодяков Сергей Александрович |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | идентификация по голосу ; биометрия ; распознавание диктора ; проверка подлинности речи ; anti-spoofing ; challenge-response ; глубокое ; обучение ; аудио-дипфейк ; voice identification ; biometrics ; speaker recognition ; speech ; authenticity ; deep learning ; audio deepfake |
| Document type | Master graduation qualification work |
| Language | Russian |
| Level of education | Master |
| Speciality code (FGOS) | 09.04.04 |
| Speciality group (FGOS) | 090000 - Информатика и вычислительная техника |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-4910 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\45083 |
| Record create date | 9/4/2026 |
Allowed Actions
–
Action 'Read' will be available if you login or access site from another network
Action 'Download' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
Объект исследования — системы биометрической идентификации по голосу и проверки подлинности речи. Цель работы — разработать масштабируемую модульную систему идентификации диктора с элементами речевой проверки подлинности и экспериментально оценить её качество. В работе спроектирована и реализована система, объединяющая три рубежа защиты — идентификацию диктора по нейросетевым эмбеддингам ECAPATDNN, анти-спуфинг на самообучаемом детекторе SSL-AASIST и текстозависимую проверку по случайной фразе (challenge-response) — в единый каскад принятия решения, работающий в пределах 4 ГБ видеопамяти. Проведено экспериментальное исследование на открытых корпусах: равная вероятность ошибок идентификации составила 0,90 % на VoxCeleb, перенос детектора на реальные аудио-дипфейки дал 10,46 %, сквозной допуск каскада — 80,8 %. Выполнены сравнение моделей по принципу «рассмотрено — выбрано — почему» и техникоэкономическое обоснование. Научная новизна состоит в методике каскадной проверки подлинности говорящего и её проверке на независимых данных, включая реальные аудиодипфейки; определены направления повышения устойчивости голосовой биометрии к современному синтезу речи. Область применения — системы контроля доступа, банковская и телефонная аутентификация, кол-центры, антифрод и форензика, противодействие аудио-дипфейкам. В работе использованы следующие информационные технологии и программные средства: язык программирования Python 3.11; библиотеки глубокого обучения PyTorch, SpeechBrain и Hugging Face Transformers; веб-фреймворк FastAPI; средства контейнеризации и публикации Docker и Caddy; система управления базами данных SQLite; виртуальный сервер (VPS), размещённый на территории России.
The object of research is voice biometric identification and speech authenticity verification. The aim of the work is to develop a scalable modular system for speaker identification with elements of speech authenticity verification and to evaluate its quality experimentally. A system has been designed and implemented that combines three protection stages — speaker identification via ECAPA-TDNN neural embeddings, anti-spoofing based on the self-supervised SSL-AASIST detector, and a text-dependent randomphrase check (challenge-response) — into a single decision cascade running within 4 GB of video memory. Experimental evaluation on public corpora yielded an identification equal error rate of 0.90 % on VoxCeleb, a cross-dataset error of 10.46% on real audio deepfakes, and an end-to-end cascade acceptance of 80.8 %. A model comparison following the «considered — chosen — why» approach and a feasibility study were carried out. The scientific novelty lies in the cascade methodology for speaker authenticity verification and its assessment on independent data, including real audio deepfakes; directions for improving the robustness of voice biometrics against modern speech synthesis are identified. Application areas include access control, banking and telephone authentication, call centres, anti-fraud and forensics, and countering audio deepfakes. The following information technologies and software tools were used: the Python 3.11 programming language; the deep-learning libraries PyTorch, SpeechBrain, and Hugging Face Transformers; the FastAPI web framework; the Docker and Caddy tools for containerisation and publishing; the SQLite database management system; and a virtual private server (VPS) located in Russia.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|