Детальная информация
| Название | Разработка интеллектуальной системы идентификации по голосу с элементами речевой проверки подлинности: выпускная квалификационная работа магистра: направление 09.04.04 «Программная инженерия» ; образовательная программа 09.04.04_02 «Основы анализа и разработки приложений с большими объемами распределенных данных» = Development of an intelligent voice identification system with elements of speech authenticity verification |
|---|---|
| Авторы | Норец Денис Игоревич |
| Научный руководитель | Молодяков Сергей Александрович |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | идентификация по голосу ; биометрия ; распознавание диктора ; проверка подлинности речи ; anti-spoofing ; challenge-response ; глубокое ; обучение ; аудио-дипфейк ; voice identification ; biometrics ; speaker recognition ; speech ; authenticity ; deep learning ; audio deepfake |
| Тип документа | Выпускная квалификационная работа магистра |
| Язык | Русский |
| Уровень высшего образования | Магистратура |
| Код специальности ФГОС | 09.04.04 |
| Группа специальностей ФГОС | 090000 - Информатика и вычислительная техника |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-4910 |
| Права доступа | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\45083 |
| Дата создания записи | 04.09.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
Объект исследования — системы биометрической идентификации по голосу и проверки подлинности речи. Цель работы — разработать масштабируемую модульную систему идентификации диктора с элементами речевой проверки подлинности и экспериментально оценить её качество. В работе спроектирована и реализована система, объединяющая три рубежа защиты — идентификацию диктора по нейросетевым эмбеддингам ECAPATDNN, анти-спуфинг на самообучаемом детекторе SSL-AASIST и текстозависимую проверку по случайной фразе (challenge-response) — в единый каскад принятия решения, работающий в пределах 4 ГБ видеопамяти. Проведено экспериментальное исследование на открытых корпусах: равная вероятность ошибок идентификации составила 0,90 % на VoxCeleb, перенос детектора на реальные аудио-дипфейки дал 10,46 %, сквозной допуск каскада — 80,8 %. Выполнены сравнение моделей по принципу «рассмотрено — выбрано — почему» и техникоэкономическое обоснование. Научная новизна состоит в методике каскадной проверки подлинности говорящего и её проверке на независимых данных, включая реальные аудиодипфейки; определены направления повышения устойчивости голосовой биометрии к современному синтезу речи. Область применения — системы контроля доступа, банковская и телефонная аутентификация, кол-центры, антифрод и форензика, противодействие аудио-дипфейкам. В работе использованы следующие информационные технологии и программные средства: язык программирования Python 3.11; библиотеки глубокого обучения PyTorch, SpeechBrain и Hugging Face Transformers; веб-фреймворк FastAPI; средства контейнеризации и публикации Docker и Caddy; система управления базами данных SQLite; виртуальный сервер (VPS), размещённый на территории России.
The object of research is voice biometric identification and speech authenticity verification. The aim of the work is to develop a scalable modular system for speaker identification with elements of speech authenticity verification and to evaluate its quality experimentally. A system has been designed and implemented that combines three protection stages — speaker identification via ECAPA-TDNN neural embeddings, anti-spoofing based on the self-supervised SSL-AASIST detector, and a text-dependent randomphrase check (challenge-response) — into a single decision cascade running within 4 GB of video memory. Experimental evaluation on public corpora yielded an identification equal error rate of 0.90 % on VoxCeleb, a cross-dataset error of 10.46% on real audio deepfakes, and an end-to-end cascade acceptance of 80.8 %. A model comparison following the «considered — chosen — why» approach and a feasibility study were carried out. The scientific novelty lies in the cascade methodology for speaker authenticity verification and its assessment on independent data, including real audio deepfakes; directions for improving the robustness of voice biometrics against modern speech synthesis are identified. Application areas include access control, banking and telephone authentication, call centres, anti-fraud and forensics, and countering audio deepfakes. The following information technologies and software tools were used: the Python 3.11 programming language; the deep-learning libraries PyTorch, SpeechBrain, and Hugging Face Transformers; the FastAPI web framework; the Docker and Caddy tools for containerisation and publishing; the SQLite database management system; and a virtual private server (VPS) located in Russia.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|