Детальная информация
| Название | Автоматическая стенография и протоколирование совещаний: выпускная квалификационная работа бакалавра: направление 02.03.01 «Математика и компьютерные науки» ; образовательная программа 02.03.01_01 «Системы искусственного интеллекта и суперкомпьютерные технологии» = Transcription, speaker diarization, and summarization algorithms and models used to build meeting protocols for the Russian language |
|---|---|
| Авторы | Тищенко Артём Андреевич |
| Научный руководитель | Мулюха Владимир Александрович |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | протоколирование совещаний ; транскрибация ; диаризация ; суммаризация ; распознавание речи ; большая языковая модель ; русскоязычный датасет ; meeting protocoling ; transcription ; diarization ; summarization ; speech recognition ; large language model ; Russian-language dataset |
| Тип документа | Выпускная квалификационная работа бакалавра |
| Язык | Русский |
| Уровень высшего образования | Бакалавриат |
| Код специальности ФГОС | 02.03.01 |
| Группа специальностей ФГОС | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-2579 |
| Права доступа | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\42750 |
| Дата создания записи | 21.08.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
Объект исследования — методы автоматической обработки речи и текста применительно к аудиозаписям совещаний. Предмет исследования — алгоритмы и модели транскрибации, диаризации речи и суммаризации, применяемые для построения протоколов совещаний на русском языке. Цель работы — разработать модульный исследовательский стенд и собственный русскоязычный датасет для автоматического протоколирования совещаний, а также провести с их помощью сравнительное исследование открытых моделей. В работе выполнен обзор предметной области: рассмотрены этапы протоколирования, подходы и модели для каждого из них, метрики оценки качества и доступные датасеты. Собран первый открытый русскоязычный датасет совещаний с эталонной разметкой (стенограммой с временными метками и указанием говорящих, краткими резюме, ключевыми моментами и поручениями) в четырёх вариантах нарастающей акустической сложности. Разработан модульный стенд с тонким ядром и изолированными в контейнерах адаптерами моделей, позволяющий подключать и сравнивать различные решения на каждом этапе обработки, а также подсистема метрик. С помощью стенда проведено сравнительное исследование открытых моделей транскрибации и диаризации и больших языковых моделей для суммаризации: оценены качество и производительность, сформированы рекомендации по выбору конфигурации под различные ресурсные ограничения. Исходный код всех компонентов опубликован в открытом доступе, собранный датасет опубликован на платформе Hugging Face.
The object of the study is automatic speech and text processing methods applied to meeting recordings. The subject of the study is transcription, speaker diarization, and summarization algorithms and models used to build meeting protocols for the Russian language. The purpose of the work is to develop a modular research testbed and a dedicated Russian-language dataset for automatic meeting protocoling, and to use them for a comparative study of open models. The work presents a review of the domain: the stages of protocoling, the approaches and models for each of them, quality metrics, and available datasets. The first open Russian-language meeting dataset with reference annotation (a transcript with timestamps and speaker labels, short summaries, highlights, and action items) is collected in four variants of increasing acoustic difficulty. A modular testbed with a thin core and model adapters isolated in containers is developed, allowing different solutions to be plugged in and compared at each processing stage, together with a metrics subsystem. Using the testbed, a comparative study of open transcription and diarization models and large language models for summarization is carried out: quality and performance are evaluated, and recommendations for choosing a configuration under various resource constraints are formulated. The source code of all components is publicly available, and the collected dataset is published on the Hugging Face platform.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|
- Определения, обозначения и сокращения
- Введение
- Исследование предметной области
- Особенности задачи протоколирования совещаний
- Обзор существующих подходов и решений
- Метрики качества
- Датасеты для оценки качества протоколирования
- Постановка задачи и требования к системе
- Подготовка датасета
- Подход к сбору данных
- Сценарии совещаний
- Эталонная разметка
- Сбор аудиозаписей
- Постобработка аудио
- Модульный исследовательский стенд
- Общая архитектура
- Адаптеры моделей
- Скрипт-оркестратор
- Оценка результатов
- Результаты экспериментов
- Условия экспериментов
- Анализ результатов транскрибации и диаризации
- Анализ результатов суммаризации
- Выбор конфигурации
- Заключение
- Список использованных источников
- Приложение А. Запросы к моделям для генерации эталонной разметки суммаризации
- Приложение Б. Конфигурация нормализации текста при расчёте WER и CER
- Приложение В. Запросы к модели-судье для оценки ключевых моментов и поручений
- Приложение Г. Полные результаты транскрибации и диаризации
- Приложение Д. Полные результаты сочетаний транскрибации и диаризации
- Приложение Е. Полные результаты суммаризации