Details

Title Автоматическая стенография и протоколирование совещаний: выпускная квалификационная работа бакалавра: направление 02.03.01 «Математика и компьютерные науки» ; образовательная программа 02.03.01_01 «Системы искусственного интеллекта и суперкомпьютерные технологии» = Transcription, speaker diarization, and summarization algorithms and models used to build meeting protocols for the Russian language
Creators Тищенко Артём Андреевич
Scientific adviser Мулюха Владимир Александрович
Organization Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects протоколирование совещаний ; транскрибация ; диаризация ; суммаризация ; распознавание речи ; большая языковая модель ; русскоязычный датасет ; meeting protocoling ; transcription ; diarization ; summarization ; speech recognition ; large language model ; Russian-language dataset
Document type Bachelor graduation qualification work
Language Russian
Level of education Bachelor
Speciality code (FGOS) 02.03.01
Speciality group (FGOS) 020000 - Компьютерные и информационные науки
DOI 10.18720/SPBPU/3/2026/vr/vr26-2579
Rights Доступ по паролю из сети Интернет (чтение, печать, копирование)
Additionally New arrival
Record key ru\spstu\vkr\42750
Record create date 8/21/2026

Allowed Actions

Action 'Прочитать' will be available if you login or access site from another network

Action 'Download' will be available if you login or access site from another network

Group Anonymous
Network Internet

Объект исследования — методы автоматической обработки речи и текста применительно к аудиозаписям совещаний. Предмет исследования — алгоритмы и модели транскрибации, диаризации речи и суммаризации, применяемые для построения протоколов совещаний на русском языке. Цель работы — разработать модульный исследовательский стенд и собственный русскоязычный датасет для автоматического протоколирования совещаний, а также провести с их помощью сравнительное исследование открытых моделей. В работе выполнен обзор предметной области: рассмотрены этапы протоколирования, подходы и модели для каждого из них, метрики оценки качества и доступные датасеты. Собран первый открытый русскоязычный датасет совещаний с эталонной разметкой (стенограммой с временными метками и указанием говорящих, краткими резюме, ключевыми моментами и поручениями) в четырёх вариантах нарастающей акустической сложности. Разработан модульный стенд с тонким ядром и изолированными в контейнерах адаптерами моделей, позволяющий подключать и сравнивать различные решения на каждом этапе обработки, а также подсистема метрик. С помощью стенда проведено сравнительное исследование открытых моделей транскрибации и диаризации и больших языковых моделей для суммаризации: оценены качество и производительность, сформированы рекомендации по выбору конфигурации под различные ресурсные ограничения. Исходный код всех компонентов опубликован в открытом доступе, собранный датасет опубликован на платформе Hugging Face.

The object of the study is automatic speech and text processing methods applied to meeting recordings. The subject of the study is transcription, speaker diarization, and summarization algorithms and models used to build meeting protocols for the Russian language. The purpose of the work is to develop a modular research testbed and a dedicated Russian-language dataset for automatic meeting protocoling, and to use them for a comparative study of open models. The work presents a review of the domain: the stages of protocoling, the approaches and models for each of them, quality metrics, and available datasets. The first open Russian-language meeting dataset with reference annotation (a transcript with timestamps and speaker labels, short summaries, highlights, and action items) is collected in four variants of increasing acoustic difficulty. A modular testbed with a thin core and model adapters isolated in containers is developed, allowing different solutions to be plugged in and compared at each processing stage, together with a metrics subsystem. Using the testbed, a comparative study of open transcription and diarization models and large language models for summarization is carried out: quality and performance are evaluated, and recommendations for choosing a configuration under various resource constraints are formulated. The source code of all components is publicly available, and the collected dataset is published on the Hugging Face platform.

Network User group Action
ILC SPbPU Local Network All
Прочитать Print Download
Internet Authorized users SPbPU
Прочитать Print Download
Internet Anonymous
  • Определения, обозначения и сокращения
  • Введение
  • Исследование предметной области
    • Особенности задачи протоколирования совещаний
    • Обзор существующих подходов и решений
    • Метрики качества
    • Датасеты для оценки качества протоколирования
    • Постановка задачи и требования к системе
  • Подготовка датасета
    • Подход к сбору данных
    • Сценарии совещаний
    • Эталонная разметка
    • Сбор аудиозаписей
    • Постобработка аудио
  • Модульный исследовательский стенд
    • Общая архитектура
    • Адаптеры моделей
    • Скрипт-оркестратор
    • Оценка результатов
  • Результаты экспериментов
    • Условия экспериментов
    • Анализ результатов транскрибации и диаризации
    • Анализ результатов суммаризации
    • Выбор конфигурации
  • Заключение
  • Список использованных источников
  • Приложение А. Запросы к моделям для генерации эталонной разметки суммаризации
  • Приложение Б. Конфигурация нормализации текста при расчёте WER и CER
  • Приложение В. Запросы к модели-судье для оценки ключевых моментов и поручений
  • Приложение Г. Полные результаты транскрибации и диаризации
  • Приложение Д. Полные результаты сочетаний транскрибации и диаризации
  • Приложение Е. Полные результаты суммаризации
...