Детальная информация

Название Разработка модели трансформера на основе линеаризации механизма внимания: выпускная квалификационная работа бакалавра: направление 02.03.01 «Математика и компьютерные науки» ; образовательная программа 02.03.01_01 «Системы искусственного интеллекта и суперкомпьютерные технологии» = Development of a transformer model based on the linearization of the attention mechanism
Авторы Черепнов Максим Михайлович
Научный руководитель Уткин Лев Владимирович
Организация Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Выходные сведения Санкт-Петербург, 2026
Коллекция Выпускные квалификационные работы ; Общая коллекция
Тематика Transformer ; механизм внимания ; self-attention ; линеаризация внимания ; многоголовое внимание ; позиционное кодирование ; BERT ; attention mechanism ; attention linearization ; multi-head attention ; positional encoding
Тип документа Выпускная квалификационная работа бакалавра
Язык Русский
Уровень высшего образования Бакалавриат
Код специальности ФГОС 02.03.01
Группа специальностей ФГОС 020000 - Компьютерные и информационные науки
DOI 10.18720/SPBPU/3/2026/vr/vr26-2167
Права доступа Доступ по паролю из сети Интернет (чтение, печать, копирование)
Дополнительно Новинка
Ключ записи ru\spstu\vkr\42730
Дата создания записи 21.08.2026

Разрешенные действия

Действие 'Прочитать' будет возможно после подготовки администраторами необходимых файлов

Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Группа Анонимные пользователи
Сеть Интернет

Цель работы состоит в разработке и исследовании подхода к линеаризации механизма внимания в архитектурах класса Transformer. Предмет исследования включает методы ускорения self-attention, а также варианты их модификации, ориентированные на более быструю обработку последовательностей. Методология работы предполагает теоретический разбор механизмов внимания, программную реализацию предложенной модифицированной модели и экспериментальное сопоставление с классическим self-attention по метрикам точности и вычислительным (временным) затратам на задаче классификации текстовых отзывов. В работе предложена модификация механизма внимания трансформера – линейная агрегация контекста по векторам Value без вычисления матриц Q×KT с модуляцией токенов позиционным сигналом. На ее основе разработаны два метода: разреженная схема и метод локальных окон. Тесты на платформе NVIDIA DGX (Tesla V100) показали, что предлагаемые механизмы внимания сокращают среднее время эпохи обучения на 11,9–25,5% с сохранением качества классификации текстовых данных и при том же объеме видеопамяти. Полученные результаты применимы для ускорения процессов обучения моделей класса BERT на существующих вычислительных мощностях.

This work aims to develop and examine an approach that linearizes the attention mechanism within Transformer-type architectures. The scope of the study includes methods that accelerate self-attention, along with their variants designed to improve the efficiency of sequence processing. The research methodology combines a theoretical review of attention mechanisms with a software implementation of the proposed modified model, followed by an experimental evaluation against standard self-attention with respect to predictive performance and computational runtime on a text review classification task. The study proposes a modification of the transformer attention mechanism via linear context aggregation using Value vectors with positional signal modulation, eliminating Q × KT matrix calculations. Based on this approach, two methods were developed: a sparse scheme and a local window method. Tests on the NVIDIA DGX platform (Tesla V100) show that the proposed attention mechanisms reduce average per-epoch training time by 11.9%–25.5% without compromising text data classification quality while maintaining the same VRAM footprint. The results are applicable for accelerating the training processes of BERT-class models using the existing computing infrastructure.

Место доступа Группа пользователей Действие
Локальная сеть ИБК СПбПУ Все
Загрузить
Интернет Авторизованные пользователи СПбПУ
Загрузить
Интернет Анонимные пользователи
...