Details
| Title | Разработка модели трансформера на основе линеаризации механизма внимания: выпускная квалификационная работа бакалавра: направление 02.03.01 «Математика и компьютерные науки» ; образовательная программа 02.03.01_01 «Системы искусственного интеллекта и суперкомпьютерные технологии» = Development of a transformer model based on the linearization of the attention mechanism |
|---|---|
| Creators | Черепнов Максим Михайлович |
| Scientific adviser | Уткин Лев Владимирович |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | Transformer ; механизм внимания ; self-attention ; линеаризация внимания ; многоголовое внимание ; позиционное кодирование ; BERT ; attention mechanism ; attention linearization ; multi-head attention ; positional encoding |
| Document type | Bachelor graduation qualification work |
| Language | Russian |
| Level of education | Bachelor |
| Speciality code (FGOS) | 02.03.01 |
| Speciality group (FGOS) | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-2167 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\42730 |
| Record create date | 8/21/2026 |
Allowed Actions
–
Action 'Read' will be available if administrator prepare required files
Action 'Download' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
Цель работы состоит в разработке и исследовании подхода к линеаризации механизма внимания в архитектурах класса Transformer. Предмет исследования включает методы ускорения self-attention, а также варианты их модификации, ориентированные на более быструю обработку последовательностей. Методология работы предполагает теоретический разбор механизмов внимания, программную реализацию предложенной модифицированной модели и экспериментальное сопоставление с классическим self-attention по метрикам точности и вычислительным (временным) затратам на задаче классификации текстовых отзывов. В работе предложена модификация механизма внимания трансформера – линейная агрегация контекста по векторам Value без вычисления матриц Q×KT с модуляцией токенов позиционным сигналом. На ее основе разработаны два метода: разреженная схема и метод локальных окон. Тесты на платформе NVIDIA DGX (Tesla V100) показали, что предлагаемые механизмы внимания сокращают среднее время эпохи обучения на 11,9–25,5% с сохранением качества классификации текстовых данных и при том же объеме видеопамяти. Полученные результаты применимы для ускорения процессов обучения моделей класса BERT на существующих вычислительных мощностях.
This work aims to develop and examine an approach that linearizes the attention mechanism within Transformer-type architectures. The scope of the study includes methods that accelerate self-attention, along with their variants designed to improve the efficiency of sequence processing. The research methodology combines a theoretical review of attention mechanisms with a software implementation of the proposed modified model, followed by an experimental evaluation against standard self-attention with respect to predictive performance and computational runtime on a text review classification task. The study proposes a modification of the transformer attention mechanism via linear context aggregation using Value vectors with positional signal modulation, eliminating Q × KT matrix calculations. Based on this approach, two methods were developed: a sparse scheme and a local window method. Tests on the NVIDIA DGX platform (Tesla V100) show that the proposed attention mechanisms reduce average per-epoch training time by 11.9%–25.5% without compromising text data classification quality while maintaining the same VRAM footprint. The results are applicable for accelerating the training processes of BERT-class models using the existing computing infrastructure.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|