Детальная информация

Название Исследование методов сжатия больших языковых моделей с сохранением качества при работе с русскоязычным текстом: выпускная квалификационная работа магистра: направление 02.04.01 «Математика и компьютерные науки» ; образовательная программа 02.04.01_03 «Искусственный интеллект и машинное обучение» = Research into methods for compressing large language models while preserving quality for Russian-language text
Авторы Музыкантов Илья Эдуардович
Научный руководитель Заборовский Владимир Сергеевич
Организация Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Выходные сведения Санкт-Петербург, 2026
Коллекция Выпускные квалификационные работы ; Общая коллекция
Тематика методы сжатия ; квантизация ; прунинг ; русский язык ; морфология ; большие языковые модели ; qwen3-14b ; mera ; compression methods ; quantization ; pruning ; russian language ; morphology ; large language models
Тип документа Выпускная квалификационная работа магистра
Язык Русский
Уровень высшего образования Магистратура
Код специальности ФГОС 02.04.01
Группа специальностей ФГОС 020000 - Компьютерные и информационные науки
DOI 10.18720/SPBPU/3/2026/vr/vr26-4857
Права доступа Доступ по паролю из сети Интернет (чтение)
Дополнительно Новинка
Ключ записи ru\spstu\vkr\45030
Дата создания записи 04.09.2026

Разрешенные действия

Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Группа Анонимные пользователи
Сеть Интернет

Объектом исследования является модель Qwen3-14B. Предметом исследования — методы сжатия, учитывающие морфологическую структуру русского языка. Цель работы — разработка и экспериментальное исследование методов сжатия больших языковых моделей, обеспечивающих высокую степень компрессии при минимальной потере качества на русскоязычных задачах. Методы исследования включают морфологически-взвешенную квантизацию (MWQ), квантование словаря с переменной битностью (VRD-Voc), спектральный прунинг каналов (MCSP), полярную квантизацию KV-кэша (Φ-KV), удаление внимания с MLP-компенсацией (ADM) и линеаризацию глубоких блоков (DeepLinear). Оценка проводилась на бенчмарках MERA: ruMMLU, PARus, MultiQ. Основные результаты: MWQ достигает сжатия 73% при сохранении 99.7% исходного качества. Экспериментально установлено, что выходные проекции (down_proj, o_proj) в 7.7 раза важнее входных (q_proj, gate_proj). VRD-Voc сжимает словарь на 73%. Φ-KV обеспечивает экономию KV-кэша 25% при снижении качества на 0.056. Комбинация VRD+MCSP даёт двойное сжатие при потере всего 0.001 пункта.

The object of research is the Qwen3-14B model. The subject of research is compression methods that take into account the morphological structure of the Russian language. The goal is to develop and experimentally evaluate large language model compression methods that achieve high compression rates while minimizing quality degradation on Russian‑language tasks. The research methods include morphology‑weighted quantization (MWQ), variable‑rate dictionary quantization (VRD‑Voc), spectral channel pruning (MCSP), polar KV‑cache quantization (Φ‑KV), attention distillation with MLP compensation (ADM), and deep block linearization (DeepLinear). Evaluation is performed on the MERA benchmarks: ruMMLU, PARus, and MultiQ. Main results: MWQ achieves 73% compression while preserving 99.7% of the original quality. It is experimentally established that the output projections (down_proj, o_proj) are 7.7 times more important than the input projections (q_proj, gate_proj). VRD‑Voc compresses the vocabulary by 73%. Φ‑KV reduces KV‑cache memory by 25% with a quality drop of 0.056. The combination of VRD‑Voc and MCSP yields double compression with a loss of only 0.001 points.

Место доступа Группа пользователей Действие
Локальная сеть ИБК СПбПУ Все
Прочитать
Интернет Авторизованные пользователи СПбПУ
Прочитать
Интернет Анонимные пользователи
...