Details

Title Исследование методов сжатия больших языковых моделей с сохранением качества при работе с русскоязычным текстом: выпускная квалификационная работа магистра: направление 02.04.01 «Математика и компьютерные науки» ; образовательная программа 02.04.01_03 «Искусственный интеллект и машинное обучение» = Research into methods for compressing large language models while preserving quality for Russian-language text
Creators Музыкантов Илья Эдуардович
Scientific adviser Заборовский Владимир Сергеевич
Organization Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects методы сжатия ; квантизация ; прунинг ; русский язык ; морфология ; большие языковые модели ; qwen3-14b ; mera ; compression methods ; quantization ; pruning ; russian language ; morphology ; large language models
Document type Master graduation qualification work
Language Russian
Level of education Master
Speciality code (FGOS) 02.04.01
Speciality group (FGOS) 020000 - Компьютерные и информационные науки
DOI 10.18720/SPBPU/3/2026/vr/vr26-4857
Rights Доступ по паролю из сети Интернет (чтение)
Additionally New arrival
Record key ru\spstu\vkr\45030
Record create date 9/4/2026

Allowed Actions

Action 'Read' will be available if you login or access site from another network

Group Anonymous
Network Internet

Объектом исследования является модель Qwen3-14B. Предметом исследования — методы сжатия, учитывающие морфологическую структуру русского языка. Цель работы — разработка и экспериментальное исследование методов сжатия больших языковых моделей, обеспечивающих высокую степень компрессии при минимальной потере качества на русскоязычных задачах. Методы исследования включают морфологически-взвешенную квантизацию (MWQ), квантование словаря с переменной битностью (VRD-Voc), спектральный прунинг каналов (MCSP), полярную квантизацию KV-кэша (Φ-KV), удаление внимания с MLP-компенсацией (ADM) и линеаризацию глубоких блоков (DeepLinear). Оценка проводилась на бенчмарках MERA: ruMMLU, PARus, MultiQ. Основные результаты: MWQ достигает сжатия 73% при сохранении 99.7% исходного качества. Экспериментально установлено, что выходные проекции (down_proj, o_proj) в 7.7 раза важнее входных (q_proj, gate_proj). VRD-Voc сжимает словарь на 73%. Φ-KV обеспечивает экономию KV-кэша 25% при снижении качества на 0.056. Комбинация VRD+MCSP даёт двойное сжатие при потере всего 0.001 пункта.

The object of research is the Qwen3-14B model. The subject of research is compression methods that take into account the morphological structure of the Russian language. The goal is to develop and experimentally evaluate large language model compression methods that achieve high compression rates while minimizing quality degradation on Russian‑language tasks. The research methods include morphology‑weighted quantization (MWQ), variable‑rate dictionary quantization (VRD‑Voc), spectral channel pruning (MCSP), polar KV‑cache quantization (Φ‑KV), attention distillation with MLP compensation (ADM), and deep block linearization (DeepLinear). Evaluation is performed on the MERA benchmarks: ruMMLU, PARus, and MultiQ. Main results: MWQ achieves 73% compression while preserving 99.7% of the original quality. It is experimentally established that the output projections (down_proj, o_proj) are 7.7 times more important than the input projections (q_proj, gate_proj). VRD‑Voc compresses the vocabulary by 73%. Φ‑KV reduces KV‑cache memory by 25% with a quality drop of 0.056. The combination of VRD‑Voc and MCSP yields double compression with a loss of only 0.001 points.

Network User group Action
ILC SPbPU Local Network All
Read
Internet Authorized users SPbPU
Read
Internet Anonymous
...