Details
| Title | Исследование методов сжатия больших языковых моделей с сохранением качества при работе с русскоязычным текстом: выпускная квалификационная работа магистра: направление 02.04.01 «Математика и компьютерные науки» ; образовательная программа 02.04.01_03 «Искусственный интеллект и машинное обучение» = Research into methods for compressing large language models while preserving quality for Russian-language text |
|---|---|
| Creators | Музыкантов Илья Эдуардович |
| Scientific adviser | Заборовский Владимир Сергеевич |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | методы сжатия ; квантизация ; прунинг ; русский язык ; морфология ; большие языковые модели ; qwen3-14b ; mera ; compression methods ; quantization ; pruning ; russian language ; morphology ; large language models |
| Document type | Master graduation qualification work |
| Language | Russian |
| Level of education | Master |
| Speciality code (FGOS) | 02.04.01 |
| Speciality group (FGOS) | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-4857 |
| Rights | Доступ по паролю из сети Интернет (чтение) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\45030 |
| Record create date | 9/4/2026 |
Allowed Actions
–
Action 'Read' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
Объектом исследования является модель Qwen3-14B. Предметом исследования — методы сжатия, учитывающие морфологическую структуру русского языка. Цель работы — разработка и экспериментальное исследование методов сжатия больших языковых моделей, обеспечивающих высокую степень компрессии при минимальной потере качества на русскоязычных задачах. Методы исследования включают морфологически-взвешенную квантизацию (MWQ), квантование словаря с переменной битностью (VRD-Voc), спектральный прунинг каналов (MCSP), полярную квантизацию KV-кэша (Φ-KV), удаление внимания с MLP-компенсацией (ADM) и линеаризацию глубоких блоков (DeepLinear). Оценка проводилась на бенчмарках MERA: ruMMLU, PARus, MultiQ. Основные результаты: MWQ достигает сжатия 73% при сохранении 99.7% исходного качества. Экспериментально установлено, что выходные проекции (down_proj, o_proj) в 7.7 раза важнее входных (q_proj, gate_proj). VRD-Voc сжимает словарь на 73%. Φ-KV обеспечивает экономию KV-кэша 25% при снижении качества на 0.056. Комбинация VRD+MCSP даёт двойное сжатие при потере всего 0.001 пункта.
The object of research is the Qwen3-14B model. The subject of research is compression methods that take into account the morphological structure of the Russian language. The goal is to develop and experimentally evaluate large language model compression methods that achieve high compression rates while minimizing quality degradation on Russian‑language tasks. The research methods include morphology‑weighted quantization (MWQ), variable‑rate dictionary quantization (VRD‑Voc), spectral channel pruning (MCSP), polar KV‑cache quantization (Φ‑KV), attention distillation with MLP compensation (ADM), and deep block linearization (DeepLinear). Evaluation is performed on the MERA benchmarks: ruMMLU, PARus, and MultiQ. Main results: MWQ achieves 73% compression while preserving 99.7% of the original quality. It is experimentally established that the output projections (down_proj, o_proj) are 7.7 times more important than the input projections (q_proj, gate_proj). VRD‑Voc compresses the vocabulary by 73%. Φ‑KV reduces KV‑cache memory by 25% with a quality drop of 0.056. The combination of VRD‑Voc and MCSP yields double compression with a loss of only 0.001 points.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|