Детальная информация
| Название | Исследование возможностей использования больших языковых моделей для сжатия данных без потерь: выпускная квалификационная работа магистра: направление 09.04.01 «Информатика и вычислительная техника» ; образовательная программа 09.04.01_15 «Технологии проектирования системного и прикладного программного обеспечения» = Study of the feasibility of using large language models for lossless data compression |
|---|---|
| Авторы | Аль-Джунди Осама Мохаммад Ахмад |
| Научный руководитель | Семенов Константин Константинович |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | языковые модели ; сжатие данных без потерь ; арифметическое кодирование ; асимметричные цифровые системы ; GPT-2 ; Mistral ; KV-кэширование ; text8 ; large language models ; lossless data compression ; arithmetic coding ; asymmetric numeral systems ; KV-caching |
| Тип документа | Выпускная квалификационная работа магистра |
| Язык | Русский |
| Уровень высшего образования | Магистратура |
| Код специальности ФГОС | 09.04.01 |
| Группа специальностей ФГОС | 090000 - Информатика и вычислительная техника |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-4345 |
| Права доступа | Доступ по паролю из сети Интернет (чтение) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\44711 |
| Дата создания записи | 04.09.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
Цель работы — исследование возможностей использования больших языковых моделей (LLM) для сжатия текстовых данных без потерь и разработка программного пакета lmcodec, реализующего данный подход. Объект исследования — методы сжатия текстовых данных без потерь. Предмет исследования — применение больших языковых моделей в качестве вероятностных моделей для арифметического кодирования. Проведён анализ классических алгоритмов сжатия (GZIP, BZIP2, LZMA) и нейросетевых подходов к нему. Разработан пакет lmcodec, реализующий двухфазный алгоритм: языковая модель вычисляет вероятности токенов с KV-кэшем, затем эти вероятности поступают в ANS-кодер. Протестировано пять моделей на корпусе text8 — от GPT-2 со 124M параметрами до Mistral-7B с семью миллиардами. В результате экспериментальной проверки подтверждены все четыре гипотезы. Наилучший результат — 0,7648 бит на символ (BPC) — достигнут с моделью Mistral-7B, что в 2,99 раза превышает коэффициент сжатия алгоритма BZIP2 (2,2838 BPC). Установлено, что применение LLM-компрессоров сопряжено с замедлением в ~19 000 раз относительно GZIP, что ограничивает область применения сценариями офлайн-архивирования.
The goal of this work is to investigate the feasibility of using large language models (LLMs) for lossless text data compression, and to develop the lmcodec software package implementing this approach. Classical lossless compression algorithms (GZIP, BZIP2, LZMA) and neural network-based approaches were analysed. The lmcodec software package was developed, implementing a two-phase pipeline: a probability computation phase where the language model assigns token probabilities using KV-caching, followed by ANS-based entropy coding. Five models ranging from GPT-2 (124M parameters) to Mistral-7B (7B parameters) were tested on the text8 corpus. All four research hypotheses were confirmed experimentally. The best result — 0.7648 bits per character (BPC) — was achieved with the Mistral-7B model, which is 2.99 times better than BZIP2 (2.2838 BPC). It was established that LLM-based compression is approximately 19,000 times slower than GZIP, limiting its practical application to offline archiving scenarios.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|