Детальная информация

Название Применение больших языковых моделей для аргументации и синтетического расширения табличных данных: выпускная квалификационная работа бакалавра: направление 09.03.01 «Информатика и вычислительная техника» ; образовательная программа 09.03.01_01 «Разработка компьютерных систем» = Using large language models for augmentation and synthetic extension of tabular data
Авторы Путилин Степан Павлович
Научный руководитель Федотов Александр Александрович
Организация Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Выходные сведения Санкт-Петербург, 2026
Коллекция Выпускные квалификационные работы ; Общая коллекция
Тематика табличные данные ; аугментация данных ; синтетические данные ; большие языковые модели ; LLM ; GReaT ; SMOTE ; TabDDPM ; EBM ; CatBoost ; Optuna ; tabular data ; data augmentation ; synthetic data ; big language models ; CTGAN
Тип документа Выпускная квалификационная работа бакалавра
Язык Русский
Уровень высшего образования Бакалавриат
Код специальности ФГОС 09.03.01
Группа специальностей ФГОС 090000 - Информатика и вычислительная техника
DOI 10.18720/SPBPU/3/2026/vr/vr26-1892
Права доступа Доступ по паролю из сети Интернет (чтение, печать, копирование)
Дополнительно Новинка
Ключ записи ru\spstu\vkr\42534
Дата создания записи 21.08.2026

Разрешенные действия

Действие 'Прочитать' будет возможно после подготовки администраторами необходимых файлов

Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Группа Анонимные пользователи
Сеть Интернет

Данная работа посвящена исследованию методов синтетического расширения табличных данных и оценке возможности применения больших языковых моделей для генерации новых табличных объектов. В ходе работы выполнен анализ особенностей табличных данных в задачах машинного обучения, рассмотрены проблемы малых выборок, дисбаланса классов. В экспериментальной части разработана единая методика сравнения генераторов синтетических данных. В качестве базовой обучающей выборки использовались 200 реальных строк, к которым добавлялись синтетические выборки разного объёма. Сравнение проводилось на открытых датасетах Iris, Electricity, Adult и Bank Marketing. В качестве единой модели-оценщика использован CatBoost, подбор гиперпараметров выполнялся с помощью Optuna. В работе реализовано приложение для генерации синтетических табличных данных с использованием больших языковых моделей через OpenRouter API. Результаты экспериментов показали, что LLM-подходы и GReaT способны обеспечивать положительный прирост качества модели и лучше учитывать семантические ограничения признаков, однако требуют обязательной валидации. По результатам исследования сформулированы практические рекомендации по применению LLM и классических генеративных методов для аугментации табличных данныx.

This paper explores methods for synthetically augmenting tabular data and assesses the feasibility of using big language models to generate new tabular objects. This paper analyzes the specific features of tabular data in machine learning problems, addressing issues such as small samples, class imbalance, rare categories, and preserving relationships between features. Classical synthetic generation methods and modern LLM-based approaches are systematized. In the experimental section, a unified methodology for comparing synthetic data generators was developed. A base training set of 200 real rows was used, supplemented with synthetic samples of varying sizes. The comparison was conducted on the open datasets Iris, Electricity, Adult, and Bank Marketing. CatBoost was used as the unified estimator model, and hyperparameter selection was performed using Optuna. This paper implements an application for generating synthetic tabular data using large-scale language models via the OpenRouter API. The following models are considered: llama-4-scout, gpt-oss-120b, and llama3.3-70b, as well as the GReaT method. Experimental results showed that LLM and GReaT approaches can provide positive improvements in model quality and better account for semantic constraints of features. However, they require mandatory validation, post-processing, and risk control for copying the original data. The studys results formulated practical recommendations for the use of LLM and classical generative methods for augmenting tabular data.

Место доступа Группа пользователей Действие
Локальная сеть ИБК СПбПУ Все
Загрузить
Интернет Авторизованные пользователи СПбПУ
Загрузить
Интернет Анонимные пользователи
...