Details

Title Применение больших языковых моделей для аргументации и синтетического расширения табличных данных: выпускная квалификационная работа бакалавра: направление 09.03.01 «Информатика и вычислительная техника» ; образовательная программа 09.03.01_01 «Разработка компьютерных систем» = Using large language models for augmentation and synthetic extension of tabular data
Creators Путилин Степан Павлович
Scientific adviser Федотов Александр Александрович
Organization Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects табличные данные ; аугментация данных ; синтетические данные ; большие языковые модели ; LLM ; GReaT ; SMOTE ; TabDDPM ; EBM ; CatBoost ; Optuna ; tabular data ; data augmentation ; synthetic data ; big language models ; CTGAN
Document type Bachelor graduation qualification work
Language Russian
Level of education Bachelor
Speciality code (FGOS) 09.03.01
Speciality group (FGOS) 090000 - Информатика и вычислительная техника
DOI 10.18720/SPBPU/3/2026/vr/vr26-1892
Rights Доступ по паролю из сети Интернет (чтение, печать, копирование)
Additionally New arrival
Record key ru\spstu\vkr\42534
Record create date 8/21/2026

Allowed Actions

Action 'Read' will be available if administrator prepare required files

Action 'Download' will be available if you login or access site from another network

Group Anonymous
Network Internet

Данная работа посвящена исследованию методов синтетического расширения табличных данных и оценке возможности применения больших языковых моделей для генерации новых табличных объектов. В ходе работы выполнен анализ особенностей табличных данных в задачах машинного обучения, рассмотрены проблемы малых выборок, дисбаланса классов. В экспериментальной части разработана единая методика сравнения генераторов синтетических данных. В качестве базовой обучающей выборки использовались 200 реальных строк, к которым добавлялись синтетические выборки разного объёма. Сравнение проводилось на открытых датасетах Iris, Electricity, Adult и Bank Marketing. В качестве единой модели-оценщика использован CatBoost, подбор гиперпараметров выполнялся с помощью Optuna. В работе реализовано приложение для генерации синтетических табличных данных с использованием больших языковых моделей через OpenRouter API. Результаты экспериментов показали, что LLM-подходы и GReaT способны обеспечивать положительный прирост качества модели и лучше учитывать семантические ограничения признаков, однако требуют обязательной валидации. По результатам исследования сформулированы практические рекомендации по применению LLM и классических генеративных методов для аугментации табличных данныx.

This paper explores methods for synthetically augmenting tabular data and assesses the feasibility of using big language models to generate new tabular objects. This paper analyzes the specific features of tabular data in machine learning problems, addressing issues such as small samples, class imbalance, rare categories, and preserving relationships between features. Classical synthetic generation methods and modern LLM-based approaches are systematized. In the experimental section, a unified methodology for comparing synthetic data generators was developed. A base training set of 200 real rows was used, supplemented with synthetic samples of varying sizes. The comparison was conducted on the open datasets Iris, Electricity, Adult, and Bank Marketing. CatBoost was used as the unified estimator model, and hyperparameter selection was performed using Optuna. This paper implements an application for generating synthetic tabular data using large-scale language models via the OpenRouter API. The following models are considered: llama-4-scout, gpt-oss-120b, and llama3.3-70b, as well as the GReaT method. Experimental results showed that LLM and GReaT approaches can provide positive improvements in model quality and better account for semantic constraints of features. However, they require mandatory validation, post-processing, and risk control for copying the original data. The studys results formulated practical recommendations for the use of LLM and classical generative methods for augmenting tabular data.

Network User group Action
ILC SPbPU Local Network All
Download
Internet Authorized users SPbPU
Download
Internet Anonymous
...