Details
| Title | Применение больших языковых моделей для аргументации и синтетического расширения табличных данных: выпускная квалификационная работа бакалавра: направление 09.03.01 «Информатика и вычислительная техника» ; образовательная программа 09.03.01_01 «Разработка компьютерных систем» = Using large language models for augmentation and synthetic extension of tabular data |
|---|---|
| Creators | Путилин Степан Павлович |
| Scientific adviser | Федотов Александр Александрович |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | табличные данные ; аугментация данных ; синтетические данные ; большие языковые модели ; LLM ; GReaT ; SMOTE ; TabDDPM ; EBM ; CatBoost ; Optuna ; tabular data ; data augmentation ; synthetic data ; big language models ; CTGAN |
| Document type | Bachelor graduation qualification work |
| Language | Russian |
| Level of education | Bachelor |
| Speciality code (FGOS) | 09.03.01 |
| Speciality group (FGOS) | 090000 - Информатика и вычислительная техника |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-1892 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\42534 |
| Record create date | 8/21/2026 |
Allowed Actions
–
Action 'Read' will be available if administrator prepare required files
Action 'Download' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
Данная работа посвящена исследованию методов синтетического расширения табличных данных и оценке возможности применения больших языковых моделей для генерации новых табличных объектов. В ходе работы выполнен анализ особенностей табличных данных в задачах машинного обучения, рассмотрены проблемы малых выборок, дисбаланса классов. В экспериментальной части разработана единая методика сравнения генераторов синтетических данных. В качестве базовой обучающей выборки использовались 200 реальных строк, к которым добавлялись синтетические выборки разного объёма. Сравнение проводилось на открытых датасетах Iris, Electricity, Adult и Bank Marketing. В качестве единой модели-оценщика использован CatBoost, подбор гиперпараметров выполнялся с помощью Optuna. В работе реализовано приложение для генерации синтетических табличных данных с использованием больших языковых моделей через OpenRouter API. Результаты экспериментов показали, что LLM-подходы и GReaT способны обеспечивать положительный прирост качества модели и лучше учитывать семантические ограничения признаков, однако требуют обязательной валидации. По результатам исследования сформулированы практические рекомендации по применению LLM и классических генеративных методов для аугментации табличных данныx.
This paper explores methods for synthetically augmenting tabular data and assesses the feasibility of using big language models to generate new tabular objects. This paper analyzes the specific features of tabular data in machine learning problems, addressing issues such as small samples, class imbalance, rare categories, and preserving relationships between features. Classical synthetic generation methods and modern LLM-based approaches are systematized. In the experimental section, a unified methodology for comparing synthetic data generators was developed. A base training set of 200 real rows was used, supplemented with synthetic samples of varying sizes. The comparison was conducted on the open datasets Iris, Electricity, Adult, and Bank Marketing. CatBoost was used as the unified estimator model, and hyperparameter selection was performed using Optuna. This paper implements an application for generating synthetic tabular data using large-scale language models via the OpenRouter API. The following models are considered: llama-4-scout, gpt-oss-120b, and llama3.3-70b, as well as the GReaT method. Experimental results showed that LLM and GReaT approaches can provide positive improvements in model quality and better account for semantic constraints of features. However, they require mandatory validation, post-processing, and risk control for copying the original data. The studys results formulated practical recommendations for the use of LLM and classical generative methods for augmenting tabular data.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|