Детальная информация
| Название | Применение больших языковых моделей для аргументации и синтетического расширения табличных данных: выпускная квалификационная работа бакалавра: направление 09.03.01 «Информатика и вычислительная техника» ; образовательная программа 09.03.01_01 «Разработка компьютерных систем» = Using large language models for augmentation and synthetic extension of tabular data |
|---|---|
| Авторы | Путилин Степан Павлович |
| Научный руководитель | Федотов Александр Александрович |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | табличные данные ; аугментация данных ; синтетические данные ; большие языковые модели ; LLM ; GReaT ; SMOTE ; TabDDPM ; EBM ; CatBoost ; Optuna ; tabular data ; data augmentation ; synthetic data ; big language models ; CTGAN |
| Тип документа | Выпускная квалификационная работа бакалавра |
| Язык | Русский |
| Уровень высшего образования | Бакалавриат |
| Код специальности ФГОС | 09.03.01 |
| Группа специальностей ФГОС | 090000 - Информатика и вычислительная техника |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-1892 |
| Права доступа | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\42534 |
| Дата создания записи | 21.08.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет возможно после подготовки администраторами необходимых файлов
Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
Данная работа посвящена исследованию методов синтетического расширения табличных данных и оценке возможности применения больших языковых моделей для генерации новых табличных объектов. В ходе работы выполнен анализ особенностей табличных данных в задачах машинного обучения, рассмотрены проблемы малых выборок, дисбаланса классов. В экспериментальной части разработана единая методика сравнения генераторов синтетических данных. В качестве базовой обучающей выборки использовались 200 реальных строк, к которым добавлялись синтетические выборки разного объёма. Сравнение проводилось на открытых датасетах Iris, Electricity, Adult и Bank Marketing. В качестве единой модели-оценщика использован CatBoost, подбор гиперпараметров выполнялся с помощью Optuna. В работе реализовано приложение для генерации синтетических табличных данных с использованием больших языковых моделей через OpenRouter API. Результаты экспериментов показали, что LLM-подходы и GReaT способны обеспечивать положительный прирост качества модели и лучше учитывать семантические ограничения признаков, однако требуют обязательной валидации. По результатам исследования сформулированы практические рекомендации по применению LLM и классических генеративных методов для аугментации табличных данныx.
This paper explores methods for synthetically augmenting tabular data and assesses the feasibility of using big language models to generate new tabular objects. This paper analyzes the specific features of tabular data in machine learning problems, addressing issues such as small samples, class imbalance, rare categories, and preserving relationships between features. Classical synthetic generation methods and modern LLM-based approaches are systematized. In the experimental section, a unified methodology for comparing synthetic data generators was developed. A base training set of 200 real rows was used, supplemented with synthetic samples of varying sizes. The comparison was conducted on the open datasets Iris, Electricity, Adult, and Bank Marketing. CatBoost was used as the unified estimator model, and hyperparameter selection was performed using Optuna. This paper implements an application for generating synthetic tabular data using large-scale language models via the OpenRouter API. The following models are considered: llama-4-scout, gpt-oss-120b, and llama3.3-70b, as well as the GReaT method. Experimental results showed that LLM and GReaT approaches can provide positive improvements in model quality and better account for semantic constraints of features. However, they require mandatory validation, post-processing, and risk control for copying the original data. The studys results formulated practical recommendations for the use of LLM and classical generative methods for augmenting tabular data.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|