Детальная информация

Название Преобразование SQL-запросов в текстовое описание задачи на русском языке: выпускная квалификационная работа магистра: направление 02.04.03 «Математическое обеспечение и администрирование информационных систем» ; образовательная программа 02.04.03_01 «Разработка и математическое обеспечение интеллектуальных информационных систем» = Converting SQL Queries into a Textual Description of the Task in Russian
Авторы Носкова Александра Сергеевна
Научный руководитель Сабинин Олег Юрьевич
Организация Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Выходные сведения Санкт-Петербург, 2026
Коллекция Выпускные квалификационные работы ; Общая коллекция
Тематика SQL-to-text ; генерация текста ; обработка естественного языка ; машинное обучение ; Snowball ; метрика BLEU ; датасет ; text generation ; natural language processing ; machine learning ; BLEC metric ; dataset
Тип документа Выпускная квалификационная работа магистра
Язык Русский
Уровень высшего образования Магистратура
Код специальности ФГОС 02.04.03
Группа специальностей ФГОС 020000 - Компьютерные и информационные науки
DOI 10.18720/SPBPU/3/2026/vr/vr26-5491
Права доступа Доступ по паролю из сети Интернет (чтение, печать)
Дополнительно Новинка
Ключ записи ru\spstu\vkr\45166
Дата создания записи 04.09.2026

Разрешенные действия

Действие 'Прочитать' будет возможно после подготовки администраторами необходимых файлов

Группа Анонимные пользователи
Сеть Интернет

В данной работе изложена сущность подхода к автоматической генерации текстовых описаний SQL-запросов на русском языке. Проведён анализ существующих решений задачи SQL-to-text, метрик оценки качества и доступных датасетов. На основе сравнительного анализа шести датасетов с применением расширенного метода TOPSIS выбран датасет Spider 1.0 для создания русскоязычного аналога. Разработан русскоязычный датасет RuSpider (7000 обучающих и 1034 валидационных примера) с разметкой по уровням сложности, выявлены проблемные конструкции, создан дополнительный датасет fix_dataset (769 запросов). Создана и адаптирована для русского языка метрика RuBLEC, оценивающая логическую согласованность между SQL-запросом и сгенерированным текстом с детекцией галлюцинаций и логических противоречий. Разработана модель RuSNOWBALL на основе архитектуры «Генератор-Оценщик» с использованием предобученной T5 (cointegrated/rut5-base, 244M параметров) и метрики RuBLEC в качестве оценщика. Реализована процедура аугментации данных с RuBLEC-фильтрацией. Проведено сравнительное тестирование трёх моделей (Rules-Based, T5-Baseline, RuSNOWBALL) на 73 запросах различной сложности. Финальная модель достигла RuBLEC = 90,8%, BERTScore = 83,1%, превзойдя T5-Baseline на 9% и 5% соответственно. Выполнено сравнение с оригинальным фреймворком SNOWBALL, подтвердившее эффективность адаптации для русского языка. Разработанная модель может использоваться в образовательных целях для обучения SQL, для документирования баз данных и автоматизации анализа SQL-кода.

This paper describes the essence of the approach to automatic generation of text descriptions of SQL queries in Russian. The analysis of existing solutions to the SQL-to-text problem, quality assessment metrics and available datasets is carried out. Based on a comparative analysis of six datasets using the advanced TOPSIS method, the Spider 1.0 dataset was selected to create a Russian-language analog. A RuSpider Russian-language dataset has been developed (7000 training and 1034 validation examples) with markup by difficulty levels, problematic constructions have been identified, and an additional fix_dataset dataset (769 queries) has been created. The RuBLEC metric has been created and adapted for the Russian language, evaluating the logical consistency between an SQL query and the generated text with the detection of hallucinations and logical contradictions. The RuSNOWBALL model has been developed based on the "Generator-Estimator" architecture using pre-trained T5 (cointegrated/rut5-base, 244M parameters) and the RuBLEC metric as an estimator. The data augmentation procedure with RuBLEC filtering has been implemented. Comparative testing of three models (Rules-Based, T5-Baseline, RuSNOWBALL) was carried out on 73 queries of varying complexity. The final model reached RuBLEC = 90.8%, BERTScore = 83.1%, surpassing the T5-Baseline by 9% and 5%, respectively. A comparison with the original SNOWBALL framework was performed, which confirmed the effectiveness of adaptation for the Russian language. The developed model can be used for educational purposes to teach SQL, document databases, and automate SQL code analysis.

Место доступа Группа пользователей Действие
Локальная сеть ИБК СПбПУ Все
Интернет Авторизованные пользователи СПбПУ
Интернет Анонимные пользователи
...