Details

Title Система автоматического переноса таблиц из СУБД Greenplum в фреймворк для распределённой обработки данных Apache Spark: выпускная квалификационная работа бакалавра: направление 02.03.03 «Математическое обеспечение и администрирование информационных систем» ; образовательная программа 02.03.03_01 «Интеллектуальные информационные системы и обработка данных» = System for automatic migration of tables from the Greenplum Database to the Apache Spark distributed data processing framework
Creators Марченко Кристина Алексеевна
Scientific adviser Сабинин Олег Юрьевич
Organization Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects миграция данных ; объектное хранилище ; партиционирование ; Greenplum ; Apache Spark ; Apache Iceberg ; Data Lakehouse ; Data Warehouse ; ETL/ELT ; Apache Airflow ; merge into ; watermark ; data migration ; object storage ; partitioning
Document type Bachelor graduation qualification work
Language Russian
Level of education Bachelor
Speciality code (FGOS) 02.03.03
Speciality group (FGOS) 020000 - Компьютерные и информационные науки
DOI 10.18720/SPBPU/3/2026/vr/vr26-2604
Rights Доступ по паролю из сети Интернет (чтение)
Additionally New arrival
Record key ru\spstu\vkr\42775
Record create date 8/21/2026

Allowed Actions

–

Action 'Read' will be available if you login or access site from another network

Group Anonymous
Network Internet

В работе изложен подход к проектированию и программной реализации системы переноса аналитических витрин из массово-параллельного хранилища Greenplum в архитектуру Data Lakehouse на базе формата Apache Iceberg. Рассмотрены архитектурные особенности классического MPP-хранилища Greenplum и современных гибридных платформ; проанализированы методы интеграции реляционных СУБД с распределённым вычислительным движком Apache Spark; обоснован выбор архитектуры решения с использованием JDBC-коннектора и собственной MERGE-логики поверх Iceberg-таблиц. Спроектирована и программно реализована модульная система миграции данных. Ядром системы являются компоненты GreenplumConnector и MigrationPipeline. Проведено экспериментальное исследование разработанной системы на синтетических наборах. Подтверждена корректность алгоритма во всех сценариях обновлений, вставок и логических удалений. Получен коэффициент сокращения объёма обрабатываемых данных по сравнению с полной перезагрузкой, что подтверждает практическую применимость предложенного решения для регулярного обновления банковских аналитических витрин.

The work presents the approach to designing and implementing a system for migrating analytical data marts from the massively parallel Greenplum data warehouse to a Data Lakehouse architecture based on the Apache Iceberg format. The architectural features of the classical MPP warehouse and modern hybrid platforms are analysed; methods of integrating relational DBMS with the Apache Spark distributed computation engine are compared; the choice of a JDBC-based solution with custom MERGE logic over Iceberg tables is justified. A modular migration system is designed and implemented. Its core components are GreenplumConnector and MigrationPipeline. The system has been evaluated experimentally on synthetic datasets. Correctness of the algorithm is confirmed across all update, insert and soft-delete scenarios. Compared with a full-reload baseline, the incremental strategy reduces the volume of processed data, which confirms the practical applicability of the proposed solution for regular incremental updates of banking analytical data marts.

Network User group Action
ILC SPbPU Local Network All
Read
Internet Authorized users SPbPU
Read
Internet Anonymous
...