Details

Title Разработка сервиса миграции данных Datatransfer с использованием платформы распределенного хранения и обработки больших объемов данных YTsaurus: выпускная квалификационная работа бакалавра: направление 09.03.04 «Программная инженерия» ; образовательная программа 09.03.04_01 «Технология разработки и сопровождения качественного программного продукта» = Development of the Datatransfer data migration service using the YTsaurus distributed storage and processing platform for large amounts of data
Creators Молотов Кирилл Дмитриевич
Scientific adviser Смирнов Николай Георгиевич
Organization Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects миграция данных ; ytsaurus ; hdfs ; clickhouse ; распределенная обработка данных ; mapreduce ; apache arrow ; hadoop2yt ; yt-dumpster ; distributed data processing
Document type Bachelor graduation qualification work
Language Russian
Level of education Bachelor
Speciality code (FGOS) 09.03.04
Speciality group (FGOS) 090000 - Информатика и вычислительная техника
DOI 10.18720/SPBPU/3/2026/vr/vr26-2724
Rights Доступ по паролю из сети Интернет (чтение)
Additionally New arrival
Record key ru\spstu\vkr\42610
Record create date 8/21/2026

Allowed Actions

Action 'Read' will be available if you login or access site from another network

Group Anonymous
Network Internet

Объект исследования – процесс миграции больших объёмов данных из разнородных источников (HDFS) в платформу распределенного хранения и обработки данных YTsaurus, а также обратная выгрузка из YTsaurus в аналитическую систему ClickHouse. Цель работы – разработка и описание двух движков – hadoop2yt (перенос данных из HDFS в статические таблицы YTsaurus) и yt-dumpster (выгрузка данных из YTsaurus в ClickHouse), расширяющих функциональность существующего сервиса миграции данных Datatransfer компании VK. Методы – анализ существующих решений (Debezium, Apache Sqoop), проектирование микросервисной архитектуры с использованием операций MapReduce платформы YTsaurus, реализация управляющего сервиса на Python (hadoop2yt) и Go (yt-dumpster), разработка высокопроизводительного C++ маппера на базе Apache Arrow. Тестирование проводилось вручную на реальных промышленных данных с оценкой метрик мониторинга. Результаты – разработаны, протестированы и внедрены в промышленную эксплуатацию движки hadoop2yt и yt-dumpster. Ошибок, приводящих к потере данных, не зафиксировано. Практическая значимость – разработанные движки интегрированы в инфраструктурную команду Datatransfer компании VK и используются для решения реальных задач миграции данных, подтверждая высокую отказоустойчивость, масштабируемость.

Object of research – the process of migrating large (petabyte-scale) data from heterogeneous sources (HDFS) into the YTsaurus distributed storage and processing platform, as well as reverse export from YTsaurus to the ClickHouse analytical system. Objective – to develop and describe two engines – hadoop2yt (transferring data from HDFS to YTsaurus static tables) and yt-dumpster (exporting data from YTsaurus to ClickHouse), which extend the functionality of the existing VK data migration service Datatransfer. Methods – analysis of existing solutions (Debezium, Apache Sqoop), design of a microservice architecture based on YTsaurus MapReduce and Vanilla operations, implementation of a Python control service (hadoop2yt) and a Go control service (yt-dumpster), development of a high‑performance C++ mapper using Apache Arrow. Testing was performed manually on real production data using monitoring metrics. Results – the hadoop2yt and yt-dumpster engines have been developed, tested and deployed in production. No data loss was observed. Practical significance – developed engines are integrated into the VK Datatransfer infrastructure team and are used to solve real‑world data migration problems, demonstrating high fault tolerance, scalability.

Network User group Action
ILC SPbPU Local Network All
Read
Internet Authorized users SPbPU
Read
Internet Anonymous
  • Термины и определения
  • Список сокращений
  • Введение
  • Глава 1. Обзор предметной области
    • 1.1 Назначение и принцип работы сервиса Datatransfer
    • 1.2 Обзор существующих решений миграции больших объемов данных
      • 1.2.1 Debezium
      • 1.2.2 Apache Sqoop
    • 1.3 Сравнительный анализ систем
    • 1.4 Вывод
  • Глава 2. Архитектура сервиса Datatransfer
    • 2.1 Основные компоненты архитектуры YTsaurus
    • 2.2 Datatransfer Core
    • 2.3 Движки
    • 2.4 Вывод
  • Глава 3. Реализация hadoop2yt
    • 3.1 Сервис Hadoop2yt
      • 3.1.1 REST API
    • 3.2 hdfs-yt-mapper
    • 3.3 Вывод
  • Глава 4. Реализация yt-dumpster
    • 4.1 Сервис yt-dumpster
      • 4.1.1 REST API
    • 4.2 Mapper
    • 4.3 Вывод
  • Глава 5. Тестирование и запуск реальных поставок hadoop2yt
    • 5.1 Цели и подход к тестированию
    • 5.2 Перенос исторических данных датасета Одноклассников apiStat
    • 5.3 CDC трансфер на примере датасета AdsUsers
    • 5.4 Вывод
  • Глава 6. Тестирование и запуск реальных поставок yt-dumpster
    • 6.1 Конфигурация поставки
    • 6.2 Результаты тестирования
    • 6.3 Вывод
  • Заключение
  • Список используемых источников
  • Приложение
...