Details
| Title | Разработка сервиса миграции данных Datatransfer с использованием платформы распределенного хранения и обработки больших объемов данных YTsaurus: выпускная квалификационная работа бакалавра: направление 09.03.04 «Программная инженерия» ; образовательная программа 09.03.04_01 «Технология разработки и сопровождения качественного программного продукта» = Development of the Datatransfer data migration service using the YTsaurus distributed storage and processing platform for large amounts of data |
|---|---|
| Creators | Молотов Кирилл Дмитриевич |
| Scientific adviser | Смирнов Николай Георгиевич |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | миграция данных ; ytsaurus ; hdfs ; clickhouse ; распределенная обработка данных ; mapreduce ; apache arrow ; hadoop2yt ; yt-dumpster ; distributed data processing |
| Document type | Bachelor graduation qualification work |
| Language | Russian |
| Level of education | Bachelor |
| Speciality code (FGOS) | 09.03.04 |
| Speciality group (FGOS) | 090000 - Информатика и вычислительная техника |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-2724 |
| Rights | Доступ по паролю из сети Интернет (чтение) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\42610 |
| Record create date | 8/21/2026 |
Allowed Actions
–
Action 'Read' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
Объект исследования – процесс миграции больших объёмов данных из разнородных источников (HDFS) в платформу распределенного хранения и обработки данных YTsaurus, а также обратная выгрузка из YTsaurus в аналитическую систему ClickHouse. Цель работы – разработка и описание двух движков – hadoop2yt (перенос данных из HDFS в статические таблицы YTsaurus) и yt-dumpster (выгрузка данных из YTsaurus в ClickHouse), расширяющих функциональность существующего сервиса миграции данных Datatransfer компании VK. Методы – анализ существующих решений (Debezium, Apache Sqoop), проектирование микросервисной архитектуры с использованием операций MapReduce платформы YTsaurus, реализация управляющего сервиса на Python (hadoop2yt) и Go (yt-dumpster), разработка высокопроизводительного C++ маппера на базе Apache Arrow. Тестирование проводилось вручную на реальных промышленных данных с оценкой метрик мониторинга. Результаты – разработаны, протестированы и внедрены в промышленную эксплуатацию движки hadoop2yt и yt-dumpster. Ошибок, приводящих к потере данных, не зафиксировано. Практическая значимость – разработанные движки интегрированы в инфраструктурную команду Datatransfer компании VK и используются для решения реальных задач миграции данных, подтверждая высокую отказоустойчивость, масштабируемость.
Object of research – the process of migrating large (petabyte-scale) data from heterogeneous sources (HDFS) into the YTsaurus distributed storage and processing platform, as well as reverse export from YTsaurus to the ClickHouse analytical system. Objective – to develop and describe two engines – hadoop2yt (transferring data from HDFS to YTsaurus static tables) and yt-dumpster (exporting data from YTsaurus to ClickHouse), which extend the functionality of the existing VK data migration service Datatransfer. Methods – analysis of existing solutions (Debezium, Apache Sqoop), design of a microservice architecture based on YTsaurus MapReduce and Vanilla operations, implementation of a Python control service (hadoop2yt) and a Go control service (yt-dumpster), development of a high‑performance C++ mapper using Apache Arrow. Testing was performed manually on real production data using monitoring metrics. Results – the hadoop2yt and yt-dumpster engines have been developed, tested and deployed in production. No data loss was observed. Practical significance – developed engines are integrated into the VK Datatransfer infrastructure team and are used to solve real‑world data migration problems, demonstrating high fault tolerance, scalability.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|
- Термины и определения
- Список сокращений
- Введение
- Глава 1. Обзор предметной области
- 1.1 Назначение и принцип работы сервиса Datatransfer
- 1.2 Обзор существующих решений миграции больших объемов данных
- 1.2.1 Debezium
- 1.2.2 Apache Sqoop
- 1.3 Сравнительный анализ систем
- 1.4 Вывод
- Глава 2. Архитектура сервиса Datatransfer
- 2.1 Основные компоненты архитектуры YTsaurus
- 2.2 Datatransfer Core
- 2.3 Движки
- 2.4 Вывод
- Глава 3. Реализация hadoop2yt
- 3.1 Сервис Hadoop2yt
- 3.1.1 REST API
- 3.2 hdfs-yt-mapper
- 3.3 Вывод
- 3.1 Сервис Hadoop2yt
- Глава 4. Реализация yt-dumpster
- 4.1 Сервис yt-dumpster
- 4.1.1 REST API
- 4.2 Mapper
- 4.3 Вывод
- 4.1 Сервис yt-dumpster
- Глава 5. Тестирование и запуск реальных поставок hadoop2yt
- 5.1 Цели и подход к тестированию
- 5.2 Перенос исторических данных датасета Одноклассников apiStat
- 5.3 CDC трансфер на примере датасета AdsUsers
- 5.4 Вывод
- Глава 6. Тестирование и запуск реальных поставок yt-dumpster
- 6.1 Конфигурация поставки
- 6.2 Результаты тестирования
- 6.3 Вывод
- Заключение
- Список используемых источников
- Приложение