Детальная информация
| Название | Разработка сервиса миграции данных Datatransfer с использованием платформы распределенного хранения и обработки больших объемов данных YTsaurus: выпускная квалификационная работа бакалавра: направление 09.03.04 «Программная инженерия» ; образовательная программа 09.03.04_01 «Технология разработки и сопровождения качественного программного продукта» = Development of the Datatransfer data migration service using the YTsaurus distributed storage and processing platform for large amounts of data |
|---|---|
| Авторы | Молотов Кирилл Дмитриевич |
| Научный руководитель | Смирнов Николай Георгиевич |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | миграция данных ; ytsaurus ; hdfs ; clickhouse ; распределенная обработка данных ; mapreduce ; apache arrow ; hadoop2yt ; yt-dumpster ; distributed data processing |
| Тип документа | Выпускная квалификационная работа бакалавра |
| Язык | Русский |
| Уровень высшего образования | Бакалавриат |
| Код специальности ФГОС | 09.03.04 |
| Группа специальностей ФГОС | 090000 - Информатика и вычислительная техника |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-2724 |
| Права доступа | Доступ по паролю из сети Интернет (чтение) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\42610 |
| Дата создания записи | 21.08.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
Объект исследования – процесс миграции больших объёмов данных из разнородных источников (HDFS) в платформу распределенного хранения и обработки данных YTsaurus, а также обратная выгрузка из YTsaurus в аналитическую систему ClickHouse. Цель работы – разработка и описание двух движков – hadoop2yt (перенос данных из HDFS в статические таблицы YTsaurus) и yt-dumpster (выгрузка данных из YTsaurus в ClickHouse), расширяющих функциональность существующего сервиса миграции данных Datatransfer компании VK. Методы – анализ существующих решений (Debezium, Apache Sqoop), проектирование микросервисной архитектуры с использованием операций MapReduce платформы YTsaurus, реализация управляющего сервиса на Python (hadoop2yt) и Go (yt-dumpster), разработка высокопроизводительного C++ маппера на базе Apache Arrow. Тестирование проводилось вручную на реальных промышленных данных с оценкой метрик мониторинга. Результаты – разработаны, протестированы и внедрены в промышленную эксплуатацию движки hadoop2yt и yt-dumpster. Ошибок, приводящих к потере данных, не зафиксировано. Практическая значимость – разработанные движки интегрированы в инфраструктурную команду Datatransfer компании VK и используются для решения реальных задач миграции данных, подтверждая высокую отказоустойчивость, масштабируемость.
Object of research – the process of migrating large (petabyte-scale) data from heterogeneous sources (HDFS) into the YTsaurus distributed storage and processing platform, as well as reverse export from YTsaurus to the ClickHouse analytical system. Objective – to develop and describe two engines – hadoop2yt (transferring data from HDFS to YTsaurus static tables) and yt-dumpster (exporting data from YTsaurus to ClickHouse), which extend the functionality of the existing VK data migration service Datatransfer. Methods – analysis of existing solutions (Debezium, Apache Sqoop), design of a microservice architecture based on YTsaurus MapReduce and Vanilla operations, implementation of a Python control service (hadoop2yt) and a Go control service (yt-dumpster), development of a high‑performance C++ mapper using Apache Arrow. Testing was performed manually on real production data using monitoring metrics. Results – the hadoop2yt and yt-dumpster engines have been developed, tested and deployed in production. No data loss was observed. Practical significance – developed engines are integrated into the VK Datatransfer infrastructure team and are used to solve real‑world data migration problems, demonstrating high fault tolerance, scalability.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|
- Термины и определения
- Список сокращений
- Введение
- Глава 1. Обзор предметной области
- 1.1 Назначение и принцип работы сервиса Datatransfer
- 1.2 Обзор существующих решений миграции больших объемов данных
- 1.2.1 Debezium
- 1.2.2 Apache Sqoop
- 1.3 Сравнительный анализ систем
- 1.4 Вывод
- Глава 2. Архитектура сервиса Datatransfer
- 2.1 Основные компоненты архитектуры YTsaurus
- 2.2 Datatransfer Core
- 2.3 Движки
- 2.4 Вывод
- Глава 3. Реализация hadoop2yt
- 3.1 Сервис Hadoop2yt
- 3.1.1 REST API
- 3.2 hdfs-yt-mapper
- 3.3 Вывод
- 3.1 Сервис Hadoop2yt
- Глава 4. Реализация yt-dumpster
- 4.1 Сервис yt-dumpster
- 4.1.1 REST API
- 4.2 Mapper
- 4.3 Вывод
- 4.1 Сервис yt-dumpster
- Глава 5. Тестирование и запуск реальных поставок hadoop2yt
- 5.1 Цели и подход к тестированию
- 5.2 Перенос исторических данных датасета Одноклассников apiStat
- 5.3 CDC трансфер на примере датасета AdsUsers
- 5.4 Вывод
- Глава 6. Тестирование и запуск реальных поставок yt-dumpster
- 6.1 Конфигурация поставки
- 6.2 Результаты тестирования
- 6.3 Вывод
- Заключение
- Список используемых источников
- Приложение