Детальная информация

Название Разработка сервиса миграции данных Datatransfer с использованием платформы распределенного хранения и обработки больших объемов данных YTsaurus: выпускная квалификационная работа бакалавра: направление 09.03.04 «Программная инженерия» ; образовательная программа 09.03.04_01 «Технология разработки и сопровождения качественного программного продукта» = Development of the Datatransfer data migration service using the YTsaurus distributed storage and processing platform for large amounts of data
Авторы Молотов Кирилл Дмитриевич
Научный руководитель Смирнов Николай Георгиевич
Организация Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Выходные сведения Санкт-Петербург, 2026
Коллекция Выпускные квалификационные работы ; Общая коллекция
Тематика миграция данных ; ytsaurus ; hdfs ; clickhouse ; распределенная обработка данных ; mapreduce ; apache arrow ; hadoop2yt ; yt-dumpster ; distributed data processing
Тип документа Выпускная квалификационная работа бакалавра
Язык Русский
Уровень высшего образования Бакалавриат
Код специальности ФГОС 09.03.04
Группа специальностей ФГОС 090000 - Информатика и вычислительная техника
DOI 10.18720/SPBPU/3/2026/vr/vr26-2724
Права доступа Доступ по паролю из сети Интернет (чтение)
Дополнительно Новинка
Ключ записи ru\spstu\vkr\42610
Дата создания записи 21.08.2026

Разрешенные действия

Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Группа Анонимные пользователи
Сеть Интернет

Объект исследования – процесс миграции больших объёмов данных из разнородных источников (HDFS) в платформу распределенного хранения и обработки данных YTsaurus, а также обратная выгрузка из YTsaurus в аналитическую систему ClickHouse. Цель работы – разработка и описание двух движков – hadoop2yt (перенос данных из HDFS в статические таблицы YTsaurus) и yt-dumpster (выгрузка данных из YTsaurus в ClickHouse), расширяющих функциональность существующего сервиса миграции данных Datatransfer компании VK. Методы – анализ существующих решений (Debezium, Apache Sqoop), проектирование микросервисной архитектуры с использованием операций MapReduce платформы YTsaurus, реализация управляющего сервиса на Python (hadoop2yt) и Go (yt-dumpster), разработка высокопроизводительного C++ маппера на базе Apache Arrow. Тестирование проводилось вручную на реальных промышленных данных с оценкой метрик мониторинга. Результаты – разработаны, протестированы и внедрены в промышленную эксплуатацию движки hadoop2yt и yt-dumpster. Ошибок, приводящих к потере данных, не зафиксировано. Практическая значимость – разработанные движки интегрированы в инфраструктурную команду Datatransfer компании VK и используются для решения реальных задач миграции данных, подтверждая высокую отказоустойчивость, масштабируемость.

Object of research – the process of migrating large (petabyte-scale) data from heterogeneous sources (HDFS) into the YTsaurus distributed storage and processing platform, as well as reverse export from YTsaurus to the ClickHouse analytical system. Objective – to develop and describe two engines – hadoop2yt (transferring data from HDFS to YTsaurus static tables) and yt-dumpster (exporting data from YTsaurus to ClickHouse), which extend the functionality of the existing VK data migration service Datatransfer. Methods – analysis of existing solutions (Debezium, Apache Sqoop), design of a microservice architecture based on YTsaurus MapReduce and Vanilla operations, implementation of a Python control service (hadoop2yt) and a Go control service (yt-dumpster), development of a high‑performance C++ mapper using Apache Arrow. Testing was performed manually on real production data using monitoring metrics. Results – the hadoop2yt and yt-dumpster engines have been developed, tested and deployed in production. No data loss was observed. Practical significance – developed engines are integrated into the VK Datatransfer infrastructure team and are used to solve real‑world data migration problems, demonstrating high fault tolerance, scalability.

Место доступа Группа пользователей Действие
Локальная сеть ИБК СПбПУ Все
Прочитать
Интернет Авторизованные пользователи СПбПУ
Прочитать
Интернет Анонимные пользователи
  • Термины и определения
  • Список сокращений
  • Введение
  • Глава 1. Обзор предметной области
    • 1.1 Назначение и принцип работы сервиса Datatransfer
    • 1.2 Обзор существующих решений миграции больших объемов данных
      • 1.2.1 Debezium
      • 1.2.2 Apache Sqoop
    • 1.3 Сравнительный анализ систем
    • 1.4 Вывод
  • Глава 2. Архитектура сервиса Datatransfer
    • 2.1 Основные компоненты архитектуры YTsaurus
    • 2.2 Datatransfer Core
    • 2.3 Движки
    • 2.4 Вывод
  • Глава 3. Реализация hadoop2yt
    • 3.1 Сервис Hadoop2yt
      • 3.1.1 REST API
    • 3.2 hdfs-yt-mapper
    • 3.3 Вывод
  • Глава 4. Реализация yt-dumpster
    • 4.1 Сервис yt-dumpster
      • 4.1.1 REST API
    • 4.2 Mapper
    • 4.3 Вывод
  • Глава 5. Тестирование и запуск реальных поставок hadoop2yt
    • 5.1 Цели и подход к тестированию
    • 5.2 Перенос исторических данных датасета Одноклассников apiStat
    • 5.3 CDC трансфер на примере датасета AdsUsers
    • 5.4 Вывод
  • Глава 6. Тестирование и запуск реальных поставок yt-dumpster
    • 6.1 Конфигурация поставки
    • 6.2 Результаты тестирования
    • 6.3 Вывод
  • Заключение
  • Список используемых источников
  • Приложение
...