Детальная информация

Название Инструмент для поиска и анализа описаний активов данных для обеспечения согласованности и сохранения качества данных в компании: выпускная квалификационная работа магистра: направление 09.04.02 «Информационные системы и технологии» ; образовательная программа 09.04.02_04 «Системный анализ и оптимизация информационных систем и технологий» = A tool for searching and analyzing data asset descriptions to ensure consistency and maintain data quality within the company
Авторы Чесноков Александр Сергеевич
Научный руководитель Хлопин Сергей Владимирович
Организация Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Выходные сведения Санкт-Петербург, 2026
Коллекция Выпускные квалификационные работы ; Общая коллекция
Тематика управление данными ; качество данных ; дата-актив ; корпоративный каталог данных ; семантический поиск ; обработка естественного языка ; эмбеддинги ; Sentence-BERT ; большие языковые модели ; структурно-семантическое сходство ; косинусная мера сходства ; каталог метаданных ; data management ; data quality ; data asset ; corporate data catalog ; semantic search ; natural language processing ; embeddings ; large language models ; structural-semantic similarity ; cosine similarity measure ; metadata catalog
Тип документа Выпускная квалификационная работа магистра
Язык Русский
Уровень высшего образования Магистратура
Код специальности ФГОС 09.04.02
Группа специальностей ФГОС 090000 - Информатика и вычислительная техника
DOI 10.18720/SPBPU/3/2026/vr/vr26-4270
Права доступа Доступ по паролю из сети Интернет (чтение)
Дополнительно Новинка
Ключ записи ru\spstu\vkr\44926
Дата создания записи 04.09.2026

Разрешенные действия

Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Группа Анонимные пользователи
Сеть Интернет

Данная работа посвящена разработке методологии и программного инструмента для автоматического поиска и анализа текстовых описаний дата-активов в корпоративных каталогах данных с использованием современных методов обработки естественного языка и нейросетевых моделей. Задачи, которые решались в ходе исследования: 1)Анализ предметной области управления данными и качества данных в соответствии с методологией DAMA-DMBOK. 2)Исследование существующих методов анализа текстов, семантического поиска и определения сходства текстовых описаний. 3)Разработка математической модели оценки сходства описаний дата-активов, учитывающей семантическое сходство, структурное соответствие и полноту описаний. 4)Разработка архитектуры программной системы и алгоритмов поиска похожих описаний. 5)Программная реализация прототипа системы на языке Python с использованием современных библиотек обработки естественного языка. 6)Экспериментальная оценка качества поиска и подбор параметров модели сходства. В работе предложен подход, основанный на использовании векторных представлений текстов, полученных с помощью модели Sentence-BERT, а также механизма нормализации описаний по пространствам категорий с использованием большой языковой модели. Итоговая оценка сходства рассчитывается как комбинация глобального семантического сходства, структурно-семантического сходства и степени структурного покрытия описаний. В результате исследования разработан прототип инструмента, позволяющий автоматически находить наиболее близкие по смыслу описания дата-активов в корпоративном каталоге данных. Проведенные эксперименты подтвердили работоспособность предложенного подхода и возможность его использования для повышения качества данных. Для достижения данных результатов в работе были использованы/разработаны следующие информационные технологии, в том числе Python, PostgreSQL, библиотека SentenceTransformers, библиотека scikit-learn, OpenAI API, JSON, SQL, средства объектно-ориентированного программирования и обработки естественного языка.

This work is devoted to the development of a methodology and software tool for automatic search and analysis of text descriptions of data assets in corporate data catalogs using modern methods of natural language processing and neural network models. The research set the following goals: 1)Analysis of the data management and data quality domains in accordance with the DAMA-DMBOK methodology. 2)Research of existing methods for text analysis, semantic search, and text description similarity determination. 3)Development of a mathematical model for assessing the similarity of data asset descriptions, taking into account semantic similarity, structural conformity, and description completeness. 4)Development of a software system architecture and algorithms for searching for similar descriptions. 5)Software implementation of a system prototype in Python using modern natural language processing libraries. 6)Experimental evaluation of search quality and selection of similarity model parameters. The paper proposes an approach based on the use of vector representations of texts obtained using the Sentence-BERT model, as well as a mechanism for normalizing descriptions across category spaces using a large language model. The final similarity score is calculated as a combination of global semantic similarity, structural-semantic similarity, and the degree of structural coverage of descriptions. As a result of the research, a prototype tool has been developed that allows you to automatically find the closest descriptions of data assets in the corporate data catalog. The experiments carried out have confirmed the efficiency of the proposed approach and the possibility of using it to improve data quality. To achieve these results, the following information technologies were used/developed in the work, including Python, PostgreSQL, the SentenceTransformers library, the scikit-learn library, the OpenAI API, JSON, SQL, object-oriented programming and natural language processing tools.

Место доступа Группа пользователей Действие
Локальная сеть ИБК СПбПУ Все
Прочитать
Интернет Авторизованные пользователи СПбПУ
Прочитать
Интернет Анонимные пользователи
  • СОДЕРЖАНИЕ
  • ВВЕДЕНИЕ
  • ГЛАВА 1. ТЕОРЕТИЧЕСКИЕ ОСНОВЫ АНАЛИЗА ТЕКСТОВЫХ ОПИСАНИЙ ДАТА-АКТИВОВ И ПОСТАНОВКА ЗАДАЧИ
    • 1.1 Роль управления данными и менеджмента данных в современных организациях
    • 1.2 Проблема согласованности текстовых описаний дата-активов
    • 1.3 Особенности структур описаний дата-активов
    • 1.4 Обзор существующих подходов к анализу текстовых описаний данных
      • 1.4.1 Поиск по ключевым словам и регулярным выражениям
      • 1.4.2. Методы, основанные на векторном представлении текста
      • 1.4.3 Семантический поиск
      • 1.4.4 Ограничения существующих подходов
    • 1.5 Постановка задачи исследования
    • 1.6 Выводы по Главе 1
  • ГЛАВА 2. МАТЕМАТИЧЕСКАЯ МОДЕЛЬ И МЕТОДОЛОГИЯ АНАЛИЗА СОГЛАСОВАННОСТИ ОПИСАНИЙ ДАТА-АКТИВОВ
    • 2.1 Формальная постановка задачи
    • 2.2 Векторное представление текстовых описаний
    • 2.3 Косинусная мера сходства
    • 2.4 Пространства категорий и нормализация описаний
    • 2.5 Структурно-семантическое представление и метрика сходства
      • 2.5.1 Глобальное семантическое сходство
      • 2.5.2 Структурно-семантическое сходство
      • 2.5.3 Оценка структурного покрытия
    • 2.6 Итоговая модель сходства и её свойства
    • 2.7 Алгоритм решения задачи поиска похожих описаний
      • 2.7.1. Этап 1. Предобработка и индексирование каталога
      • 2.7.2. Этап 2. Обработка входного текста
      • 2.7.3 Этап 3. Вычисление сходства
      • 2.7.4 Этап 4. Ранжирование
      • 2.7.5. Особенности реализации алгоритма
    • 2.8 Подбор коэффициентов итоговой функции сходства
    • 2.9 Оценка производительности системы на основе теории массового обслуживания
    • 2.10 Выводы по Главе 2
  • ГЛАВА 3. ПРОЕКТИРОВАНИЕ АРХИТЕКТУРЫ И АЛГОРИТМОВ СИСТЕМЫ ПОИСКА ПОХОЖИХ ОПИСАНИЙ ДАТА-АКТИВОВ
    • 3.1 Выбор средств реализации
    • 3.2 Архитектура данных
      • 3.2.1 Таблица текстовых описаний (text_descriptions)
      • 3.2.2 Таблица шаблонов (templates)
      • 3.2.3 Таблица связи описаний и шаблонов (description_template_embeddings)
    • 3.3 Архитектура классов
      • 3.3.1 Класс Database
      • 3.3.2. Репозитории
      • 3.3.3 Класс моделей данных
      • 3.3.4 Сервис для вычисления эмбеддингов
      • 3.3.5 Сервис нормализации текста по категориям шаблона
      • 3.3.6 Сервис вычисления сходства двух текстовых описаний
      • 3.3.7 Клиентский сервис
    • 3.4. Основной алгоритм работы инструмента поиска похожих описаний
    • 3.5 Дополнительные и вложенные алгоритмы
      • 3.5.1 Наполнение базы данных
      • 3.5.2 Алгоритм нормализации
      • 3.5.3 Алгоритм имитации нормализации
      • 3.5.4 Алгоритм подсчета структурно-семантического сходства
      • 3.5.5 Алгоритм подсчета структурного покрытия
    • 3.6 Выводы по Главе 3
  • ГЛАВА 4. ПРАКТИЧЕСКАЯ РЕАЛИЗАЦИЯ СИСТЕМЫ ПОИСКА ПОХОЖИХ ОПИСАНИЙ ДАТА-АКТИВОВ И ЭКСПЕРИМЕНТАЛЬНАЯ ОЦЕНКА
    • 4.1 Программная реализация ключевых элементов
      • 4.1.1 Класс Database
      • 4.1.2. Репозитории
      • 4.1.3 Классы моделей данных
      • 4.1.4 Класс EmbeddingService
      • 4.1.5 LlmService
      • 4.1.6 MockLLMNormalizationService
      • 4.1.7 SimilarityService
      • 4.1.8 ClientService
    • 4.2 Реализация скриптов запуска и наполнения базы данных
    • 4.3 Эксперимент
      • 4.3.1 Подбор коэффициентов
      • 4.3.2 Сравнение с классическим подходом
      • 4.3.3 Анализ поведения модели на нерелевантных входных текстах
      • 4.3.4. Оценка производительности системы на основе модели СМО
      • 4.3.5 Выводы эксперимента
    • 4.4 Выводы по Главе 4
  • ЗАКЛЮЧЕНИЕ
  • СПИСОК ИСПОЛЬЗОВАННЫХ ИСТОЧНИКОВ
  • ПРИЛОЖЕНИЕ А ДИАГРАММА КЛАССОВ
  • ПРИЛОЖЕНИЕ Б ДИАГРАММА ПОСЛЕДОВАТЕЛЬНОСТИ
  • ПРИЛОЖЕНИЕ В ПРОГРАММНЫЙ КОД СЕРВИСА
...