Детальная информация

Название Разработка алгоритма извлечения структурированных данных из изображений столбчатых диаграмм с неполной визуальной информацией: выпускная квалификационная работа бакалавра: направление 02.03.01 «Математика и компьютерные науки» ; образовательная программа 02.03.01_01 «Системы искусственного интеллекта и суперкомпьютерные технологии» = Development of a Hybrid Algorithm for Extracting Structured Data from Bar Chart Images with Incomplete Visual Information
Авторы Богданова Елизавета Михайловна
Научный руководитель Мулюха Владимир Александрович
Организация Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Выходные сведения Санкт-Петербург, 2026
Коллекция Выпускные квалификационные работы ; Общая коллекция
Тематика извлечение данных ; столбчатые диаграммы ; компьютерное зрение ; мультимодальные большие языковые модели ; yolo ; paddleocr ; qwen ; гибридный алгоритм ; data extraction ; bar charts ; computer vision ; multimodal large language models ; hybrid algorithm
Тип документа Выпускная квалификационная работа бакалавра
Язык Русский
Уровень высшего образования Бакалавриат
Код специальности ФГОС 02.03.01
Группа специальностей ФГОС 020000 - Компьютерные и информационные науки
DOI 10.18720/SPBPU/3/2026/vr/vr26-2578
Права доступа Доступ по паролю из сети Интернет (чтение, печать, копирование)
Дополнительно Новинка
Ключ записи ru\spstu\vkr\42749
Дата создания записи 21.08.2026

Разрешенные действия

Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Группа Анонимные пользователи
Сеть Интернет

Тема выпускной квалификационной работы: «Разработка гибридного алгоритма извлечения структурированных данных из изображений столбчатых диаграмм с неполной визуальной информацией». Целью работы является разработка алгоритма, обеспечивающего устойчивое извлечение числовых и семантических данных из изображений диаграмм путем объединения геометрической точности методов компьютерного зрения и гибкости больших языковых моделей. Объектом исследования выступают методы автоматического анализа графических изображений, в частности столбчатых диаграмм. Для достижения поставленной цели решены следующие задачи: проведен сравнительный анализ существующих подходов (классическое CV, глубокое обучение, MLLM); разработана каскадная архитектура системы; реализованы модули детекции на базе YOLOv8n, распознавания текста через PaddleOCR и семантического анализа с использованием модели Qwen3.5-35B-A3B; предложен метод адаптивных зон влияния для привязки текста и алгоритм калибровки масштаба; сформирован специализированный датасет из 3911 изображений для обучения и тестирования. В ходе работы была исследована эффективность различных архитектур детекторов. Экспериментально доказано, что гибридный алгоритм снижает медианную абсолютную процентную ошибку (MdAPE) более чем в 3 раза по сравнению с чистым CV-подходом (5.98% против 18.62%) и стабилизирует работу языковых моделей на зашумленных данных. На реальных данных достигнута точность MdAPE 1.34%. Полученные результаты могут быть использованы при создании систем интеллектуального анализа документов, оцифровки архивов и автоматизации ввода данных из технической документации. Для реализации программного обеспечения использовались язык программирования Python, библиотеки OpenCV и NumPy, фреймворк Ultralytics YOLO, система OCR PaddleOCR, а также API-сервис OpenRouter для взаимодействия с мультимодальной моделью Qwen.

The subject of the graduate qualification work is «Development of a Hybrid Algorithm for Extracting Structured Data from Bar Chart Images with Incomplete Visual Information». The purpose of the study is the development of an algorithm ensuring robust extraction of numerical and semantic data from chart images by combining the geometric precision of computer vision methods with the flexibility of large language models. The object of the work is methods for automated analysis of graphical images, particularly bar charts. The research set the following goals: 1.Comparative analysis of existing approaches (classical CV, deep learning, MLLM). 2. Development of a cascading system architecture. 3. Implementation of detection modules based on YOLOv8n, text recognition through PaddleOCR, and semantic analysis using the Qwen3.5-35B-A3B model. 4. Proposal of an adaptive zone-of-influence method for text anchoring and a scale calibration algorithm. 5. Creation of a specialized dataset of 3,911 images for training and testing. During the work, the efficiency of various detector architectures was investigated. Modern approaches to chart analysis were analyzed. The work resulted in the experimental proof that the hybrid algorithm reduces the Median Absolute Percentage Error (MdAPE) by more than 3 times compared to a pure CV approach (5.98% vs 18.62%) and stabilizes the performance of language models on noisy data. On real-world data, an MdAPE accuracy of 1.34% was achieved. The results could be used in the development of intelligent document analysis systems, archive digitization, and automation of data entry from technical documentation. To achieve these results, software was developed using the Python programming language, OpenCV and NumPy libraries, Ultralytics YOLO framework, PaddleOCR system, and the OpenRouter API service for interaction with the multimodal Qwen model.

Место доступа Группа пользователей Действие
Локальная сеть ИБК СПбПУ Все
Прочитать Печать Загрузить
Интернет Авторизованные пользователи СПбПУ
Прочитать Печать Загрузить
Интернет Анонимные пользователи
  • РЕФЕРАТ
  • ABSTRACT
  • ОПРЕДЕЛЕНИЯ, ОБОЗНАЧЕНИЯ И СОКРАЩЕНИЯ
  • ВВЕДЕНИЕ
  • АКТУАЛЬНОСТЬ
  • Анализ методов извлечения данных из изображений
    • Основные подходы к извлечению данных из изображений диаграмм
      • Классический подход: компьютерное зрение и обработка изображений
      • Подход на основе глубокого обучения
        • Классификация типов диаграмм с помощью сверточных нейронных сетей (Convolutional Neural Network, CNN)
        • Детекция объектов и проблема локализации элементов
        • Трансформерные архитектуры в анализе диаграмм
        • Гибридные подходы: объединение классического CV и Deep Learning
        • Ограничения подходов, основанных исключительно на глубоком обучении
      • Мультимодальные большие языковые модели (MLLM)
        • Преимущества и недостатки MLLM
    • Специфика задачи извлечения данных из столбчатых диаграмм
      • Структурные элементы столбчатой диаграммы
      • Типы проблемных случаев и «шумные» данные
        • Отсутствие явных числовых меток и необходимость оценки по шкале
        • Визуальный шум и артефакты сжатия
        • Сложная компоновка: группированные и стековые диаграммы
        • Семантическая неоднозначность: схожие цвета и отсутствие легенды
    • Метрики оценки качества извлечения данных
      • Метрики качества детекции объектов
      • Метрики точности извлечения числовых значений
      • Метрики оценки семантической и визуальной согласованности
      • Метрики производительности
    • Выводы к главе
  • ФОРМАЛЬНАЯ ПОСТАНОВКА ЗАДАЧИ
  • РАЗРАБОТКА ГИБРИДНОГО АЛГОРИТМА ИЗВЛЕЧЕНИЯ СТРУКТУРИРОВАННЫХ ДАННЫХ ИЗ ИЗОБРАЖЕНИЙ СТОЛБЧАТЫХ ДИАГРАММ С НЕПОЛНОЙ ВИЗУАЛЬНОЙ ИНФОРМАЦИЕЙ
    • Архитектура предлагаемого гибридного решения
      • Общая схема пайплайна обработки изображения
      • Обоснование каскадной архитектуры: разделение задач детекции, распознавания и семантического анализа
    • Выбор и обоснование стека технологий
      • Язык программирования Python и библиотеки компьютерного зрения
      • Фреймворк Ultralytics YOLO: преимущества для задачи детекции объектов
      • Система оптического распознавания символов PaddleOCR
        • Мультимодальная большая языковая модель Qwen3.5-35B-A3B
        • Запрос в MLLM и спецификация формата вывода
      • Инфраструктура взаимодействия: OpenRouter API
    • Подготовка датасета для обучения и тестирования детектора
      • Методология формирования датасета
      • Описание групп экспериментального датасета
      • Процесс разметки и формат аннотаций
    • Сравнительный анализ архитектур детекции объектов и выбор базовой модели
      • Результаты сравнительного тестирования
      • Анализ результатов и выбор финальной архитектуры
    • Разработка алгоритмических модулей системы
      • Модуль предобработки и детекции геометрических примитивов
      • Модуль пространственной ассоциации текстовых меток (OCR)
      • Модуль адаптивной калибровки масштаба и семантического слияния
    • Выводы к главе
  • ЭКСПЕРИМЕНТАЛЬНАЯ ОЦЕНКА ЭФФЕКТИВНОСТИ ГИБРИДНОГО АЛГОРИТМА
    • Методология расчета метрик качества
      • Медианная абсолютная процентная ошибка (MdAPE)
      • Точность в пределах порога (Acc@10%)
      • Коэффициент детерминации (R2 Median)
      • Точность распознавания меток (Label Exact Match)
    • Результаты эксперимента
    • Анализ результатов
    • Выводы к главе
  • ЗАКЛЮЧЕНИЕ
  • СПИСОК ИСПОЛЬЗОВАННЫХ ИСТОЧНИКОВ
...