Details
| Title | Разработка алгоритма извлечения структурированных данных из изображений столбчатых диаграмм с неполной визуальной информацией: выпускная квалификационная работа бакалавра: направление 02.03.01 «Математика и компьютерные науки» ; образовательная программа 02.03.01_01 «Системы искусственного интеллекта и суперкомпьютерные технологии» = Development of a Hybrid Algorithm for Extracting Structured Data from Bar Chart Images with Incomplete Visual Information |
|---|---|
| Creators | Богданова Елизавета Михайловна |
| Scientific adviser | Мулюха Владимир Александрович |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | извлечение данных ; столбчатые диаграммы ; компьютерное зрение ; мультимодальные большие языковые модели ; yolo ; paddleocr ; qwen ; гибридный алгоритм ; data extraction ; bar charts ; computer vision ; multimodal large language models ; hybrid algorithm |
| Document type | Bachelor graduation qualification work |
| Language | Russian |
| Level of education | Bachelor |
| Speciality code (FGOS) | 02.03.01 |
| Speciality group (FGOS) | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-2578 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\42749 |
| Record create date | 8/21/2026 |
Allowed Actions
–
Action 'Read' will be available if you login or access site from another network
Action 'Download' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
Тема выпускной квалификационной работы: «Разработка гибридного алгоритма извлечения структурированных данных из изображений столбчатых диаграмм с неполной визуальной информацией». Целью работы является разработка алгоритма, обеспечивающего устойчивое извлечение числовых и семантических данных из изображений диаграмм путем объединения геометрической точности методов компьютерного зрения и гибкости больших языковых моделей. Объектом исследования выступают методы автоматического анализа графических изображений, в частности столбчатых диаграмм. Для достижения поставленной цели решены следующие задачи: проведен сравнительный анализ существующих подходов (классическое CV, глубокое обучение, MLLM); разработана каскадная архитектура системы; реализованы модули детекции на базе YOLOv8n, распознавания текста через PaddleOCR и семантического анализа с использованием модели Qwen3.5-35B-A3B; предложен метод адаптивных зон влияния для привязки текста и алгоритм калибровки масштаба; сформирован специализированный датасет из 3911 изображений для обучения и тестирования. В ходе работы была исследована эффективность различных архитектур детекторов. Экспериментально доказано, что гибридный алгоритм снижает медианную абсолютную процентную ошибку (MdAPE) более чем в 3 раза по сравнению с чистым CV-подходом (5.98% против 18.62%) и стабилизирует работу языковых моделей на зашумленных данных. На реальных данных достигнута точность MdAPE 1.34%. Полученные результаты могут быть использованы при создании систем интеллектуального анализа документов, оцифровки архивов и автоматизации ввода данных из технической документации. Для реализации программного обеспечения использовались язык программирования Python, библиотеки OpenCV и NumPy, фреймворк Ultralytics YOLO, система OCR PaddleOCR, а также API-сервис OpenRouter для взаимодействия с мультимодальной моделью Qwen.
The subject of the graduate qualification work is «Development of a Hybrid Algorithm for Extracting Structured Data from Bar Chart Images with Incomplete Visual Information». The purpose of the study is the development of an algorithm ensuring robust extraction of numerical and semantic data from chart images by combining the geometric precision of computer vision methods with the flexibility of large language models. The object of the work is methods for automated analysis of graphical images, particularly bar charts. The research set the following goals: 1.Comparative analysis of existing approaches (classical CV, deep learning, MLLM). 2. Development of a cascading system architecture. 3. Implementation of detection modules based on YOLOv8n, text recognition through PaddleOCR, and semantic analysis using the Qwen3.5-35B-A3B model. 4. Proposal of an adaptive zone-of-influence method for text anchoring and a scale calibration algorithm. 5. Creation of a specialized dataset of 3,911 images for training and testing. During the work, the efficiency of various detector architectures was investigated. Modern approaches to chart analysis were analyzed. The work resulted in the experimental proof that the hybrid algorithm reduces the Median Absolute Percentage Error (MdAPE) by more than 3 times compared to a pure CV approach (5.98% vs 18.62%) and stabilizes the performance of language models on noisy data. On real-world data, an MdAPE accuracy of 1.34% was achieved. The results could be used in the development of intelligent document analysis systems, archive digitization, and automation of data entry from technical documentation. To achieve these results, software was developed using the Python programming language, OpenCV and NumPy libraries, Ultralytics YOLO framework, PaddleOCR system, and the OpenRouter API service for interaction with the multimodal Qwen model.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|
- РЕФЕРАТ
- ABSTRACT
- ОПРЕДЕЛЕНИЯ, ОБОЗНАЧЕНИЯ И СОКРАЩЕНИЯ
- ВВЕДЕНИЕ
- АКТУАЛЬНОСТЬ
- Анализ методов извлечения данных из изображений
- Основные подходы к извлечению данных из изображений диаграмм
- Классический подход: компьютерное зрение и обработка изображений
- Подход на основе глубокого обучения
- Классификация типов диаграмм с помощью сверточных нейронных сетей (Convolutional Neural Network, CNN)
- Детекция объектов и проблема локализации элементов
- Трансформерные архитектуры в анализе диаграмм
- Гибридные подходы: объединение классического CV и Deep Learning
- Ограничения подходов, основанных исключительно на глубоком обучении
- Мультимодальные большие языковые модели (MLLM)
- Преимущества и недостатки MLLM
- Специфика задачи извлечения данных из столбчатых диаграмм
- Структурные элементы столбчатой диаграммы
- Типы проблемных случаев и «шумные» данные
- Отсутствие явных числовых меток и необходимость оценки по шкале
- Визуальный шум и артефакты сжатия
- Сложная компоновка: группированные и стековые диаграммы
- Семантическая неоднозначность: схожие цвета и отсутствие легенды
- Метрики оценки качества извлечения данных
- Метрики качества детекции объектов
- Метрики точности извлечения числовых значений
- Метрики оценки семантической и визуальной согласованности
- Метрики производительности
- Выводы к главе
- Основные подходы к извлечению данных из изображений диаграмм
- ФОРМАЛЬНАЯ ПОСТАНОВКА ЗАДАЧИ
- РАЗРАБОТКА ГИБРИДНОГО АЛГОРИТМА ИЗВЛЕЧЕНИЯ СТРУКТУРИРОВАННЫХ ДАННЫХ ИЗ ИЗОБРАЖЕНИЙ СТОЛБЧАТЫХ ДИАГРАММ С НЕПОЛНОЙ ВИЗУАЛЬНОЙ ИНФОРМАЦИЕЙ
- Архитектура предлагаемого гибридного решения
- Общая схема пайплайна обработки изображения
- Обоснование каскадной архитектуры: разделение задач детекции, распознавания и семантического анализа
- Выбор и обоснование стека технологий
- Язык программирования Python и библиотеки компьютерного зрения
- Фреймворк Ultralytics YOLO: преимущества для задачи детекции объектов
- Система оптического распознавания символов PaddleOCR
- Мультимодальная большая языковая модель Qwen3.5-35B-A3B
- Запрос в MLLM и спецификация формата вывода
- Инфраструктура взаимодействия: OpenRouter API
- Подготовка датасета для обучения и тестирования детектора
- Методология формирования датасета
- Описание групп экспериментального датасета
- Процесс разметки и формат аннотаций
- Сравнительный анализ архитектур детекции объектов и выбор базовой модели
- Результаты сравнительного тестирования
- Анализ результатов и выбор финальной архитектуры
- Разработка алгоритмических модулей системы
- Модуль предобработки и детекции геометрических примитивов
- Модуль пространственной ассоциации текстовых меток (OCR)
- Модуль адаптивной калибровки масштаба и семантического слияния
- Выводы к главе
- Архитектура предлагаемого гибридного решения
- ЭКСПЕРИМЕНТАЛЬНАЯ ОЦЕНКА ЭФФЕКТИВНОСТИ ГИБРИДНОГО АЛГОРИТМА
- Методология расчета метрик качества
- Медианная абсолютная процентная ошибка (MdAPE)
- Точность в пределах порога (Acc@10%)
- Коэффициент детерминации (R2 Median)
- Точность распознавания меток (Label Exact Match)
- Результаты эксперимента
- Анализ результатов
- Выводы к главе
- Методология расчета метрик качества
- ЗАКЛЮЧЕНИЕ
- СПИСОК ИСПОЛЬЗОВАННЫХ ИСТОЧНИКОВ