Details

Title Разработка и исследование модели извлечения структурированных данных из изображений российских кассовых чеков: выпускная квалификационная работа бакалавра: направление 02.03.01 «Математика и компьютерные науки» ; образовательная программа 02.03.01_01 «Системы искусственного интеллекта и суперкомпьютерные технологии» = Development and study of a model for extracting structured data from images of Russian cash register receipts
Creators Гаар Владислав Сергеевич
Scientific adviser Мулюха Владимир Александрович
Organization Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects российские кассовые чеки ; OCR ; KIE ; извлечение ключевой информации ; PaddleOCR ; синтетические данные ; постобработка ; Russian receipts ; key information extraction ; synthetic data ; postprocessing
Document type Bachelor graduation qualification work
Language Russian
Level of education Bachelor
Speciality code (FGOS) 02.03.01
Speciality group (FGOS) 020000 - Компьютерные и информационные науки
DOI 10.18720/SPBPU/3/2026/vr/vr26-2587
Rights Доступ по паролю из сети Интернет (чтение, печать)
Additionally New arrival
Record key ru\spstu\vkr\42758
Record create date 8/21/2026

Allowed Actions

Action 'Read' will be available if you login or access site from another network

Group Anonymous
Network Internet

Тема выпускной квалификационной работы — разработка и исследование модели извлечения структурированных данных из изображений российских кассовых чеков. Предмет исследования — методы OCR, извлечения ключевой информации, синтетического расширения выборки и доменной постобработки. Цель работы — построить и оценить воспроизводимый OCR/KIE-конвейер для российских чеков. Методика включает анализ существующих подходов, подготовку корпуса реальных чеков, преобразование разметки в наборы DET, REC и SER, разработку генератора синтетических чеков, дообучение моделей PaddleOCR и E2E-оценку на фиксированной тестовой выборке. Для воспроизводимости подготовлен открытый маскированный тестовый экспорт. Разработан программный конвейер подготовки данных, обучения, применения моделей (инференса), постобработки и расчёта метрик. Лучший нейросетевой вариант использовал предварительное обучение OCR- и SER-компонентов на синтетических чеках с последующим дообучением на реальных данных. После выбора режима обработки по валидационной выборке итоговая E2E F1 на тестовой выборке составила 0,64015; диагностический прогон полного набора доменных правил показал потенциальный прирост до 0,68493. Результаты применимы для локальной обработки чеков, проверки OCR/KIE-моделей и подготовки обезличенных наборов данных. Сделан вывод, что синтетические данные полезны при ограниченной разметке, но дальнейшее улучшение требует расширения корпуса и уточнения правил выделения текстовых областей.

The topic of the graduate qualification work is the development and study of a model for extracting structured data from images of Russian cash register receipts. The subject of the study is OCR methods, key information extraction, synthetic training set expansion, and domain-specific postprocessing. The purpose of the work is to build and evaluate a reproducible OCR/KIE pipeline for Russian receipts. The methodology includes analysis of existing approaches, preparation of a corpus of real receipts, conversion of annotations into DET, REC, and SER datasets, development of a synthetic receipt generator, fine-tuning of PaddleOCR models, and E2E evaluation on a fixed test set. A masked public test export was prepared for reproducible evaluation. A software pipeline for data preparation, training, model inference, postprocessing, and metric calculation was developed. The best neural configuration used OCR and SER pretraining on synthetic receipts followed by fine-tuning on real data. After the processing mode was selected on the validation set, the final E2E F1 on the test set reached 0.64015; a diagnostic run of the full domain-specific rule set showed a potential increase to 0.68493. The results can be applied to local receipt processing systems, OCR/KIE model evaluation, and preparation of anonymized datasets. The work concludes that synthetic data are useful when annotation is limited, while further improvement requires corpus expansion and refinement of text-region annotation rules.

Network User group Action
ILC SPbPU Local Network All
Read Print
Internet Authorized users SPbPU
Read Print
Internet Anonymous
  • Определения, обозначения и сокращения
  • Введение
  • Исследование предметной области и постановка задачи
    • Кассовый чек как объект обработки и источники данных
    • OCR и извлечение ключевой информации из чеков
    • Ограничения готовых решений и постановка задачи
    • Выводы по главе
  • Проектирование моделей и архитектуры экспериментального программного комплекса
    • Требования и общая архитектура экспериментального комплекса
    • Представление данных и модели OCR/KIE
    • Дополнительные компоненты конвейера и защита данных
    • Выводы по главе
  • Методы работы конвейера и экспериментальная методика
    • Подготовка данных и порядок применения конвейера
    • Методика обучения и сравнения вариантов конвейера
    • Метрики, экспериментальный протокол и анализ ошибок
    • Выводы по главе
  • Практическая реализация и экспериментальная оценка
    • Программная реализация и подготовка данных
    • Экспериментальный стенд и результаты модульной оценки
    • Анализ результатов и практические рекомендации
    • Анализ ошибок и ограничения решения
    • Выводы по главе
  • Заключение
  • Список использованных источников
  • Приложение А. Пример выходного JSON
...