Details
| Title | Разработка и исследование модели извлечения структурированных данных из изображений российских кассовых чеков: выпускная квалификационная работа бакалавра: направление 02.03.01 «Математика и компьютерные науки» ; образовательная программа 02.03.01_01 «Системы искусственного интеллекта и суперкомпьютерные технологии» = Development and study of a model for extracting structured data from images of Russian cash register receipts |
|---|---|
| Creators | Гаар Владислав Сергеевич |
| Scientific adviser | Мулюха Владимир Александрович |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | российские кассовые чеки ; OCR ; KIE ; извлечение ключевой информации ; PaddleOCR ; синтетические данные ; постобработка ; Russian receipts ; key information extraction ; synthetic data ; postprocessing |
| Document type | Bachelor graduation qualification work |
| Language | Russian |
| Level of education | Bachelor |
| Speciality code (FGOS) | 02.03.01 |
| Speciality group (FGOS) | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-2587 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\42758 |
| Record create date | 8/21/2026 |
Allowed Actions
–
Action 'Read' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
Тема выпускной квалификационной работы — разработка и исследование модели извлечения структурированных данных из изображений российских кассовых чеков. Предмет исследования — методы OCR, извлечения ключевой информации, синтетического расширения выборки и доменной постобработки. Цель работы — построить и оценить воспроизводимый OCR/KIE-конвейер для российских чеков. Методика включает анализ существующих подходов, подготовку корпуса реальных чеков, преобразование разметки в наборы DET, REC и SER, разработку генератора синтетических чеков, дообучение моделей PaddleOCR и E2E-оценку на фиксированной тестовой выборке. Для воспроизводимости подготовлен открытый маскированный тестовый экспорт. Разработан программный конвейер подготовки данных, обучения, применения моделей (инференса), постобработки и расчёта метрик. Лучший нейросетевой вариант использовал предварительное обучение OCR- и SER-компонентов на синтетических чеках с последующим дообучением на реальных данных. После выбора режима обработки по валидационной выборке итоговая E2E F1 на тестовой выборке составила 0,64015; диагностический прогон полного набора доменных правил показал потенциальный прирост до 0,68493. Результаты применимы для локальной обработки чеков, проверки OCR/KIE-моделей и подготовки обезличенных наборов данных. Сделан вывод, что синтетические данные полезны при ограниченной разметке, но дальнейшее улучшение требует расширения корпуса и уточнения правил выделения текстовых областей.
The topic of the graduate qualification work is the development and study of a model for extracting structured data from images of Russian cash register receipts. The subject of the study is OCR methods, key information extraction, synthetic training set expansion, and domain-specific postprocessing. The purpose of the work is to build and evaluate a reproducible OCR/KIE pipeline for Russian receipts. The methodology includes analysis of existing approaches, preparation of a corpus of real receipts, conversion of annotations into DET, REC, and SER datasets, development of a synthetic receipt generator, fine-tuning of PaddleOCR models, and E2E evaluation on a fixed test set. A masked public test export was prepared for reproducible evaluation. A software pipeline for data preparation, training, model inference, postprocessing, and metric calculation was developed. The best neural configuration used OCR and SER pretraining on synthetic receipts followed by fine-tuning on real data. After the processing mode was selected on the validation set, the final E2E F1 on the test set reached 0.64015; a diagnostic run of the full domain-specific rule set showed a potential increase to 0.68493. The results can be applied to local receipt processing systems, OCR/KIE model evaluation, and preparation of anonymized datasets. The work concludes that synthetic data are useful when annotation is limited, while further improvement requires corpus expansion and refinement of text-region annotation rules.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|
- Определения, обозначения и сокращения
- Введение
- Исследование предметной области и постановка задачи
- Кассовый чек как объект обработки и источники данных
- OCR и извлечение ключевой информации из чеков
- Ограничения готовых решений и постановка задачи
- Выводы по главе
- Проектирование моделей и архитектуры экспериментального программного комплекса
- Требования и общая архитектура экспериментального комплекса
- Представление данных и модели OCR/KIE
- Дополнительные компоненты конвейера и защита данных
- Выводы по главе
- Методы работы конвейера и экспериментальная методика
- Подготовка данных и порядок применения конвейера
- Методика обучения и сравнения вариантов конвейера
- Метрики, экспериментальный протокол и анализ ошибок
- Выводы по главе
- Практическая реализация и экспериментальная оценка
- Программная реализация и подготовка данных
- Экспериментальный стенд и результаты модульной оценки
- Анализ результатов и практические рекомендации
- Анализ ошибок и ограничения решения
- Выводы по главе
- Заключение
- Список использованных источников
- Приложение А. Пример выходного JSON