Детальная информация
| Название | Разработка и исследование модели извлечения структурированных данных из изображений российских кассовых чеков: выпускная квалификационная работа бакалавра: направление 02.03.01 «Математика и компьютерные науки» ; образовательная программа 02.03.01_01 «Системы искусственного интеллекта и суперкомпьютерные технологии» = Development and study of a model for extracting structured data from images of Russian cash register receipts |
|---|---|
| Авторы | Гаар Владислав Сергеевич |
| Научный руководитель | Мулюха Владимир Александрович |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | российские кассовые чеки ; OCR ; KIE ; извлечение ключевой информации ; PaddleOCR ; синтетические данные ; постобработка ; Russian receipts ; key information extraction ; synthetic data ; postprocessing |
| Тип документа | Выпускная квалификационная работа бакалавра |
| Язык | Русский |
| Уровень высшего образования | Бакалавриат |
| Код специальности ФГОС | 02.03.01 |
| Группа специальностей ФГОС | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-2587 |
| Права доступа | Доступ по паролю из сети Интернет (чтение, печать) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\42758 |
| Дата создания записи | 21.08.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
Тема выпускной квалификационной работы — разработка и исследование модели извлечения структурированных данных из изображений российских кассовых чеков. Предмет исследования — методы OCR, извлечения ключевой информации, синтетического расширения выборки и доменной постобработки. Цель работы — построить и оценить воспроизводимый OCR/KIE-конвейер для российских чеков. Методика включает анализ существующих подходов, подготовку корпуса реальных чеков, преобразование разметки в наборы DET, REC и SER, разработку генератора синтетических чеков, дообучение моделей PaddleOCR и E2E-оценку на фиксированной тестовой выборке. Для воспроизводимости подготовлен открытый маскированный тестовый экспорт. Разработан программный конвейер подготовки данных, обучения, применения моделей (инференса), постобработки и расчёта метрик. Лучший нейросетевой вариант использовал предварительное обучение OCR- и SER-компонентов на синтетических чеках с последующим дообучением на реальных данных. После выбора режима обработки по валидационной выборке итоговая E2E F1 на тестовой выборке составила 0,64015; диагностический прогон полного набора доменных правил показал потенциальный прирост до 0,68493. Результаты применимы для локальной обработки чеков, проверки OCR/KIE-моделей и подготовки обезличенных наборов данных. Сделан вывод, что синтетические данные полезны при ограниченной разметке, но дальнейшее улучшение требует расширения корпуса и уточнения правил выделения текстовых областей.
The topic of the graduate qualification work is the development and study of a model for extracting structured data from images of Russian cash register receipts. The subject of the study is OCR methods, key information extraction, synthetic training set expansion, and domain-specific postprocessing. The purpose of the work is to build and evaluate a reproducible OCR/KIE pipeline for Russian receipts. The methodology includes analysis of existing approaches, preparation of a corpus of real receipts, conversion of annotations into DET, REC, and SER datasets, development of a synthetic receipt generator, fine-tuning of PaddleOCR models, and E2E evaluation on a fixed test set. A masked public test export was prepared for reproducible evaluation. A software pipeline for data preparation, training, model inference, postprocessing, and metric calculation was developed. The best neural configuration used OCR and SER pretraining on synthetic receipts followed by fine-tuning on real data. After the processing mode was selected on the validation set, the final E2E F1 on the test set reached 0.64015; a diagnostic run of the full domain-specific rule set showed a potential increase to 0.68493. The results can be applied to local receipt processing systems, OCR/KIE model evaluation, and preparation of anonymized datasets. The work concludes that synthetic data are useful when annotation is limited, while further improvement requires corpus expansion and refinement of text-region annotation rules.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|
- Определения, обозначения и сокращения
- Введение
- Исследование предметной области и постановка задачи
- Кассовый чек как объект обработки и источники данных
- OCR и извлечение ключевой информации из чеков
- Ограничения готовых решений и постановка задачи
- Выводы по главе
- Проектирование моделей и архитектуры экспериментального программного комплекса
- Требования и общая архитектура экспериментального комплекса
- Представление данных и модели OCR/KIE
- Дополнительные компоненты конвейера и защита данных
- Выводы по главе
- Методы работы конвейера и экспериментальная методика
- Подготовка данных и порядок применения конвейера
- Методика обучения и сравнения вариантов конвейера
- Метрики, экспериментальный протокол и анализ ошибок
- Выводы по главе
- Практическая реализация и экспериментальная оценка
- Программная реализация и подготовка данных
- Экспериментальный стенд и результаты модульной оценки
- Анализ результатов и практические рекомендации
- Анализ ошибок и ограничения решения
- Выводы по главе
- Заключение
- Список использованных источников
- Приложение А. Пример выходного JSON