Details
| Title | Система автоматической классификации фотоматериалов в задачах эксплуатации интеллектуального учета электроэнергии: выпускная квалификационная работа бакалавра: направление 09.03.02 «Информационные системы и технологии» ; образовательная программа 09.03.02_02 «Информационные системы и технологии» = Automatic classification of photographic materials submitted to the work management system (ISUR) during maintenance of electricity metering devices |
|---|---|
| Creators | Ромашов Иван Андреевич |
| Scientific adviser | Хасанов Дмитрий Салимович |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Document type | Bachelor graduation qualification work |
| Language | Russian |
| Level of education | Bachelor |
| Speciality code (FGOS) | 09.03.02 |
| Speciality group (FGOS) | 090000 - Информатика и вычислительная техника |
| Rights | Текст не доступен в соответствии с распоряжением СПбПУ от 13.06.2017 г. № 91 |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\43888 |
| Record create date | 9/1/2026 |
Проведен аналитический обзор методов компьютерного зрения, обосновавший выбор однометочной классификации с функцией потерь CrossEntropyLoss и мультимодальных векторных представлений на базе открытых моделей OpenCLIP и SigLIP. Разработана методология формирования обучающих данных на основе двухконтурного механизма активного обучения с псевдоразметкой, позволившая расширить верифицированный набор Gold Standard объемом 52 122 изображений до 130 202 изображений при совокупном объеме ручной разметки 1 448 записей. Классификатор первого уровня на базе ConvNeXt-V2-Nano достиг F1-Macro 0,9931; экспертные классификаторы второго уровня на базе MobileNetV3-Large-100 показали взвешенный F1 0,98 и 0,95 соответственно. Сквозное тестирование каскада на 2 700 изображениях зафиксировало Macro F1 0,957 при доле корректного отклонения нецелевых изображений 94%. Программная реализация выполнена в виде веб-сервиса без сохранения состояния на FastAPI с асинхронным пулом соединений PostgreSQL. Время обработки одного изображения составляет 87–148 мс на CPU и 12–19 мс на GPU, что соответствует установленному требованию не более 200 мс. Весь технологический стек ограничен лицензиями MIT, Apache 2.0 и BSD.
An analytical review of computer vision methods justified the selection of single-label classification with CrossEntropyLoss and multimodal vector representations based on the open-source OpenCLIP and SigLIP models. A training data formation methodology based on a dual-loop active learning approach with pseudo-labeling was developed, enabling the expansion of the verified Gold Standard dataset of 52,122 images to 130,202 images with a total manual annotation volume of 1,448 records. The first-level classifier based on ConvNeXt-V2-Nano achieved an F1-Macro score of 0.9931; the second-level expert classifiers based on MobileNetV3-Large-100 demonstrated weighted F1 scores of 0.98 and 0.95, respectively. End-to-end cascade testing on 2,700 images yielded a Macro F1 of 0.957 with a 94% correct rejection rate for out-of-scope images. The software implementation is delivered as a stateless FastAPI web service with an asynchronous PostgreSQL connection pool. Single-image inference time is 87–148 ms on CPU and 12–19 ms on GPU, satisfying the established requirement of no more than 200 ms. The entire technology stack is covered by MIT, Apache 2.0, and BSD licenses.