Детальная информация
| Название | Автоматическое распознавание текстов XVIII в. на русском языке для лексикографической работы: выпускная квалификационная работа магистра: направление 45.04.04 «Интеллектуальные системы в гуманитарной среде» ; образовательная программа 45.04.04_02 «Цифровая лингвистика» = Automatic recognition of 18th-century russian texts for lexicographic research |
|---|---|
| Авторы | Симчера Даниил Иванович |
| Научный руководитель | Коваленко Кира Иосифовна |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Гуманитарный институт |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | OCR ; распознавание текста ; исторические тексты ; XVIII век ; цифровые гуманитарные науки ; постобработка ; большие языковые модели ; OCR4all ; TrOCR ; Tesseract ; историческая орфография ; цифровизация культурного наследия ; optical character recognition ; historical texts ; 18th century ; digital humanities ; post-processing ; LLM ; large language models ; historical orthography ; cultural heritage digitization |
| Тип документа | Выпускная квалификационная работа магистра |
| Язык | Русский |
| Уровень высшего образования | Магистратура |
| Код специальности ФГОС | 45.04.04 |
| Группа специальностей ФГОС | 450000 - Языкознание и литературоведение |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-5352 |
| Права доступа | Доступ по паролю из сети Интернет (чтение, печать) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\45731 |
| Дата создания записи | 10.09.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
Работа посвящена разработке и исследованию методов автоматического распознавания русских печатных текстов XVIII века. В исследовании рассматриваются особенности исторических источников, осложняющие задачу OCR, включая орфографическую и графическую вариативность, нестабильность типографики и физическую деградацию документов. Для проведения экспериментов были подготовлены обучающие датасеты, включающие как специализированный корпус на материале издания «География генералная» 1718 года, так и рас-ширенный корпус русских печатных текстов XVIII века из различных типографий и изданий. На основе данных материалов проведено обучение OCR-моделей Tesseract, OCR4all и TrOCR и выполнен сравнительный анализ качества распознавания с использованием метрик CER и WER. Наилучшие результаты показала модель OCR4all, особенно после адаптации к специализированному корпусу. Дополнительно разработан метод постобработки OCR-выхода с использованием большой языковой модели, основанный на принципе минимального вмешательства и сохранения исторической орфографии. Эксперименты показали, что применение LLM позволяет снизить количество ошибок распознавания, прежде всего символьных замен и ошибок сегментации. Практическая значимость работы связана с возможностью применения разработанного подхода в проектах цифровизации исторических источников, создании электронных библиотек и исторических текстовых корпусов.
This thesis is devoted to the development and evaluation of methods for the automatic recognition of 18th-century Russian printed texts. The study examines the specific characteristics of historical documents that complicate the OCR process, including orthographic and graphical variation, inconsistent typography, and the physical degradation of source materials. For the experiments, several training datasets were prepared, including a specialized corpus based on the 1718 edition of Geographia Generalis and an extended corpus of 18th-century Russian printed texts collected from different publications and printing houses. Using these datasets, OCR models based on Tesseract, OCR4all, and TrOCR were trained and evaluated. The recognition quality was assessed using the Character Error Rate (CER) and Word Error Rate (WER) metrics. The experimental results demonstrate that OCR4all achieved the highest recognition accuracy, particularly after adaptation to the specialized corpus. In addition, a post-processing method based on a large language model (LLM) was developed. The proposed approach follows the principle of minimal intervention and aims to preserve the historical orthography of the source text while correcting OCR errors. The experiments showed that LLM-based post-processing reduces recognition errors, especially character substitutions and segmentation errors. The practical significance of the study lies in the potential application of the proposed approach to the digitization of historical documents, the creation of electronic libraries, and the development of historical text corpora for linguistic and lexicographic research.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|