Детальная информация
| Название | Комбинированная модель идентификации языка текста, устойчивая к нестандартному пользовательскому вводу, с адаптивными механизмами обработки чувствительных языковых пар: выпускная квалификационная работа бакалавра: направление 02.03.03 «Математическое обеспечение и администрирование информационных систем» ; образовательная программа 02.03.03_01 «Интеллектуальные информационные системы и обработка данных» = A combined model for text language identification robust to non-standard user input with adaptive mechanisms for processing sensitive language pairs |
|---|---|
| Авторы | Шмелева Мария Максимовна |
| Научный руководитель | Вербова Наталья Михайловна |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | идентификация языка ; fastText ; DistilBERT ; классификация текста ; обработка естественного языка ; language identification ; text classification ; natural language processing |
| Тип документа | Выпускная квалификационная работа бакалавра |
| Язык | Русский |
| Уровень высшего образования | Бакалавриат |
| Код специальности ФГОС | 02.03.03 |
| Группа специальностей ФГОС | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-2618 |
| Права доступа | Доступ по паролю из сети Интернет (чтение) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\42789 |
| Дата создания записи | 21.08.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет возможно после подготовки администраторами необходимых файлов
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
Объектом исследования является задача автоматической идентификации языка текста в международных чатах поддержки. Цель работы — разработать модель, которая определяет язык пользовательского сообщения при стандартной записи, короткой длине, ошибках, транслитерации, смешении письменностей и нестандартном вводе, а также отдельно учитывает чувствительные языковые пары: армянский–азербайджанский, урду–хинди, русский–украинский, иврит–арабский, арабский–фарси. Методология включает формирование обучающего набора из открытых источников и части реальных обращений, использование внутренних меток для разных вариантов письменности, обучение fastText-классификатора, подключение бинарных классификаторов для чувствительных пар и резервного DistilBERT, экспортированного в ONNX. Программная реализация выполнена на языке Python с использованием pandas, numpy, scikit-learn, fastText, PyTorch, transformers и onnxruntime; запуск экспериментов организован в Docker-среде. После очистки обучающий набор включает 82030 уникальных примеров. На реальных пользовательских данных полный пайплайн показал accuracy 0,9392 и macro F1 0,8684, превысив базовую fastText-модель по macro F1 на 0,1293. Результаты работы могут применяться для маршрутизации обращений и предварительной обработки сообщений в многоязычных службах поддержки.
The object of study is the task of automatic text language identification in international customer support chats. The aim of this work is to develop a model that detects the language of user messages written in standard form, as well as short texts, messages with spelling errors, transliteration, mixed scripts, and other forms of non-standard input, while also taking sensitive language pairs into account: Armenian–Azerbaijani, Urdu–Hindi, Russian–Ukrainian, Hebrew–Arabic, and Arabic–Farsi. The methodology includes building a training dataset from open sources and a part of real user requests, using internal labels to distinguish different script variants, training a fastText classifier, adding binary classifiers for sensitive pairs, and using a backup DistilBERT model exported to ONNX. The software implementation was developed in Python with pandas, numpy, scikit-learn, fastText, PyTorch, transformers, and onnxruntime; experiments were run in a Docker environment. After cleaning, the training dataset contains 82030 unique examples. On real user data, the full pipeline achieved an accuracy of 0.9392 and a macro F1 score of 0.8684, improving macro F1 by 0.1293 compared with the baseline fastText model. The results can be applied to request routing and preliminary message processing in multilingual support services.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|