Details

Title Комбинированная модель идентификации языка текста, устойчивая к нестандартному пользовательскому вводу, с адаптивными механизмами обработки чувствительных языковых пар: выпускная квалификационная работа бакалавра: направление 02.03.03 «Математическое обеспечение и администрирование информационных систем» ; образовательная программа 02.03.03_01 «Интеллектуальные информационные системы и обработка данных» = A combined model for text language identification robust to non-standard user input with adaptive mechanisms for processing sensitive language pairs
Creators Шмелева Мария Максимовна
Scientific adviser Вербова Наталья Михайловна
Organization Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects идентификация языка ; fastText ; DistilBERT ; классификация текста ; обработка естественного языка ; language identification ; text classification ; natural language processing
Document type Bachelor graduation qualification work
Language Russian
Level of education Bachelor
Speciality code (FGOS) 02.03.03
Speciality group (FGOS) 020000 - Компьютерные и информационные науки
DOI 10.18720/SPBPU/3/2026/vr/vr26-2618
Rights Доступ по паролю из сети Интернет (чтение)
Additionally New arrival
Record key ru\spstu\vkr\42789
Record create date 8/21/2026

Allowed Actions

Action 'Read' will be available if administrator prepare required files

Group Anonymous
Network Internet

Объектом исследования является задача автоматической идентификации языка текста в международных чатах поддержки. Цель работы — разработать модель, которая определяет язык пользовательского сообщения при стандартной записи, короткой длине, ошибках, транслитерации, смешении письменностей и нестандартном вводе, а также отдельно учитывает чувствительные языковые пары: армянский–азербайджанский, урду–хинди, русский–украинский, иврит–арабский, арабский–фарси. Методология включает формирование обучающего набора из открытых источников и части реальных обращений, использование внутренних меток для разных вариантов письменности, обучение fastText-классификатора, подключение бинарных классификаторов для чувствительных пар и резервного DistilBERT, экспортированного в ONNX. Программная реализация выполнена на языке Python с использованием pandas, numpy, scikit-learn, fastText, PyTorch, transformers и onnxruntime; запуск экспериментов организован в Docker-среде. После очистки обучающий набор включает 82030 уникальных примеров. На реальных пользовательских данных полный пайплайн показал accuracy 0,9392 и macro F1 0,8684, превысив базовую fastText-модель по macro F1 на 0,1293. Результаты работы могут применяться для маршрутизации обращений и предварительной обработки сообщений в многоязычных службах поддержки.

The object of study is the task of automatic text language identification in international customer support chats. The aim of this work is to develop a model that detects the language of user messages written in standard form, as well as short texts, messages with spelling errors, transliteration, mixed scripts, and other forms of non-standard input, while also taking sensitive language pairs into account: Armenian–Azerbaijani, Urdu–Hindi, Russian–Ukrainian, Hebrew–Arabic, and Arabic–Farsi. The methodology includes building a training dataset from open sources and a part of real user requests, using internal labels to distinguish different script variants, training a fastText classifier, adding binary classifiers for sensitive pairs, and using a backup DistilBERT model exported to ONNX. The software implementation was developed in Python with pandas, numpy, scikit-learn, fastText, PyTorch, transformers, and onnxruntime; experiments were run in a Docker environment. After cleaning, the training dataset contains 82030 unique examples. On real user data, the full pipeline achieved an accuracy of 0.9392 and a macro F1 score of 0.8684, improving macro F1 by 0.1293 compared with the baseline fastText model. The results can be applied to request routing and preliminary message processing in multilingual support services.

Network User group Action
ILC SPbPU Local Network All
Internet Authorized users SPbPU
Internet Anonymous
...