Details
| Title | Комбинированная модель идентификации языка текста, устойчивая к нестандартному пользовательскому вводу, с адаптивными механизмами обработки чувствительных языковых пар: выпускная квалификационная работа бакалавра: направление 02.03.03 «Математическое обеспечение и администрирование информационных систем» ; образовательная программа 02.03.03_01 «Интеллектуальные информационные системы и обработка данных» = A combined model for text language identification robust to non-standard user input with adaptive mechanisms for processing sensitive language pairs |
|---|---|
| Creators | Шмелева Мария Максимовна |
| Scientific adviser | Вербова Наталья Михайловна |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | идентификация языка ; fastText ; DistilBERT ; классификация текста ; обработка естественного языка ; language identification ; text classification ; natural language processing |
| Document type | Bachelor graduation qualification work |
| Language | Russian |
| Level of education | Bachelor |
| Speciality code (FGOS) | 02.03.03 |
| Speciality group (FGOS) | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-2618 |
| Rights | Доступ по паролю из сети Интернет (чтение) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\42789 |
| Record create date | 8/21/2026 |
Allowed Actions
–
Action 'Read' will be available if administrator prepare required files
| Group | Anonymous |
|---|---|
| Network | Internet |
Объектом исследования является задача автоматической идентификации языка текста в международных чатах поддержки. Цель работы — разработать модель, которая определяет язык пользовательского сообщения при стандартной записи, короткой длине, ошибках, транслитерации, смешении письменностей и нестандартном вводе, а также отдельно учитывает чувствительные языковые пары: армянский–азербайджанский, урду–хинди, русский–украинский, иврит–арабский, арабский–фарси. Методология включает формирование обучающего набора из открытых источников и части реальных обращений, использование внутренних меток для разных вариантов письменности, обучение fastText-классификатора, подключение бинарных классификаторов для чувствительных пар и резервного DistilBERT, экспортированного в ONNX. Программная реализация выполнена на языке Python с использованием pandas, numpy, scikit-learn, fastText, PyTorch, transformers и onnxruntime; запуск экспериментов организован в Docker-среде. После очистки обучающий набор включает 82030 уникальных примеров. На реальных пользовательских данных полный пайплайн показал accuracy 0,9392 и macro F1 0,8684, превысив базовую fastText-модель по macro F1 на 0,1293. Результаты работы могут применяться для маршрутизации обращений и предварительной обработки сообщений в многоязычных службах поддержки.
The object of study is the task of automatic text language identification in international customer support chats. The aim of this work is to develop a model that detects the language of user messages written in standard form, as well as short texts, messages with spelling errors, transliteration, mixed scripts, and other forms of non-standard input, while also taking sensitive language pairs into account: Armenian–Azerbaijani, Urdu–Hindi, Russian–Ukrainian, Hebrew–Arabic, and Arabic–Farsi. The methodology includes building a training dataset from open sources and a part of real user requests, using internal labels to distinguish different script variants, training a fastText classifier, adding binary classifiers for sensitive pairs, and using a backup DistilBERT model exported to ONNX. The software implementation was developed in Python with pandas, numpy, scikit-learn, fastText, PyTorch, transformers, and onnxruntime; experiments were run in a Docker environment. After cleaning, the training dataset contains 82030 unique examples. On real user data, the full pipeline achieved an accuracy of 0.9392 and a macro F1 score of 0.8684, improving macro F1 by 0.1293 compared with the baseline fastText model. The results can be applied to request routing and preliminary message processing in multilingual support services.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|