Details
| Title | Дообучение трансформерных моделей для сентимент-анализа русскоязычных текстов с эмодзи: выпускная квалификационная работа магистра: направление 45.04.04 «Интеллектуальные системы в гуманитарной среде» ; образовательная программа 45.04.04_02 «Цифровая лингвистика» = Fine-tuning Transformer Models for Sentiment Analysis of Russian-Language Texts Containing Emojis |
|---|---|
| Creators | Гарусова Дарья Александровна |
| Scientific adviser | Дмитриев Александр Владиславович |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Гуманитарный институт |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | сентимент-анализ ; эмодзи ; BERT ; трансформерные модели ; обработка естественного языка (nlp) ; тональность текста ; русский язык ; цифровая коммуникация ; дообучение модели ; токенизация ; корпус текстов ; telegram ; адаптация модели ; sentiment analysis ; emojis ; transformer models ; natural language processing (NLP) ; text sentiment ; Russian language ; digital communication ; model fine-tuning ; tokenization ; text corpus ; model adaptation |
| Document type | Master graduation qualification work |
| Language | Russian |
| Level of education | Master |
| Speciality code (FGOS) | 45.04.04 |
| Speciality group (FGOS) | 450000 - Языкознание и литературоведение |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-5696 |
| Rights | Доступ по паролю из сети Интернет (чтение) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\45535 |
| Record create date | 9/10/2026 |
Allowed Actions
–
Action 'Read' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
В данной работе исследуются методы адаптации трансформерных моделей семейства BERT для повышения качества сентимент-анализа русскоязычных пользовательских текстов, содержащих эмодзи. В ходе исследования рассмотрены функции эмодзи в цифровой коммуникации и выявлены основные проблемы их автоматической интерпретации в задачах обработки естественного языка. Для проведения эксперимента сформирован специализированный корпус русскоязычных сообщений из мессенджера Telegram (1016 текстов), выполнена ручная разметка по категориям тональности (POSITIVE, NEUTRAL, NEGATIVE). Проведён сравнительный анализ трёх предобученных моделей (RuBERT-Sentiment, XLM-RoBERTa-Twitter, BERT Multilingual), показавший преимущество доменной адаптации перед языковой специализацией при работе с текстами, содержащими эмодзи. Разработан и реализован двухэтапный подход к адаптации модели: расширение словаря токенизатора путём добавления 159 эмодзи с последующим дообучением на созданном корпусе. Результаты эксперимента показали, что простое расширение токенизатора без обучения не приводит к улучшению качества, тогда как комплексная адаптация (расширение + дообучение) повышает Accuracy с 0,46 до 0,54, а Macro F1 – с 0,4567 до 0,5162. Наилучшие результаты достигнуты для негативной тональности (F1=0,6042). Полученные результаты подтверждают, что эмодзи являются значимыми элементами пользовательского контента и их учёт на всех этапах обработки – от токенизации до обучения – необходим для эффективного сентимент-анализа в цифровой коммуникации.
This study investigates methods for adapting transformer models of the BERT family to improve the quality of sentiment analysis for Russian-language user-generated texts containing emojis. The research examines the functions of emojis in digital communication and identifies the main challenges of their automatic interpretation in natural language processing tasks. For the experiment, a specialized corpus of Russian-language messages from the Telegram messenger (1,016 texts) was compiled, with manual annotation by sentiment categories (POSITIVE, NEUTRAL, NEGATIVE). A comparative analysis of three pre-trained models (RuBERT-Sentiment, XLM-RoBERTa-Twitter, BERT Multilingual) was conducted, demonstrating the advantage of domain adaptation over language specialization when processing texts containing emojis. A two-stage model adaptation approach was developed and implemented: expanding the tokenizer’s vocabulary by adding 159 emojis, followed by fine-tuning on the created corpus. Experimental results showed that simple tokenizer expansion without training does not improve quality, whereas comprehensive adaptation (expansion + fine-tuning) increases Accuracy from 0.46 to 0.54, and Macro F1 from 0.4567 to 0.5162. The best results were achieved for negative sentiment (F1 = 0.6042). The obtained results confirm that emojis are significant elements of user-generated content, and their consideration at all processing stages – from tokenization to training – is necessary for effective sentiment analysis in digital communication.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|