Детальная информация
| Название | Дообучение трансформерных моделей для сентимент-анализа русскоязычных текстов с эмодзи: выпускная квалификационная работа магистра: направление 45.04.04 «Интеллектуальные системы в гуманитарной среде» ; образовательная программа 45.04.04_02 «Цифровая лингвистика» = Fine-tuning Transformer Models for Sentiment Analysis of Russian-Language Texts Containing Emojis |
|---|---|
| Авторы | Гарусова Дарья Александровна |
| Научный руководитель | Дмитриев Александр Владиславович |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Гуманитарный институт |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | сентимент-анализ ; эмодзи ; BERT ; трансформерные модели ; обработка естественного языка (nlp) ; тональность текста ; русский язык ; цифровая коммуникация ; дообучение модели ; токенизация ; корпус текстов ; telegram ; адаптация модели ; sentiment analysis ; emojis ; transformer models ; natural language processing (NLP) ; text sentiment ; Russian language ; digital communication ; model fine-tuning ; tokenization ; text corpus ; model adaptation |
| Тип документа | Выпускная квалификационная работа магистра |
| Язык | Русский |
| Уровень высшего образования | Магистратура |
| Код специальности ФГОС | 45.04.04 |
| Группа специальностей ФГОС | 450000 - Языкознание и литературоведение |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-5696 |
| Права доступа | Доступ по паролю из сети Интернет (чтение) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\45535 |
| Дата создания записи | 10.09.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
В данной работе исследуются методы адаптации трансформерных моделей семейства BERT для повышения качества сентимент-анализа русскоязычных пользовательских текстов, содержащих эмодзи. В ходе исследования рассмотрены функции эмодзи в цифровой коммуникации и выявлены основные проблемы их автоматической интерпретации в задачах обработки естественного языка. Для проведения эксперимента сформирован специализированный корпус русскоязычных сообщений из мессенджера Telegram (1016 текстов), выполнена ручная разметка по категориям тональности (POSITIVE, NEUTRAL, NEGATIVE). Проведён сравнительный анализ трёх предобученных моделей (RuBERT-Sentiment, XLM-RoBERTa-Twitter, BERT Multilingual), показавший преимущество доменной адаптации перед языковой специализацией при работе с текстами, содержащими эмодзи. Разработан и реализован двухэтапный подход к адаптации модели: расширение словаря токенизатора путём добавления 159 эмодзи с последующим дообучением на созданном корпусе. Результаты эксперимента показали, что простое расширение токенизатора без обучения не приводит к улучшению качества, тогда как комплексная адаптация (расширение + дообучение) повышает Accuracy с 0,46 до 0,54, а Macro F1 – с 0,4567 до 0,5162. Наилучшие результаты достигнуты для негативной тональности (F1=0,6042). Полученные результаты подтверждают, что эмодзи являются значимыми элементами пользовательского контента и их учёт на всех этапах обработки – от токенизации до обучения – необходим для эффективного сентимент-анализа в цифровой коммуникации.
This study investigates methods for adapting transformer models of the BERT family to improve the quality of sentiment analysis for Russian-language user-generated texts containing emojis. The research examines the functions of emojis in digital communication and identifies the main challenges of their automatic interpretation in natural language processing tasks. For the experiment, a specialized corpus of Russian-language messages from the Telegram messenger (1,016 texts) was compiled, with manual annotation by sentiment categories (POSITIVE, NEUTRAL, NEGATIVE). A comparative analysis of three pre-trained models (RuBERT-Sentiment, XLM-RoBERTa-Twitter, BERT Multilingual) was conducted, demonstrating the advantage of domain adaptation over language specialization when processing texts containing emojis. A two-stage model adaptation approach was developed and implemented: expanding the tokenizer’s vocabulary by adding 159 emojis, followed by fine-tuning on the created corpus. Experimental results showed that simple tokenizer expansion without training does not improve quality, whereas comprehensive adaptation (expansion + fine-tuning) increases Accuracy from 0.46 to 0.54, and Macro F1 from 0.4567 to 0.5162. The best results were achieved for negative sentiment (F1 = 0.6042). The obtained results confirm that emojis are significant elements of user-generated content, and their consideration at all processing stages – from tokenization to training – is necessary for effective sentiment analysis in digital communication.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|