Details
| Title | Автоматическая оценка тональности отзывов на приложения по изучению иностранных языков: выпускная квалификационная работа магистра: направление 45.04.04 «Интеллектуальные системы в гуманитарной среде» ; образовательная программа 45.04.04_02 «Цифровая лингвистика» = Automatic sentiment classification of reviews of foreign language learning applications |
|---|---|
| Creators | Васьков Елисей Даниилович |
| Scientific adviser | Агафонова Марина Павловна |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Гуманитарный институт |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | компьютерная лингвистика ; машинное обучение ; анализ тональности ; сентимент-анализ ; отзывы ; мобильные приложения ; computational linguistics ; machine learning ; sentiment analysis ; reviews ; mobile applications |
| Document type | Master graduation qualification work |
| Language | Russian |
| Level of education | Master |
| Speciality code (FGOS) | 45.04.04 |
| Speciality group (FGOS) | 450000 - Языкознание и литературоведение |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-5343 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\45722 |
| Record create date | 9/10/2026 |
Allowed Actions
–
Action 'Read' will be available if you login or access site from another network
Action 'Download' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
В работе рассматривается автоматическая оценка тональности пользовательских отзывов к приложениям для изучения иностранных языков. Для исследования был сформирован корпус англоязычных отзывов из Google Play, после очистки и фильтрации подготовлен размеченный датасет отзывов. В работе сравниваются методы анализа тональности на основе правил, классические модели машинного обучения и модель BERT. Эксперименты проводились в трех постановках задачи: пятибалльной, трехклассовой и бинарной классификации. Результаты показали, что наиболее сложной является пятибалльная классификация, поскольку соседние оценки часто выражаются похожими текстами. Лучшие результаты во всех задачах показала модель BERT, а среди классических моделей наиболее устойчивой оказалась логистическая регрессия. Сохранение эмодзи не дало заметного прироста качества. Качественный анализ ошибок показал, что основные трудности связаны со смешанной тональностью, сарказмом, оценочными фактами и несовпадением текста отзыва с пользовательской оценкой.
The paper examines automatic sentiment classification of user reviews of foreign language learning applications. For the study, a corpus of English-language reviews from Google Play was compiled, and after cleaning and filtering, a labeled review dataset was prepared. The paper compares rule-based sentiment analysis methods, classical machine learning models, and BERT. The experiments were conducted in three task settings: five-class, three-class, and binary classification. The results showed that five-class classification is the most difficult task, since neighboring ratings are often expressed through similar texts. BERT achieved the best results in all tasks, while logistic regression proved to be the most stable among the classical models. Preserving emoji did not lead to a noticeable improvement in quality. The qualitative error analysis showed that the main difficulties are associated with mixed sentiment, sarcasm, evaluative facts, and mismatches between the review text and the user rating.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|