Детальная информация
| Название | Исследование и разработка системы анализа тональности пользовательских текстов на основе моделей BERT и PhoBERT: выпускная квалификационная работа бакалавра: направление 02.03.01 «Математика и компьютерные науки» ; образовательная программа 02.03.01_01 «Системы искусственного интеллекта и суперкомпьютерные технологии» = Research and Development of a Sentiment Analysis System for User-Generated Texts Based on BERT and PhoBERT Models |
|---|---|
| Авторы | Доан Тхань Тунг |
| Научный руководитель | Глазунов Вадим Валерьевич |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | анализ тональности ; обработка естественного языка ; PhoBERT ; аугментация данных ; Back Translation ; Fill-Mask ; вьетнамский язык ; sentiment analysis ; natural language processing ; data augmentation ; Vietnamese language |
| Тип документа | Выпускная квалификационная работа бакалавра |
| Язык | Русский |
| Уровень высшего образования | Бакалавриат |
| Код специальности ФГОС | 02.03.01 |
| Группа специальностей ФГОС | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-2009 |
| Права доступа | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\42726 |
| Дата создания записи | 21.08.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет возможно после подготовки администраторами необходимых файлов
Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
Данная работа посвящена исследованию задачи анализа тональности текстов на вьетнамском языке на основе предобученной языковой модели PhoBERT. В рамках исследования рассматриваются вопросы подготовки данных, аугментации данных, обучения моделей и разработки веб-приложения для анализа тональности. В ходе выполнения работы были решены следующие задачи: проведён обзор современных методов анализа тональности; разработан процесс предварительной обработки текстов на вьетнамском языке; наборы данных VLSP2018_Hotel и VLSP2018_Restaurant были преобразованы из задачи аспектно-ориентированного анализа тональности в задачу анализа тональности на уровне предложения; реализованы методы аугментации данных Back Translation и Fill-Mask; выполнены обучение и оценка модели PhoBERT на наборах данных UIT-VSFC, VLSP2018_Hotel, VLSP2018_Restaurant и VS; проведена оптимизация гиперпараметров с использованием Optuna для набора данных VS; разработано веб-приложение для анализа тональности на основе Streamlit. Результаты экспериментов показали, что применение методов аугментации данных позволяет повысить качество классификации на наборах данныхс дисбалансом классов, особенно по метрике Macro F1. Для набора данных VLSP2018_Restaurant метод Back Translation продемонстрировал более высокие результаты по сравнению с Fill-Mask. Для набора данных VS модель PhoBERT после оптимизации гиперпараметров достигла значений Accuracy 94.97%, Macro F1 93.95% и Weighted F1 94.98%. Полученные результаты были использованы при разработке веб-приложения, поддерживающего анализ тональности в четырёх предметных областях: образование, гостиничный бизнес, ресторанный бизнес и электронная коммерция. Приложение позволяет выполнять анализ отдельных текстов, массовый анализ комментариев и формирование отчётов для оценки отзывов пользователей. Для выполнения исследования использовались Google Colab, Python, PyTorch, Hugging Face Transformers, PhoBERT, VnCoreNLP, Optuna и Streamlit.
This thesis focuses on the task of Vietnamese sentiment analysis based on the pre-trained language model PhoBERT. The study covers data preparation, data augmentation, model training, and the development of a web application for sentiment analysis. The main tasks completed during the research include: reviewing modern sentiment analysis approaches; developing a Vietnamese text preprocessing pipeline; converting the VLSP2018_Hotel and VLSP2018_Restaurant datasets from aspectbased sentiment analysis to sentence-level sentiment analysis; implementing the Back Translation and Fill-Mask data augmentation methods; training and evaluating PhoBERT on the UIT-VSFC, VLSP2018_Hotel, VLSP2018_Restaurant, and VS datasets; optimizing hyperparameters on the VS dataset using Optuna; and developing a sentiment analysis web application with Streamlit. Experimental results show that data augmentation improves classification performance on imbalanced datasets, particularly in terms of Macro F1. On the VLSP2018_Restaurant dataset, Back Translation achieved better results than FillMask. On the VS dataset, the PhoBERT model achieved an Accuracy of 94.97%, a Macro F1 score of 93.95%, and a Weighted F1 score of 94.98% after hyperparameter optimization. The research outcomes were integrated into a web application supporting sentiment analysis in four domains: education, hospitality, restaurant services, and e-commerce. The application enables single-text sentiment analysis, large-scale comment analysis, and report generation for customer feedback evaluation. The main technologies and tools used in this study include Google Colab, Python, PyTorch, Hugging Face Transformers, PhoBERT, VnCoreNLP, Optuna, and Streamlit.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|