Details

Title Исследование и разработка системы анализа тональности пользовательских текстов на основе моделей BERT и PhoBERT: выпускная квалификационная работа бакалавра: направление 02.03.01 «Математика и компьютерные науки» ; образовательная программа 02.03.01_01 «Системы искусственного интеллекта и суперкомпьютерные технологии» = Research and Development of a Sentiment Analysis System for User-Generated Texts Based on BERT and PhoBERT Models
Creators Доан Тхань Тунг
Scientific adviser Глазунов Вадим Валерьевич
Organization Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects анализ тональности ; обработка естественного языка ; PhoBERT ; аугментация данных ; Back Translation ; Fill-Mask ; вьетнамский язык ; sentiment analysis ; natural language processing ; data augmentation ; Vietnamese language
Document type Bachelor graduation qualification work
Language Russian
Level of education Bachelor
Speciality code (FGOS) 02.03.01
Speciality group (FGOS) 020000 - Компьютерные и информационные науки
DOI 10.18720/SPBPU/3/2026/vr/vr26-2009
Rights Доступ по паролю из сети Интернет (чтение, печать, копирование)
Additionally New arrival
Record key ru\spstu\vkr\42726
Record create date 8/21/2026

Allowed Actions

Action 'Read' will be available if administrator prepare required files

Action 'Download' will be available if you login or access site from another network

Group Anonymous
Network Internet

Данная работа посвящена исследованию задачи анализа тональности текстов на вьетнамском языке на основе предобученной языковой модели PhoBERT. В рамках исследования рассматриваются вопросы подготовки данных, аугментации данных, обучения моделей и разработки веб-приложения для анализа тональности. В ходе выполнения работы были решены следующие задачи: проведён обзор современных методов анализа тональности; разработан процесс предварительной обработки текстов на вьетнамском языке; наборы данных VLSP2018_Hotel и VLSP2018_Restaurant были преобразованы из задачи аспектно-ориентированного анализа тональности в задачу анализа тональности на уровне предложения; реализованы методы аугментации данных Back Translation и Fill-Mask; выполнены обучение и оценка модели PhoBERT на наборах данных UIT-VSFC, VLSP2018_Hotel, VLSP2018_Restaurant и VS; проведена оптимизация гиперпараметров с использованием Optuna для набора данных VS; разработано веб-приложение для анализа тональности на основе Streamlit. Результаты экспериментов показали, что применение методов аугментации данных позволяет повысить качество классификации на наборах данныхс дисбалансом классов, особенно по метрике Macro F1. Для набора данных VLSP2018_Restaurant метод Back Translation продемонстрировал более высокие результаты по сравнению с Fill-Mask. Для набора данных VS модель PhoBERT после оптимизации гиперпараметров достигла значений Accuracy 94.97%, Macro F1 93.95% и Weighted F1 94.98%. Полученные результаты были использованы при разработке веб-приложения, поддерживающего анализ тональности в четырёх предметных областях: образование, гостиничный бизнес, ресторанный бизнес и электронная коммерция. Приложение позволяет выполнять анализ отдельных текстов, массовый анализ комментариев и формирование отчётов для оценки отзывов пользователей. Для выполнения исследования использовались Google Colab, Python, PyTorch, Hugging Face Transformers, PhoBERT, VnCoreNLP, Optuna и Streamlit.

This thesis focuses on the task of Vietnamese sentiment analysis based on the pre-trained language model PhoBERT. The study covers data preparation, data augmentation, model training, and the development of a web application for sentiment analysis. The main tasks completed during the research include: reviewing modern sentiment analysis approaches; developing a Vietnamese text preprocessing pipeline; converting the VLSP2018_Hotel and VLSP2018_Restaurant datasets from aspectbased sentiment analysis to sentence-level sentiment analysis; implementing the Back Translation and Fill-Mask data augmentation methods; training and evaluating PhoBERT on the UIT-VSFC, VLSP2018_Hotel, VLSP2018_Restaurant, and VS datasets; optimizing hyperparameters on the VS dataset using Optuna; and developing a sentiment analysis web application with Streamlit. Experimental results show that data augmentation improves classification performance on imbalanced datasets, particularly in terms of Macro F1. On the VLSP2018_Restaurant dataset, Back Translation achieved better results than FillMask. On the VS dataset, the PhoBERT model achieved an Accuracy of 94.97%, a Macro F1 score of 93.95%, and a Weighted F1 score of 94.98% after hyperparameter optimization. The research outcomes were integrated into a web application supporting sentiment analysis in four domains: education, hospitality, restaurant services, and e-commerce. The application enables single-text sentiment analysis, large-scale comment analysis, and report generation for customer feedback evaluation. The main technologies and tools used in this study include Google Colab, Python, PyTorch, Hugging Face Transformers, PhoBERT, VnCoreNLP, Optuna, and Streamlit.

Network User group Action
ILC SPbPU Local Network All
Download
Internet Authorized users SPbPU
Download
Internet Anonymous
...