Details

Title Исследование и реализация методов анализа эмоциональной окраски и выявление сгенерированного текста в отзывах: выпускная квалификационная работа бакалавра: направление 02.03.01 «Математика и компьютерные науки» ; образовательная программа 02.03.01_01 «Системы искусственного интеллекта и суперкомпьютерные технологии» = Research and implementation of methods for analyzing emotional coloring and identifying generated text in reviews
Creators Емешкин Максим Сергеевич
Scientific adviser Мулюха Владимир Александрович
Organization Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects анализ тональности ; детекция ботов ; интеллектуальные системы ; конвейерная архитектура ; машинное обучение ; обработка естественного языка ; sentiment analysis ; bot detection ; intelligent systems ; pipeline architecture ; machine learning ; natural language processing
Document type Bachelor graduation qualification work
Language Russian
Level of education Bachelor
Speciality code (FGOS) 02.03.01
Speciality group (FGOS) 020000 - Компьютерные и информационные науки
DOI 10.18720/SPBPU/3/2026/vr/vr26-3459
Rights Доступ по паролю из сети Интернет (чтение, печать, копирование)
Additionally New arrival
Record key ru\spstu\vkr\42652
Record create date 8/21/2026

Allowed Actions

Action 'Read' will be available if you login or access site from another network

Action 'Download' will be available if you login or access site from another network

Group Anonymous
Network Internet

В работе представлен подход к проектированию и экспериментальной оценке интеллектуальной конвейерной системы review-analyzer для автоматического анализа русскоязычных пользовательских отзывов. Рассмотрены методы классификации тональности на базе трансформерных архитектур и алгоритмы выявления накруток и AI-сгенерированного контента. Также способы агрегации результатов работы отдельных модулей в единый показатель достоверности (trust score). Проведён сравнительный анализ российских и зарубежных платформ (Яндекс.Маркет, Amazon, Trustpilot). Выполнен обзор научных публикаций по тематикам анализа тональности и детекции фейковых отзывов, формализована исследовательская задача и обоснованы архитектурные решения. На основе этого спроектирован модульный конвейер обработки данных, который включаюет этапы предобработки текста, классификации тональности (на базе ruBERT), детекции ботов (Bi-LSTM + XGBoost) и детекции AI-текста. Прототип системы реализован на языке Python с применением PyTorch, Hugging Face Transformers, FastAPI, Celery и PostgreSQL. Подготовлены наборы данных, выполнено обучение и тестирование моделей. На основном test достигнуты F1-macro 0.871 по тональности, AUC-ROC 0.914 для ботов и AUC-ROC 0.934 для AI-текста. На контрольной выборке из 400 отзывов с LLM AUC AI-детектора составил 0.823, что показывает частичный перенос модели на «чужие» данные. Продемонстрирована ресурсная эффективность конвейера при развёртывании на потребительской видеокарте.

The paper presents an approach to the design and experimental evaluation of the intelligent pipeline system review-analyzer for automatic analysis of Russian-language user reviews. Methods of tonality classification based on transformer architectures and algorithms for detecting fraud and AI-generated content are considered. There are also ways to aggregate the results of individual modules into a single confidence score. A comparative analysis of Russian and foreign platforms has been carried out. (Yandex.Market, Amazon, Trustpilot). A review of scientific publications on the topics of sentiment analysis and fake review detection has been performed, the research task has been formalized, and architectural solutions have been substantiated. Based on this, a modular data processing pipeline has been designed, which includes the stages of text preprocessing, sentiment classification (based on ruBERT), bot detection (Bi-LSTM + XGBoost), and AI text detection. The system prototype has been implemented in Python using PyTorch, Hugging Face Transformers, FastAPI, Celery, and PostgreSQL. Datasets have been prepared, and models have been trained and tested. On the main test, F1-macro of 0.871 has been achieved for sentiment, AUC-ROC of 0.914 for bots and AUC-ROC of 0.934 for AI-text. On a test set of 400 reviews with The LLM AUC of the AI detector was 0.823, which shows partial transfer of the model to "foreign" data. The resource efficiency of the pipeline was demonstrated when it was deployed on a consumer graphics card.

Network User group Action
ILC SPbPU Local Network All
Read Print Download
Internet Authorized users SPbPU
Read Print Download
Internet Anonymous
  • СПИСОК СОКРАЩЕНИЙ И УСЛОВНЫХ ОБОЗНАЧЕНИЙ
  • СЛОВАРЬ ТЕРМИНОВ
  • ВВЕДЕНИЕ
  • АНАЛИЗ ПРЕДМЕТНОЙ ОБЛАСТИ И МЕТОДОЛОГИЧЕСКИЕ ОСНОВЫ ИССЛЕДОВАНИЯ
    • Сравнительный анализ платформ и научных исследований
    • Обоснование разработки системы и постановка задачи
    • Методы анализа тональности и детекции недостоверного контента
    • Интеграция задач, данные и методологические выводы
    • Выводы и постановка задачи исследования
  • АРХИТЕКТУРНОЕ ПРОЕКТИРОВАНИЕ СИСТЕМЫ И ВЫБОР ТЕХНОЛОГИЧЕСКОГО СТЕКА
    • Обоснование выбора архитектурных решений
    • Проектирование общей архитектуры
    • Определение и обоснование технологического стека
  • АРХИТЕКТУРНОЕ ОПИСАНИЕ СИСТЕМЫ АНАЛИЗА ОТЗЫВОВ
    • Концептуальное назначение и область применения
    • Общая архитектура конвейерной системы
    • Компонентный анализ архитектуры
    • Процесс работы конвейера
    • Обучение и валидация
  • РЕЗУЛЬТАТЫ ЭКСПЕРИМЕНТАЛЬНОЙ ОЦЕНКИ СИСТЕМЫ
    • Методология и базовые модели сравнения
    • Результаты классификации тональности
    • Интегральная оценка конвейера
    • Ресурсоёмкость. Сравнение с альтернативными подходами
    • Сравнительный анализ. Обученная система и сырые модели
  • ЗАКЛЮЧЕНИЕ
  • СПИСОК ИСПОЛЬЗОВАННЫХ ИСТОЧНИКОВ
...