Детальная информация

Название Исследование и реализация методов анализа эмоциональной окраски и выявление сгенерированного текста в отзывах: выпускная квалификационная работа бакалавра: направление 02.03.01 «Математика и компьютерные науки» ; образовательная программа 02.03.01_01 «Системы искусственного интеллекта и суперкомпьютерные технологии» = Research and implementation of methods for analyzing emotional coloring and identifying generated text in reviews
Авторы Емешкин Максим Сергеевич
Научный руководитель Мулюха Владимир Александрович
Организация Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Выходные сведения Санкт-Петербург, 2026
Коллекция Выпускные квалификационные работы ; Общая коллекция
Тематика анализ тональности ; детекция ботов ; интеллектуальные системы ; конвейерная архитектура ; машинное обучение ; обработка естественного языка ; sentiment analysis ; bot detection ; intelligent systems ; pipeline architecture ; machine learning ; natural language processing
Тип документа Выпускная квалификационная работа бакалавра
Язык Русский
Уровень высшего образования Бакалавриат
Код специальности ФГОС 02.03.01
Группа специальностей ФГОС 020000 - Компьютерные и информационные науки
DOI 10.18720/SPBPU/3/2026/vr/vr26-3459
Права доступа Доступ по паролю из сети Интернет (чтение, печать, копирование)
Дополнительно Новинка
Ключ записи ru\spstu\vkr\42652
Дата создания записи 21.08.2026

Разрешенные действия

Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Группа Анонимные пользователи
Сеть Интернет

В работе представлен подход к проектированию и экспериментальной оценке интеллектуальной конвейерной системы review-analyzer для автоматического анализа русскоязычных пользовательских отзывов. Рассмотрены методы классификации тональности на базе трансформерных архитектур и алгоритмы выявления накруток и AI-сгенерированного контента. Также способы агрегации результатов работы отдельных модулей в единый показатель достоверности (trust score). Проведён сравнительный анализ российских и зарубежных платформ (Яндекс.Маркет, Amazon, Trustpilot). Выполнен обзор научных публикаций по тематикам анализа тональности и детекции фейковых отзывов, формализована исследовательская задача и обоснованы архитектурные решения. На основе этого спроектирован модульный конвейер обработки данных, который включаюет этапы предобработки текста, классификации тональности (на базе ruBERT), детекции ботов (Bi-LSTM + XGBoost) и детекции AI-текста. Прототип системы реализован на языке Python с применением PyTorch, Hugging Face Transformers, FastAPI, Celery и PostgreSQL. Подготовлены наборы данных, выполнено обучение и тестирование моделей. На основном test достигнуты F1-macro 0.871 по тональности, AUC-ROC 0.914 для ботов и AUC-ROC 0.934 для AI-текста. На контрольной выборке из 400 отзывов с LLM AUC AI-детектора составил 0.823, что показывает частичный перенос модели на «чужие» данные. Продемонстрирована ресурсная эффективность конвейера при развёртывании на потребительской видеокарте.

The paper presents an approach to the design and experimental evaluation of the intelligent pipeline system review-analyzer for automatic analysis of Russian-language user reviews. Methods of tonality classification based on transformer architectures and algorithms for detecting fraud and AI-generated content are considered. There are also ways to aggregate the results of individual modules into a single confidence score. A comparative analysis of Russian and foreign platforms has been carried out. (Yandex.Market, Amazon, Trustpilot). A review of scientific publications on the topics of sentiment analysis and fake review detection has been performed, the research task has been formalized, and architectural solutions have been substantiated. Based on this, a modular data processing pipeline has been designed, which includes the stages of text preprocessing, sentiment classification (based on ruBERT), bot detection (Bi-LSTM + XGBoost), and AI text detection. The system prototype has been implemented in Python using PyTorch, Hugging Face Transformers, FastAPI, Celery, and PostgreSQL. Datasets have been prepared, and models have been trained and tested. On the main test, F1-macro of 0.871 has been achieved for sentiment, AUC-ROC of 0.914 for bots and AUC-ROC of 0.934 for AI-text. On a test set of 400 reviews with The LLM AUC of the AI detector was 0.823, which shows partial transfer of the model to "foreign" data. The resource efficiency of the pipeline was demonstrated when it was deployed on a consumer graphics card.

Место доступа Группа пользователей Действие
Локальная сеть ИБК СПбПУ Все
Прочитать Печать Загрузить
Интернет Авторизованные пользователи СПбПУ
Прочитать Печать Загрузить
Интернет Анонимные пользователи
  • СПИСОК СОКРАЩЕНИЙ И УСЛОВНЫХ ОБОЗНАЧЕНИЙ
  • СЛОВАРЬ ТЕРМИНОВ
  • ВВЕДЕНИЕ
  • АНАЛИЗ ПРЕДМЕТНОЙ ОБЛАСТИ И МЕТОДОЛОГИЧЕСКИЕ ОСНОВЫ ИССЛЕДОВАНИЯ
    • Сравнительный анализ платформ и научных исследований
    • Обоснование разработки системы и постановка задачи
    • Методы анализа тональности и детекции недостоверного контента
    • Интеграция задач, данные и методологические выводы
    • Выводы и постановка задачи исследования
  • АРХИТЕКТУРНОЕ ПРОЕКТИРОВАНИЕ СИСТЕМЫ И ВЫБОР ТЕХНОЛОГИЧЕСКОГО СТЕКА
    • Обоснование выбора архитектурных решений
    • Проектирование общей архитектуры
    • Определение и обоснование технологического стека
  • АРХИТЕКТУРНОЕ ОПИСАНИЕ СИСТЕМЫ АНАЛИЗА ОТЗЫВОВ
    • Концептуальное назначение и область применения
    • Общая архитектура конвейерной системы
    • Компонентный анализ архитектуры
    • Процесс работы конвейера
    • Обучение и валидация
  • РЕЗУЛЬТАТЫ ЭКСПЕРИМЕНТАЛЬНОЙ ОЦЕНКИ СИСТЕМЫ
    • Методология и базовые модели сравнения
    • Результаты классификации тональности
    • Интегральная оценка конвейера
    • Ресурсоёмкость. Сравнение с альтернативными подходами
    • Сравнительный анализ. Обученная система и сырые модели
  • ЗАКЛЮЧЕНИЕ
  • СПИСОК ИСПОЛЬЗОВАННЫХ ИСТОЧНИКОВ
...