Details

Title Разработка нейросетевой рекомендательной системы на основе текстовых эмбеддингов: выпускная квалификационная работа бакалавра: направление 09.03.04 «Программная инженерия» ; образовательная программа 09.03.04_01 «Технология разработки и сопровождения качественного программного продукта» = Development of a neural recommender system based on text embeddings
Creators Гурьянов Кирилл Евгеньевич
Scientific adviser Селин Иван Андреевич
Organization Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects рекомендательная система ; текстовые эмбеддинги ; двухэтапный пайплайн ; SASRec ; ALS ; FAISS ; nomic-embed ; машинное обучение ; recommender system ; sequential recommendation ; text embeddings ; two-stage pipeline ; machine learning
Document type Bachelor graduation qualification work
Language Russian
Level of education Bachelor
Speciality code (FGOS) 09.03.04
Speciality group (FGOS) 090000 - Информатика и вычислительная техника
DOI 10.18720/SPBPU/3/2026/vr/vr26-1853
Rights Доступ по паролю из сети Интернет (чтение, печать, копирование)
Additionally New arrival
Record key ru\spstu\vkr\42510
Record create date 8/21/2026

Allowed Actions

Action 'Read' will be available if you login or access site from another network

Action 'Download' will be available if you login or access site from another network

Group Anonymous
Network Internet

Объект исследования – двухуровневые рекомендательные системы с текстовыми признаками, предмет – влияние текстовых эмбеддингов на качество ранжирования на датасете Amazon Books. Гипотеза: гибридное представление товара (ID-эмбеддинг + замороженный текстовый) превосходит ID-only. Задачи: анализ предметной области; обоснование архитектур и составного представления товара; подготовка данных и реализация двухэтапного пайплайна (recall → rerank); обучение моделей и разработка сервиса с графическим интерфейсом; сравнение конфигураций и оценка производительности. Методология: коллаборативная фильтрация (ALS), последовательные модели (SASRec), текстовые эмбеддинги nomic-embed-text-v1.5, поиск ближайших соседей FAISS HNSW, logQ-коррекция смещения выборки. Результаты: реализована система recall-rerank; обучены три варианта SASRec (ID-only, Text-only, Hybrid) и два рекаллера (Popular, ALS); абляция на 11 конфигурациях. Различия значимы (парный bootstrap, p < 0,001). Лучшая модель ALS + SASRec Hybrid: NDCG@10 = 0,0126, HR@10 = 0,0526 (69 392 пользователя); p95-задержка – 8,1 мс на CPU. Гипотеза подтверждена (Hybrid > Text-only > ID-only). Применение – рекомендательные сервисы в e-commerce и цифровых медиа. Использованные информационные технологии: Python 3.10; PyTorch, implicit, faiss-cpu, scikit-learn; HuggingFace Transformers, sentence-transformers, nomic-embed-text-v1.5, pandas, MLflow, FastAPI, Streamlit, Docker.

The object of study is two-stage recommender systems with text features, the subject – the effect of text embeddings on ranking quality. The work was carried out on the Amazon Books dataset. Hypothesis: a composite (hybrid) item representation (a trainable ID embedding + a frozen text embedding) outperforms ID-only approaches. Goals: to analyse the subject area; to justify the architectures and the composite item representation; to prepare the data and implement a two-stage pipeline (recall → rerank); to train the models and develop a service with a graphical interface; to compare configurations and evaluate performance. Methods: collaborative filtering (ALS), Transformer-based sequential models (SASRec), text embeddings nomic-embed-text-v1.5, approximate nearest-neighbour search FAISS HNSW, sampling-bias correction logQ. Results: a recall-rerank system was implemented; three SASRec variants (ID-only, Text-only, Hybrid) and two recallers (Popular, ALS) were trained; an ablation over 11 configurations was conducted. The differences are significant (paired bootstrap, 1000 iterations, p < 0.001). The best model ALS + SASRec Hybrid: NDCG@10 = 0.0126, HR@10 = 0.0526 (test, 69,392 users); p95 latency – 8.1 ms on CPU. The hypothesis is confirmed (Hybrid > Text-only > ID-only). The area of application is recommender services in e-commerce and media platforms. Information technologies used: Python 3.10; PyTorch, implicit, faiss-cpu, scikit-learn; HuggingFace Transformers, sentence-transformers, nomic-embed-text-v1.5; pandas, MLflow, FastAPI, Streamlit, Docker Compose, uv, ruff.

Network User group Action
ILC SPbPU Local Network All
Read Print Download
Internet Authorized users SPbPU
Read Print Download
Internet Anonymous
  • ОПРЕДЕЛЕНИЯ, ОБОЗНАЧЕНИЯ И СОКРАЩЕНИЯ
  • ВВЕДЕНИЕ
  • 1. АНАЛИЗ ПРЕДМЕТНОЙ ОБЛАСТИ
    • 1.1. Задачи рекомендательных систем
    • 1.2. Методы коллаборативной фильтрации
    • 1.3. Последовательные модели рекомендаций
    • 1.4. Текстовые эмбеддинги в рекомендательных системах
    • 1.5. Двухэтапные системы recall–rerank
    • 1.6. Анализ существующих открытых систем
  • 2. ТЕОРЕТИЧЕСКОЕ ПРЕДЛОЖЕНИЕ И ОБОСНОВАНИЕ РЕШЕНИЙ
    • 2.1. Формальная постановка задачи
    • 2.2. Функциональные и нефункциональные требования к системе
    • 2.3. Авторское предложение: SASRec Hybrid
    • 2.4. Матрица экспериментов и гипотеза
    • 2.5. Обоснование архитектурных решений
  • 3. ТЕХНОЛОГИЧЕСКОЕ РЕШЕНИЕ И РЕАЛИЗАЦИЯ
    • 3.1. Общая архитектура системы
    • 3.2. Подготовка данных
      • 3.2.1. Набор данных Amazon Books
      • 3.2.2. Фильтрация и стратифицированная выборка
      • 3.2.3. Temporal split
      • 3.2.4. Предобработка текстов и генерация эмбеддингов
    • 3.3. Реализация рекаллеров
      • 3.3.1. Popular baseline
      • 3.3.2. ALS Recaller
    • 3.4. Реализация реранкера SASRec
      • 3.4.1. Базовая архитектура SASRec
      • 3.4.2. Три варианта эмбеддинга
    • 3.5. Обучение моделей
    • 3.6. Инференс-сервис
      • 3.6.1. REST API (FastAPI)
      • 3.6.2. Пайплайн инференса
      • 3.6.3. Веб-интерфейс (Streamlit)
      • 3.6.4. Контейнеризация
    • 3.7. Переобучение моделей
    • 3.8. Обоснование технологического стека
    • 3.9. Система контроля версий и процесс разработки
    • 3.10. Тестирование программного обеспечения
      • 3.10.1. Стратегия тестирования
      • 3.10.2. Модульные тесты
      • 3.10.3. Функциональные и сквозные тесты
      • 3.10.4. Нагрузочные тесты и проверка нефункциональных требований
  • 4. АПРОБАЦИЯ И АНАЛИЗ РЕЗУЛЬТАТОВ
    • 4.1. Метрики качества
    • 4.2. Результаты recall-этапа
    • 4.3. Абляционное исследование реранкеров
    • 4.4. Эффективность двухэтапного пайплайна
    • 4.5. Оценка производительности
    • 4.6. Результаты
  • ЗАКЛЮЧЕНИЕ
  • СПИСОК ИСПОЛЬЗОВАННЫХ ИСТОЧНИКОВ
  • ПРИЛОЖЕНИЕ А
  • ПРИЛОЖЕНИЕ Б
  • ПРИЛОЖЕНИЕ В
...