Details
| Title | Разработка нейросетевой рекомендательной системы на основе текстовых эмбеддингов: выпускная квалификационная работа бакалавра: направление 09.03.04 «Программная инженерия» ; образовательная программа 09.03.04_01 «Технология разработки и сопровождения качественного программного продукта» = Development of a neural recommender system based on text embeddings |
|---|---|
| Creators | Гурьянов Кирилл Евгеньевич |
| Scientific adviser | Селин Иван Андреевич |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | рекомендательная система ; текстовые эмбеддинги ; двухэтапный пайплайн ; SASRec ; ALS ; FAISS ; nomic-embed ; машинное обучение ; recommender system ; sequential recommendation ; text embeddings ; two-stage pipeline ; machine learning |
| Document type | Bachelor graduation qualification work |
| Language | Russian |
| Level of education | Bachelor |
| Speciality code (FGOS) | 09.03.04 |
| Speciality group (FGOS) | 090000 - Информатика и вычислительная техника |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-1853 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\42510 |
| Record create date | 8/21/2026 |
Allowed Actions
–
Action 'Read' will be available if you login or access site from another network
Action 'Download' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
Объект исследования – двухуровневые рекомендательные системы с текстовыми признаками, предмет – влияние текстовых эмбеддингов на качество ранжирования на датасете Amazon Books. Гипотеза: гибридное представление товара (ID-эмбеддинг + замороженный текстовый) превосходит ID-only. Задачи: анализ предметной области; обоснование архитектур и составного представления товара; подготовка данных и реализация двухэтапного пайплайна (recall → rerank); обучение моделей и разработка сервиса с графическим интерфейсом; сравнение конфигураций и оценка производительности. Методология: коллаборативная фильтрация (ALS), последовательные модели (SASRec), текстовые эмбеддинги nomic-embed-text-v1.5, поиск ближайших соседей FAISS HNSW, logQ-коррекция смещения выборки. Результаты: реализована система recall-rerank; обучены три варианта SASRec (ID-only, Text-only, Hybrid) и два рекаллера (Popular, ALS); абляция на 11 конфигурациях. Различия значимы (парный bootstrap, p < 0,001). Лучшая модель ALS + SASRec Hybrid: NDCG@10 = 0,0126, HR@10 = 0,0526 (69 392 пользователя); p95-задержка – 8,1 мс на CPU. Гипотеза подтверждена (Hybrid > Text-only > ID-only). Применение – рекомендательные сервисы в e-commerce и цифровых медиа. Использованные информационные технологии: Python 3.10; PyTorch, implicit, faiss-cpu, scikit-learn; HuggingFace Transformers, sentence-transformers, nomic-embed-text-v1.5, pandas, MLflow, FastAPI, Streamlit, Docker.
The object of study is two-stage recommender systems with text features, the subject – the effect of text embeddings on ranking quality. The work was carried out on the Amazon Books dataset. Hypothesis: a composite (hybrid) item representation (a trainable ID embedding + a frozen text embedding) outperforms ID-only approaches. Goals: to analyse the subject area; to justify the architectures and the composite item representation; to prepare the data and implement a two-stage pipeline (recall → rerank); to train the models and develop a service with a graphical interface; to compare configurations and evaluate performance. Methods: collaborative filtering (ALS), Transformer-based sequential models (SASRec), text embeddings nomic-embed-text-v1.5, approximate nearest-neighbour search FAISS HNSW, sampling-bias correction logQ. Results: a recall-rerank system was implemented; three SASRec variants (ID-only, Text-only, Hybrid) and two recallers (Popular, ALS) were trained; an ablation over 11 configurations was conducted. The differences are significant (paired bootstrap, 1000 iterations, p < 0.001). The best model ALS + SASRec Hybrid: NDCG@10 = 0.0126, HR@10 = 0.0526 (test, 69,392 users); p95 latency – 8.1 ms on CPU. The hypothesis is confirmed (Hybrid > Text-only > ID-only). The area of application is recommender services in e-commerce and media platforms. Information technologies used: Python 3.10; PyTorch, implicit, faiss-cpu, scikit-learn; HuggingFace Transformers, sentence-transformers, nomic-embed-text-v1.5; pandas, MLflow, FastAPI, Streamlit, Docker Compose, uv, ruff.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|
- ОПРЕДЕЛЕНИЯ, ОБОЗНАЧЕНИЯ И СОКРАЩЕНИЯ
- ВВЕДЕНИЕ
- 1. АНАЛИЗ ПРЕДМЕТНОЙ ОБЛАСТИ
- 1.1. Задачи рекомендательных систем
- 1.2. Методы коллаборативной фильтрации
- 1.3. Последовательные модели рекомендаций
- 1.4. Текстовые эмбеддинги в рекомендательных системах
- 1.5. Двухэтапные системы recall–rerank
- 1.6. Анализ существующих открытых систем
- 2. ТЕОРЕТИЧЕСКОЕ ПРЕДЛОЖЕНИЕ И ОБОСНОВАНИЕ РЕШЕНИЙ
- 2.1. Формальная постановка задачи
- 2.2. Функциональные и нефункциональные требования к системе
- 2.3. Авторское предложение: SASRec Hybrid
- 2.4. Матрица экспериментов и гипотеза
- 2.5. Обоснование архитектурных решений
- 3. ТЕХНОЛОГИЧЕСКОЕ РЕШЕНИЕ И РЕАЛИЗАЦИЯ
- 3.1. Общая архитектура системы
- 3.2. Подготовка данных
- 3.2.1. Набор данных Amazon Books
- 3.2.2. Фильтрация и стратифицированная выборка
- 3.2.3. Temporal split
- 3.2.4. Предобработка текстов и генерация эмбеддингов
- 3.3. Реализация рекаллеров
- 3.3.1. Popular baseline
- 3.3.2. ALS Recaller
- 3.4. Реализация реранкера SASRec
- 3.4.1. Базовая архитектура SASRec
- 3.4.2. Три варианта эмбеддинга
- 3.5. Обучение моделей
- 3.6. Инференс-сервис
- 3.6.1. REST API (FastAPI)
- 3.6.2. Пайплайн инференса
- 3.6.3. Веб-интерфейс (Streamlit)
- 3.6.4. Контейнеризация
- 3.7. Переобучение моделей
- 3.8. Обоснование технологического стека
- 3.9. Система контроля версий и процесс разработки
- 3.10. Тестирование программного обеспечения
- 3.10.1. Стратегия тестирования
- 3.10.2. Модульные тесты
- 3.10.3. Функциональные и сквозные тесты
- 3.10.4. Нагрузочные тесты и проверка нефункциональных требований
- 4. АПРОБАЦИЯ И АНАЛИЗ РЕЗУЛЬТАТОВ
- 4.1. Метрики качества
- 4.2. Результаты recall-этапа
- 4.3. Абляционное исследование реранкеров
- 4.4. Эффективность двухэтапного пайплайна
- 4.5. Оценка производительности
- 4.6. Результаты
- ЗАКЛЮЧЕНИЕ
- СПИСОК ИСПОЛЬЗОВАННЫХ ИСТОЧНИКОВ
- ПРИЛОЖЕНИЕ А
- ПРИЛОЖЕНИЕ Б
- ПРИЛОЖЕНИЕ В