Details
| Title | Алгоритм best-match поиска в СУБД MongoDB на основе мер сходства и векторных представлений: выпускная квалификационная работа бакалавра: направление 02.03.03 «Математическое обеспечение и администрирование информационных систем» ; образовательная программа 02.03.03_01 «Интеллектуальные информационные системы и обработка данных» = Best-match document search algorithm for MongoDB based on similarity metrics and vector representations |
|---|---|
| Creators | Абуталипов Александр Альбертович |
| Scientific adviser | Щербаков Николай |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | best-match поиск ; MongoDB ; векторные представления ; меры сходства ; гибридный алгоритм ; FAISS ; HNSW ; Sentence-BERT ; BM25 ; автоматическое определение схемы ; best-match search ; vector representations ; similarity measures ; hybrid algorithm ; automatic schema detection |
| Document type | Bachelor graduation qualification work |
| Language | Russian |
| Level of education | Bachelor |
| Speciality code (FGOS) | 02.03.03 |
| Speciality group (FGOS) | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-2614 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\42785 |
| Record create date | 8/21/2026 |
Allowed Actions
–
Action 'Прочитать' will be available if you login or access site from another network
Action 'Download' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
Объект исследования — алгоритмы поиска наиболее похожих документов в документо-ориентированных СУБД. Цель работы — разработка универсального алгоритма best-match-поиска в MongoDB, объединяющего лексическую, семантическую, числовую и категориальную составляющие сходства. В работе применены TF-IDF и Sentence-BERT для векторизации, HNSW для приближённого поиска, косинусное сходство, коэффициенты Жаккара и вариации, расстояние Левенштейна, нормированная энтропия Шеннона. Качество оценено метриками Precision@k, Recall@k, nDCG@k и MRR. Разработан гибридный алгоритм с автоматическим определением схемы коллекции и двухфазной процедурой поиска. Реализован прототип — ядро и REST-API на FastAPI. На реальных данных Amazon (1465 товаров) разработанный алгоритм превосходит MongoDB $text по Precision@5 на 163,7 %, BM25 Okapi — на 11,4 %, MongoDB Atlas Vector Search — на 194,0 %. Область применения — каталоги электронной коммерции, рекомендательные модули, сервисы подбора вакансий, корпоративные системы управления документами. Выводы. Гибридный многомодальный подход даёт существенный прирост качества ранжирования над встроенными средствами MongoDB на гетерогенных реальных данных.
Object of research — algorithms for retrieving the most similar documents in document-oriented DBMS. The goal of the work is to develop a universal best-match search algorithm for MongoDB that combines lexical, semantic, numerical and categorical similarity components. The methods applied are TF-IDF and Sentence-BERT for text vectorization, HNSW for approximate nearest neighbour search, cosine similarity, Jaccard and variation coefficients, Levenshtein distance and normalized Shannon entropy. Quality is evaluated by Precision@k, Recall@k, nDCG@k and MRR. A hybrid algorithm with automatic schema detection and a two-phase search procedure has been developed. A prototype consisting of the algorithm core and a FastAPI REST API has been implemented. On the real Amazon dataset (1,465 products) the algorithm outperforms MongoDB $text by 163.7% in Precision@5, BM25 Okapi by 11.4%, and MongoDB Atlas Vector Search by 194.0%. Application areas — e-commerce catalogs, recommendation modules, vacancy matching services and enterprise document management systems. Conclusions. The hybrid multi-modal approach delivers a significant improvement in ranking quality over the single-modal built-in tools of MongoDB on heterogeneous real-world data.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|
- 4c3ad09d678ce276fcae715049048b0ccdc4ebe9e43b59a9c99d8083daec6a7f.pdf
- 5963b24604c09e99b2962635286a588cbe9aa011115bab4f67c556c68d0aaf2b.pdf
- 4c3ad09d678ce276fcae715049048b0ccdc4ebe9e43b59a9c99d8083daec6a7f.pdf