Details
| Title | Автоматизированная система пост-генеративной детекции галлюцинаций русскоязычных больших языковых моделей в нефтегазовом домене: выпускная квалификационная работа бакалавра: направление 02.03.03 «Математическое обеспечение и администрирование информационных систем» ; образовательная программа 02.03.03_01 «Интеллектуальные информационные системы и обработка данных» = Automated Post-Generative Hallucination Detection System for Russian-Language Large Language Models in the Oil and Gas Domain |
|---|---|
| Creators | Любецкая Антонина Александровна |
| Scientific adviser | Пак Вадим Геннадьевич |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | большие языковые модели ; галлюцинации ; детекция галлюцинаций ; дополненная генерация ; мультиагентные системы ; нормативнотехническая документация ; нефтегазовый домен ; верификация фактов ; обработка естественного языка ; гибридный поиск ; large language models ; hallucination detection ; retrieval-augmented generation ; multi-agent systems ; normative technical documentation ; oil and gas domain ; fact verification ; natural language processing ; hybrid retrieval |
| Document type | Bachelor graduation qualification work |
| Language | Russian |
| Level of education | Bachelor |
| Speciality code (FGOS) | 02.03.03 |
| Speciality group (FGOS) | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-4389 |
| Rights | Доступ по паролю из сети Интернет (чтение) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\42858 |
| Record create date | 8/21/2026 |
Allowed Actions
–
Action 'Read' will be available if administrator prepare required files
| Group | Anonymous |
|---|---|
| Network | Internet |
В работе исследована проблема фактологической недостоверности текстов, генерируемых большими языковыми моделями (LLM) при работе с нормативно-технической документацией нефтегазовой отрасли. Проведён систематический анализ существующих методов детекции и минимизации галлюцинаций, выявлены их ограничения в контексте русскоязычных узкоспециализированных доменов. На основе проведённого анализа обоснован выбор метода пост-генеративной верификации (post-hoc verification) как наиболее применимого в условиях работы с документацией типа ГОСТ и СНиП. Спроектирована и программно реализована мультиагентная интеллектуальная система «AI-Нормоконтролер», реализующая полный цикл верификации сгенерированных ответов: декомпозицию текста на атомарные утверждения, гибридное извлечение релевантного контекста из базы нормативных документов, логическую проверку каждого факта агентомверификатором на базе концепции LLM-as-a-Judge и агрегацию результатов в интегральный показатель достоверности. Разработана авторская метрика WDS-FActScore (Weighted Domain-Specific Fact Score), реализующая принцип «инженерного пессимизма» за счёт дифференцированного взвешивания критических числовых параметров и описательных утверждений. Для устранения выявленной проблемы потери контекста при векторном поиске (Retrieval Bottleneck) спроектирована подсистема гибридного поиска, сочетающая семантический поиск на базе ChromaDB с лексическим алгоритмом BM25 и последующим повторным ранжированием посредством модели Cross-Encoder. Проведено многоэтапное экспериментальное исследование, включающее абляционное тестирование модуля верификации, сравнительный анализ базовой и модифицированной архитектур поиска, а также нагрузочное тестирование системы. Экспериментально доказано, что внедрение гибридной архитектуры обеспечивает двукратный прирост показателя полноты извлечения данных (Recall: с 0,32 до 0,64) и рост интегральной метрики WDSFActScore на 90%. Разработан пользовательский веб-интерфейс системы на базе фреймворка Streamlit.
This work investigates the problem of factual inaccuracy in texts generated by large language models (LLMs) when processing normative technical documentation in the oil and gas industry. A systematic review of existing hallucination detection and mitigation methods is conducted, and their limitations in the context of Russianlanguage specialized domains are identified. Based on this analysis, the post-hoc verification approach is substantiated as the most applicable method for working with regulatory documents such as GOST and SNiP standards. A multi-agent intelligent system, «AI-NormoController», is designed and implemented. The system realizes a complete verification pipeline: decomposition of generated text into atomic claims, hybrid retrieval of relevant context from a normative document knowledge base, logical verification of each claim by a verifier agent based on the LLM-as-a-Judge paradigm, and aggregation of results into an integrated reliability score. An original metric, WDS-FActScore (Weighted Domain-Specific Fact Score), is developed, implementing the principle of «engineering pessimism» through differentiated weighting of critical numerical parameters versus descriptive statements. To address the identified Retrieval Bottleneck problem, a hybrid retrieval subsystem is designed that combines dense semantic search (ChromaDB) with the sparse lexical BM25 algorithm and subsequent Cross-Encoder re-ranking. A multi-stage experimental study is conducted, comprising ablation testing of the verification module, comparative analysis of baseline and advanced retrieval architectures, and load testing. Experimental results demonstrate that the hybrid architecture provides a twofold increase in data retrieval completeness (Recall: from 0.32 to 0.64) and a 90% improvement in the WDS-FActScore metric. A web-based user interface is developed using the Streamlit framework.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|