Детальная информация
| Название | Автоматизированное извлечение ключевых понятий из медицинских текстов с использованием трансформерных моделей и методов семантического анализа: выпускная квалификационная работа бакалавра: направление 45.03.04 «Интеллектуальные системы в гуманитарной сфере» ; образовательная программа 45.03.04_01 «Цифровые технологии и иностранные языки» = Automated key concept extraction from medical texts using transformer models and semantic analysis methods |
|---|---|
| Авторы | Чернякова Татьяна Леонидовна |
| Научный руководитель | Дмитриев Александр Владиславович |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Гуманитарный институт |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | медицинские тексты ; обработка естественного языка ; извлечение ключевых понятий ; трансформерные модели ; семантический анализ ; граммовые алгоритмы ; доменная адаптация ; RuBioBERT ; medical texts ; natural language processing ; key concept extraction ; transformer models ; semantic analysis ; graph algorithms ; domain adaptation |
| Тип документа | Выпускная квалификационная работа бакалавра |
| Язык | Русский |
| Уровень высшего образования | Бакалавриат |
| Код специальности ФГОС | 45.03.04 |
| Группа специальностей ФГОС | 450000 - Языкознание и литературоведение |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-3072 |
| Права доступа | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\41921 |
| Дата создания записи | 12.08.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет возможно после подготовки администраторами необходимых файлов
Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
Данная работа посвящена разработке и экспериментальной апробации гибридного конвейера автоматического извлечения ключевых понятий (Key Concept Extraction, KCE) из неструктурированных русскоязычных медицинских текстов на основе доменно-адаптированной трансформерной модели RuBioBERT, графовых алгоритмов ранжирования и экспертных баз знаний. Задачи, которые решались в ходе исследования: Изучение и теоретический обзор современных подходов к Key Concept Extraction (KCE) в биомедицинском NLP, включая статистические, графовые и эмбеддинг-ориентированные методы. Формирование исследовательского корпуса на базе подвыборки Massive Medical Corpus (MMedC), а также экспертная разметка тестового подмножества («золотого стандарта») в среде Label Studio. Проектирование и программная реализация гибридного конвейера KCE, сочетающего лингвистическую предобработку, семантическую генерацию кандидатов (KeyBERT + RuBioBERT), графовое ранжирование (PageRank) и модуль доменной адаптации. Проведение сравнительного количественного эксперимента разработанного метода с классическими базовыми линиями (TF-IDF, TextRank) по метрикам Precision, Recall и F1-score. Выполнение качественного анализа типичных ошибок извлечения концептов и определение перспективных направлений оптимизации и развития разработанной архитектуры. Работа выполнена на материале русскоязычной подвыборки медицинского корпуса MMedC, для валидации которой было создано верифицированное эталонное подмножество из 50 клинических эпикризов. В ходе исследования были проведены вычислительные эксперименты по извлечению концептов базовыми методами и разработанным гибридным пайплайном, а также осуществлен детальный лингвистический анализ ошибок. Полученные количественные результаты показали значительное преимущество гибридного подхода (F1-score = 0.413), что обеспечило относительный прирост эффективности на 78% по сравнению с классическим алгоритмом TextRank за счет радикального повышения полноты извлечения сложных многословных терминов. Для достижения указанных результатов использовались современные средства обработки естественного языка и анализа данных: язык программирования Python; библиотеки Natasha, PyMorphy3, KeyBERT, transformers, NetworkX, scikit-learn, difflib; платформа разметки данных Label Studio; а также локальная среда разработки Visual Studio Code.
This study is devoted to the development and experimental evaluation of a hybrid pipeline for automated Key Concept Extraction (KCE) from unstructured Russian clinical texts based on the domain-adapted transformer model RuBioBERT, graph-based ranking algorithms, and expert knowledge bases. The research set the following goals: To review contemporary approaches to Key Concept Extraction (KCE) in biomedical NLP, including statistical, graph-based, and embedding-oriented methods. To compile a research corpus based on a subset of the Massive Medical Corpus (MMedC) and perform expert annotation of a test subset ("gold standard") using Label Studio. To design and implement a hybrid KCE pipeline combining linguistic preprocessing, semantic candidate generation (KeyBERT + RuBioBERT), graph-based ranking (PageRank), and a domain adaptation module. To conduct a comparative quantitative evaluation of the developed method against classical baselines (TF-IDF, TextRank) using Precision, Recall, and F1-score metrics. To perform a qualitative analysis of typical concept extraction errors and identify promising directions for the optimization and future development of the architecture. The study is based on the Russian-language subset of the MMedC medical corpus, with a verified reference subset of 50 clinical records compiled for validation purposes. The research involved computational experiments on concept extraction using baseline methods and the developed hybrid pipeline, followed by a detailed linguistic error analysis. The obtained quantitative results demonstrated a significant advantage of the hybrid approach (F1-score = 0.413), providing a 78% relative quality improvement over the classical TextRank algorithm due to a radical increase in the recall of multi-word clinical terms. To achieve these results, the study employed modern tools for natural language processing and data analysis, including the Python programming language; the Natasha, PyMorphy3, KeyBERT, transformers, NetworkX, scikit-learn and difflib libraries; the Label Studio data annotation platform; and the Visual Studio Code local development environment.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|