Details

Title Автоматизированное извлечение ключевых понятий из медицинских текстов с использованием трансформерных моделей и методов семантического анализа: выпускная квалификационная работа бакалавра: направление 45.03.04 «Интеллектуальные системы в гуманитарной сфере» ; образовательная программа 45.03.04_01 «Цифровые технологии и иностранные языки» = Automated key concept extraction from medical texts using transformer models and semantic analysis methods
Creators Чернякова Татьяна Леонидовна
Scientific adviser Дмитриев Александр Владиславович
Organization Санкт-Петербургский политехнический университет Петра Великого. Гуманитарный институт
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects медицинские тексты ; обработка естественного языка ; извлечение ключевых понятий ; трансформерные модели ; семантический анализ ; граммовые алгоритмы ; доменная адаптация ; RuBioBERT ; medical texts ; natural language processing ; key concept extraction ; transformer models ; semantic analysis ; graph algorithms ; domain adaptation
Document type Bachelor graduation qualification work
Language Russian
Level of education Bachelor
Speciality code (FGOS) 45.03.04
Speciality group (FGOS) 450000 - Языкознание и литературоведение
DOI 10.18720/SPBPU/3/2026/vr/vr26-3072
Rights Доступ по паролю из сети Интернет (чтение, печать, копирование)
Additionally New arrival
Record key ru\spstu\vkr\41921
Record create date 8/12/2026

Allowed Actions

Action 'Read' will be available if administrator prepare required files

Action 'Download' will be available if you login or access site from another network

Group Anonymous
Network Internet

Данная работа посвящена разработке и экспериментальной апробации гибридного конвейера автоматического извлечения ключевых понятий (Key Concept Extraction, KCE) из неструктурированных русскоязычных медицинских текстов на основе доменно-адаптированной трансформерной модели RuBioBERT, графовых алгоритмов ранжирования и экспертных баз знаний. Задачи, которые решались в ходе исследования: Изучение и теоретический обзор современных подходов к Key Concept Extraction (KCE) в биомедицинском NLP, включая статистические, графовые и эмбеддинг-ориентированные методы. Формирование исследовательского корпуса на базе подвыборки Massive Medical Corpus (MMedC), а также экспертная разметка тестового подмножества («золотого стандарта») в среде Label Studio. Проектирование и программная реализация гибридного конвейера KCE, сочетающего лингвистическую предобработку, семантическую генерацию кандидатов (KeyBERT + RuBioBERT), графовое ранжирование (PageRank) и модуль доменной адаптации. Проведение сравнительного количественного эксперимента разработанного метода с классическими базовыми линиями (TF-IDF, TextRank) по метрикам Precision, Recall и F1-score. Выполнение качественного анализа типичных ошибок извлечения концептов и определение перспективных направлений оптимизации и развития разработанной архитектуры. Работа выполнена на материале русскоязычной подвыборки медицинского корпуса MMedC, для валидации которой было создано верифицированное эталонное подмножество из 50 клинических эпикризов. В ходе исследования были проведены вычислительные эксперименты по извлечению концептов базовыми методами и разработанным гибридным пайплайном, а также осуществлен детальный лингвистический анализ ошибок. Полученные количественные результаты показали значительное преимущество гибридного подхода (F1-score = 0.413), что обеспечило относительный прирост эффективности на 78% по сравнению с классическим алгоритмом TextRank за счет радикального повышения полноты извлечения сложных многословных терминов. Для достижения указанных результатов использовались современные средства обработки естественного языка и анализа данных: язык программирования Python; библиотеки Natasha, PyMorphy3, KeyBERT, transformers, NetworkX, scikit-learn, difflib; платформа разметки данных Label Studio; а также локальная среда разработки Visual Studio Code.

This study is devoted to the development and experimental evaluation of a hybrid pipeline for automated Key Concept Extraction (KCE) from unstructured Russian clinical texts based on the domain-adapted transformer model RuBioBERT, graph-based ranking algorithms, and expert knowledge bases. The research set the following goals: To review contemporary approaches to Key Concept Extraction (KCE) in biomedical NLP, including statistical, graph-based, and embedding-oriented methods. To compile a research corpus based on a subset of the Massive Medical Corpus (MMedC) and perform expert annotation of a test subset ("gold standard") using Label Studio. To design and implement a hybrid KCE pipeline combining linguistic preprocessing, semantic candidate generation (KeyBERT + RuBioBERT), graph-based ranking (PageRank), and a domain adaptation module. To conduct a comparative quantitative evaluation of the developed method against classical baselines (TF-IDF, TextRank) using Precision, Recall, and F1-score metrics. To perform a qualitative analysis of typical concept extraction errors and identify promising directions for the optimization and future development of the architecture. The study is based on the Russian-language subset of the MMedC medical corpus, with a verified reference subset of 50 clinical records compiled for validation purposes. The research involved computational experiments on concept extraction using baseline methods and the developed hybrid pipeline, followed by a detailed linguistic error analysis. The obtained quantitative results demonstrated a significant advantage of the hybrid approach (F1-score = 0.413), providing a 78% relative quality improvement over the classical TextRank algorithm due to a radical increase in the recall of multi-word clinical terms. To achieve these results, the study employed modern tools for natural language processing and data analysis, including the Python programming language; the Natasha, PyMorphy3, KeyBERT, transformers, NetworkX, scikit-learn and difflib libraries; the Label Studio data annotation platform; and the Visual Studio Code local development environment.

Network User group Action
ILC SPbPU Local Network All
Download
Internet Authorized users SPbPU
Download
Internet Anonymous
...