Детальная информация

Название Разработка и исследование методов построения и разметки корпусов текстов для адаптации языковых моделей к узкоспециализированным предметным областям: выпускная квалификационная работа магистра: направление 02.04.01 «Математика и компьютерные науки» ; образовательная программа 02.04.01_03 «Искусственный интеллект и машинное обучение» = Development and research of methods for constructing and annotating text corpora to adapt language models to highly specialized subject areas
Авторы Губарев Артём
Научный руководитель Заборовский Владимир Сергеевич
Организация Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Выходные сведения Санкт-Петербург, 2026
Коллекция Выпускные квалификационные работы ; Общая коллекция
Тематика адаптация языковых моделей ; узкоспециализированные предметные области ; торакальная онкология ; построение корпуса текстов ; иерархическая классификация ; фильтрация данных ; кластерный анализ ; dbscan ; knn ; векторные представления ; интерпретируемость моделей ; language model adaptation ; domain-specific fields ; thoracic oncology ; text corpus construction ; hierarchicclassification ; data filtering ; cluster analysis ; vector representations ; model interpretability
Тип документа Выпускная квалификационная работа магистра
Язык Русский
Уровень высшего образования Магистратура
Код специальности ФГОС 02.04.01
Группа специальностей ФГОС 020000 - Компьютерные и информационные науки
DOI 10.18720/SPBPU/3/2026/vr/vr26-4864
Права доступа Доступ по паролю из сети Интернет (чтение, печать, копирование)
Дополнительно Новинка
Ключ записи ru\spstu\vkr\45037
Дата создания записи 04.09.2026

Разрешенные действия

Действие 'Прочитать' будет возможно после подготовки администраторами необходимых файлов

Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Группа Анонимные пользователи
Сеть Интернет

Объектом исследования является адаптация языковых моделей к узкоспециализированным предметным областям. Работа посвящена разработке и исследованию методов построения и разметки корпусов текстов для адаптации языковой модели к области торакальной онкологии. Разработанные алгоритмы извлекают текстовые данные из исходных документов, очищают их от технического шума и обрабатывают специальную лексику. Кластерный анализ обработанных данных позволяет отсеять нерелевантные предметной области документы и предложения. На полученном корпусе модель RuBERT адаптируется к предметной области методом LoRA и выполняет иерархическую классификацию диагнозов. Для оценки качества методов адаптированная модель сравнивается с базовой версией. По результатам экспериментов значение Fβ-меры после адаптации возросло на 11 п.п. на уровне категорий и на 8 п.п. на уровне подкатегорий. Вместе с тем результаты работы не являются исчерпывающими, поскольку доступ к закрытым медицинским данным был ограничен, а привлечь специалиста предметной области для составления эталонной разметки и валидации алгоритмов не представлялось возможным.

The object of research is the adaptation of language models to narrow domainspecific fields. The work is devoted to the development and study of methods for constructing and labelling text corpora for adapting a language model to the field of thoracic oncology. The developed algorithms extract textual data from source documents, clean it from technical noise and process domain-specific vocabulary. Cluster analysis of the processed data allows filtering out documents and sentences irrelevant to the domain. On the resulting corpus, the RuBERT model is adapted to the domain using the LoRA method and performs hierarchical classification of diagnoses. To assess the quality of the methods, the adapted model is compared with the baseline version. According to the experimental results, the Fβ score increased by 11 p.p. at the category level and by 8 p.p. at the subcategory level after adaptation. At the same time, the results are not exhaustive, since access to closed medical data was limited, and it was not possible to involve a domain expert for creating reference labelling and validating the algorithms.

Место доступа Группа пользователей Действие
Локальная сеть ИБК СПбПУ Все
Загрузить
Интернет Авторизованные пользователи СПбПУ
Загрузить
Интернет Анонимные пользователи
...