Details
| Title | Разработка и исследование методов построения и разметки корпусов текстов для адаптации языковых моделей к узкоспециализированным предметным областям: выпускная квалификационная работа магистра: направление 02.04.01 «Математика и компьютерные науки» ; образовательная программа 02.04.01_03 «Искусственный интеллект и машинное обучение» = Development and research of methods for constructing and annotating text corpora to adapt language models to highly specialized subject areas |
|---|---|
| Creators | Губарев Артём |
| Scientific adviser | Заборовский Владимир Сергеевич |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | адаптация языковых моделей ; узкоспециализированные предметные области ; торакальная онкология ; построение корпуса текстов ; иерархическая классификация ; фильтрация данных ; кластерный анализ ; dbscan ; knn ; векторные представления ; интерпретируемость моделей ; language model adaptation ; domain-specific fields ; thoracic oncology ; text corpus construction ; hierarchicclassification ; data filtering ; cluster analysis ; vector representations ; model interpretability |
| Document type | Master graduation qualification work |
| Language | Russian |
| Level of education | Master |
| Speciality code (FGOS) | 02.04.01 |
| Speciality group (FGOS) | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-4864 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\45037 |
| Record create date | 9/4/2026 |
Allowed Actions
–
Action 'Read' will be available if administrator prepare required files
Action 'Download' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
Объектом исследования является адаптация языковых моделей к узкоспециализированным предметным областям. Работа посвящена разработке и исследованию методов построения и разметки корпусов текстов для адаптации языковой модели к области торакальной онкологии. Разработанные алгоритмы извлекают текстовые данные из исходных документов, очищают их от технического шума и обрабатывают специальную лексику. Кластерный анализ обработанных данных позволяет отсеять нерелевантные предметной области документы и предложения. На полученном корпусе модель RuBERT адаптируется к предметной области методом LoRA и выполняет иерархическую классификацию диагнозов. Для оценки качества методов адаптированная модель сравнивается с базовой версией. По результатам экспериментов значение Fβ-меры после адаптации возросло на 11 п.п. на уровне категорий и на 8 п.п. на уровне подкатегорий. Вместе с тем результаты работы не являются исчерпывающими, поскольку доступ к закрытым медицинским данным был ограничен, а привлечь специалиста предметной области для составления эталонной разметки и валидации алгоритмов не представлялось возможным.
The object of research is the adaptation of language models to narrow domainspecific fields. The work is devoted to the development and study of methods for constructing and labelling text corpora for adapting a language model to the field of thoracic oncology. The developed algorithms extract textual data from source documents, clean it from technical noise and process domain-specific vocabulary. Cluster analysis of the processed data allows filtering out documents and sentences irrelevant to the domain. On the resulting corpus, the RuBERT model is adapted to the domain using the LoRA method and performs hierarchical classification of diagnoses. To assess the quality of the methods, the adapted model is compared with the baseline version. According to the experimental results, the Fβ score increased by 11 p.p. at the category level and by 8 p.p. at the subcategory level after adaptation. At the same time, the results are not exhaustive, since access to closed medical data was limited, and it was not possible to involve a domain expert for creating reference labelling and validating the algorithms.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|