Details
| Title | Разработка и сравнительный анализ методов few-shot обучения для автоматической детекции лингвистических маркеров депрессии в текстах социальных медиа: выпускная квалификационная работа магистра: направление 09.04.04 «Программная инженерия» ; образовательная программа 09.04.04_01 «Технология разработки и сопровождения качественного программного продукта» = Development and comparative analysis of few‑shot learning methods for automatic detection of linguistic markers of depression in social media texts |
|---|---|
| Creators | Шлякова Анна Сергеевна |
| Scientific adviser | Ковалев Артем Дмитриевич |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | few-shot обучение ; MAML ; трансформеры ; rubert‑tiny ; депрессия ; лингвистические маркеры ; вконтакте ; VK API ; few‑shot learning ; transformers ; depression ; linguistic markers ; VKontakte |
| Document type | Master graduation qualification work |
| Language | Russian |
| Level of education | Master |
| Speciality code (FGOS) | 09.04.04 |
| Speciality group (FGOS) | 090000 - Информатика и вычислительная техника |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-4898 |
| Rights | Доступ по паролю из сети Интернет (чтение) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\45071 |
| Record create date | 9/4/2026 |
Allowed Actions
–
Action 'Read' will be available if administrator prepare required files
| Group | Anonymous |
|---|---|
| Network | Internet |
Работа посвящена разработке и сравнению методов few‑shot обучения для выявления лингвистических маркеров депрессии в текстах ВКонтакте. Существующие подходы требуют 500–1000 размеченных текстов, что затрудняет оперативное внедрение. Предложено использование MAML с маскированием внимания, проведён сравнительный анализ с Prototypical Networks и Matching Networks. Задачи, которые решались в ходе исследования: 1. Анализ методов детекции депрессии и few‑shot обучения, обоснование выбора MAML. 2. Формирование корпуса русскоязычных текстов с разметкой маркеров депрессии (бинарная классификация) с участием экспертов-психологов. 3. Проектирование архитектуры сервиса для мета‑обучения и few‑shot адаптации. 4. Реализация сервиса на Python (PyTorch, higher, Transformers, FastAPI, React) с интеграцией VK API. 5. Экспериментальная оценка методов на выборках 5, 10, 20 текстов по F1, точности и времени адаптации. Работа выполнена на базе ВШПИ СПбПУ. Использован синтетический корпус из 212 847 текстов и 600 текстов, размеченных экспертами по наличию депрессивной лексики. Для мета‑обучения сгенерировано 20 000 эпизодов на основе 20 примитивных признаков. Базовая модель – RuBERT‑tiny (~10 млн параметров). MAML адаптировался за 3 градиентных шага (только классификатор), метрические методы – без подстройки. Валидация проведена на 12 добровольцах. В результате лучшие показатели у MAML с маскированием: на 20 примерах F1 = 0,73, AUC‑ROC = 0,81. Prototypical Networks – 0,66, Matching Networks – 0,64. Время адаптации MAML – 38 с, полный цикл – 53 с (< 1 мин). Прирост от маскирования – 3,9 п.п. (p < 0,001). Коэффициент сжатия данных – 25. Валидация на реальных пользователях: средний F1 = 0,740. Использованные технологии: Python (PyTorch, Transformers, higher, FastAPI, Motor, scikit‑learn), TypeScript (React, Chart.js), MongoDB (GridFS), Docker, VK API, NLTK. Сервис предназначен для первичного скрининга депрессивных состояний в психологических центрах и образовательных учреждениях.
The work is devoted to the development and comparison of few‑shot learning methods for detecting linguistic markers of depression in VKontakte texts. Existing approaches require 500–1000 labeled texts, which hinders rapid deployment. The use of MAML with attention masking is proposed, and a comparative analysis with Prototypical Networks and Matching Networks is carried out. The research set the following goals: 1. Analysis of depression detection and few‑shot learning methods, justification of the choice of MAML. 2. Formation of a corpus of Russian‑language texts with depression marker labeling (binary classification) involving expert psychologists. 3. Design of a service architecture for meta‑learning and few‑shot adaptation. 4. Implementation of the service in Python (PyTorch, higher, Transformers, FastAPI, React) with VK API integration. 5. Experimental evaluation of methods on 5, 10, 20 text samples by F1, accuracy, and adaptation time. The work was carried out at the Institute of Computer Science and Cybersecurity of SPbPU. A synthetic corpus of 212,847 texts and 600 texts labeled by experts for depressive vocabulary were used. For meta‑learning, 20,000 episodes were generated based on 20 primitive features. The base model is RuBERT‑tiny (~10 million parameters). MAML was adapted over 3 gradient steps (classifier only), metric methods – without tuning. Validation was performed on 12 volunteers. As a result, the best performance was achieved by MAML with masking: on 20 examples, F1 = 0.73, AUC‑ROC = 0.81. Prototypical Networks – 0.66, Matching Networks – 0.64. MAML adaptation time – 38 s, full cycle – 53 s (< 1 min). Improvement from masking – 3.9 p.p. (p < 0.001). Data compression ratio – 25. Validation on real users: average F1 = 0.740. Technologies used: Python (PyTorch, Transformers, higher, FastAPI, Motor, scikit‑learn), TypeScript (React, Chart.js), MongoDB (GridFS), Docker, VK API, NLTK. The service is intended for primary screening of depressive states in psychological centers and educational institutions.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|