Детальная информация
| Название | Мультиагент автоматизации менеджмента научных данных: выпускная квалификационная работа бакалавра: направление 01.03.02 «Прикладная математика и информатика» ; образовательная программа 01.03.02_02 «Системное программирование» = Multi-agent automation ofscientific data management |
|---|---|
| Авторы | Сивошенко Александр Юрьевич |
| Научный руководитель | Чуканов Вячеслав Сергеевич |
| Другие авторы | Пчицкая Е. И. |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Физико-механический институт |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | научные данные ; семантическая реконструкция ; сопоставление схем ; мультиагентная система ; открытые репозитории ; scientific data ; semantic reconstruction ; schema matching ; multi-agent system ; open repositories |
| Тип документа | Выпускная квалификационная работа бакалавра |
| Язык | Русский |
| Уровень высшего образования | Бакалавриат |
| Код специальности ФГОС | 01.03.02 |
| Группа специальностей ФГОС | 010000 - Математика и механика |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-3297 |
| Права доступа | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\41404 |
| Дата создания записи | 31.07.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет возможно после подготовки администраторами необходимых файлов
Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
Выпускная квалификационная работа посвящена разработке мультиагентной системы MdMAS для семантической реконструкции научных данных, представленных связкой «статья + репозиторий». Предмет исследования — методы автоматизации менеджмента научных данных: извлечение структуры Zenodo, генерация табличных метаданных, эмбеддинговое представление полей и гармонизация схем при объединении датасетов. Цель работы — построить воспроизводимый конвейер, связывающий публикацию, структуру репозитория и табличные данные и сокращающий ручную разметку. Методология основана на декомпозиции процесса на специализированные сценарии, применении LLM для интерпретации контекста и использовании эмбеддингов с алгоритмической либо LLM-верификацией соответствий. Реализованы прототипы подсистем разметки метаданных и сопоставления схем. Проведены пилотная авторазметка трёх записей Zenodo, анализ эмбеддингового пространства на паре схем с 23 эталонными соответствиями, ε-сопоставление и сравнение методов сопоставления на 38 синтетических репликах; схема отбора k ближайших кандидатов с LLM-верификацией достигла средней точности 0.960 против 0.775 у венгерского сопоставления. Результаты применимы для подготовки машиночитаемых датасетов, первичной разметки репозиториев и интеграции разнородных научных данных. Сделан вывод, что сочетание репозиторного контекста, текста статьи и двухэтапного сопоставления схем является целесообразной основой MdMAS, при этом спорные соответствия должны проходить экспертную проверку.
This graduate qualification thesis develops MdMAS, a multi-agent system for the semantic reconstruction of scientific data represented by an article--repository pair. The research subject comprises methods for automating scientific data management: Zenodo record structure extraction, tabular metadata generation, field embeddings, and schema harmonization when merging datasets. The goal is to build a reproducible pipeline linking the publication, repository layout, and tabular data so as to reduce manual annotation. The methodology rests on decomposing the workflow into specialized scenarios, using large language models for contextual interpretation and embeddings with subsequent algorithmic or LLM-based verification of correspondences. Prototypes were implemented for metadata annotation and schema-matching subsystems. Experiments included a pilot auto-annotation of three Zenodo records, embedding-space analysis on a pair of schemas with 23 ground-truth correspondences, ε-matching, and schema-matching comparison on 38 synthetic replicas; retrieval of k nearest candidates with LLM verification achieved a mean accuracy of 0.960 versus 0.775 for Hungarian matching. The results support machine-readable dataset preparation, primary repository annotation, and integration of heterogeneous scientific data. The conclusion is that combining repository context, article text, and two-stage schema matching forms a sound basis for MdMAS, while ambiguous correspondences require expert review.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|