Details

Title Мультиагент автоматизации менеджмента научных данных: выпускная квалификационная работа бакалавра: направление 01.03.02 «Прикладная математика и информатика» ; образовательная программа 01.03.02_02 «Системное программирование» = Multi-agent automation ofscientific data management
Creators Сивошенко Александр Юрьевич
Scientific adviser Чуканов Вячеслав Сергеевич
Other creators Пчицкая Е. И.
Organization Санкт-Петербургский политехнический университет Петра Великого. Физико-механический институт
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects научные данные ; семантическая реконструкция ; сопоставление схем ; мультиагентная система ; открытые репозитории ; scientific data ; semantic reconstruction ; schema matching ; multi-agent system ; open repositories
Document type Bachelor graduation qualification work
Language Russian
Level of education Bachelor
Speciality code (FGOS) 01.03.02
Speciality group (FGOS) 010000 - Математика и механика
DOI 10.18720/SPBPU/3/2026/vr/vr26-3297
Rights Доступ по паролю из сети Интернет (чтение, печать, копирование)
Additionally New arrival
Record key ru\spstu\vkr\41404
Record create date 7/31/2026

Allowed Actions

Action 'Read' will be available if administrator prepare required files

Action 'Download' will be available if you login or access site from another network

Group Anonymous
Network Internet

Выпускная квалификационная работа посвящена разработке мультиагентной системы MdMAS для семантической реконструкции научных данных, представленных связкой «статья + репозиторий». Предмет исследования — методы автоматизации менеджмента научных данных: извлечение структуры Zenodo, генерация табличных метаданных, эмбеддинговое представление полей и гармонизация схем при объединении датасетов. Цель работы — построить воспроизводимый конвейер, связывающий публикацию, структуру репозитория и табличные данные и сокращающий ручную разметку. Методология основана на декомпозиции процесса на специализированные сценарии, применении LLM для интерпретации контекста и использовании эмбеддингов с алгоритмической либо LLM-верификацией соответствий. Реализованы прототипы подсистем разметки метаданных и сопоставления схем. Проведены пилотная авторазметка трёх записей Zenodo, анализ эмбеддингового пространства на паре схем с 23 эталонными соответствиями, ε-сопоставление и сравнение методов сопоставления на 38 синтетических репликах; схема отбора k ближайших кандидатов с LLM-верификацией достигла средней точности 0.960 против 0.775 у венгерского сопоставления. Результаты применимы для подготовки машиночитаемых датасетов, первичной разметки репозиториев и интеграции разнородных научных данных. Сделан вывод, что сочетание репозиторного контекста, текста статьи и двухэтапного сопоставления схем является целесообразной основой MdMAS, при этом спорные соответствия должны проходить экспертную проверку.

This graduate qualification thesis develops MdMAS, a multi-agent system for the semantic reconstruction of scientific data represented by an article--repository pair. The research subject comprises methods for automating scientific data management: Zenodo record structure extraction, tabular metadata generation, field embeddings, and schema harmonization when merging datasets. The goal is to build a reproducible pipeline linking the publication, repository layout, and tabular data so as to reduce manual annotation. The methodology rests on decomposing the workflow into specialized scenarios, using large language models for contextual interpretation and embeddings with subsequent algorithmic or LLM-based verification of correspondences. Prototypes were implemented for metadata annotation and schema-matching subsystems. Experiments included a pilot auto-annotation of three Zenodo records, embedding-space analysis on a pair of schemas with 23 ground-truth correspondences, ε-matching, and schema-matching comparison on 38 synthetic replicas; retrieval of k nearest candidates with LLM verification achieved a mean accuracy of 0.960 versus 0.775 for Hungarian matching. The results support machine-readable dataset preparation, primary repository annotation, and integration of heterogeneous scientific data. The conclusion is that combining repository context, article text, and two-stage schema matching forms a sound basis for MdMAS, while ambiguous correspondences require expert review.

Network User group Action
ILC SPbPU Local Network All
Download
Internet Authorized users SPbPU
Download
Internet Anonymous
...