Детальная информация
| Название | Исследование крупной языковой модели для диагностики неисправностей промышленного оборудования на основе эффективной тонкой настройки параметров и слияния данных из нескольких источников.: выпускная квалификационная работа бакалавра: направление 27.03.04 «Управление в технических системах» ; образовательная программа 27.03.04_07 «Промышленный искусственный интеллект» = Research of a large language model for industrial equipment fault diagnosis based on parameter-efficient fine-tuning and multi-source data fusion |
|---|---|
| Авторы | У Фэйян |
| Научный руководитель | Олейников Виталий Сергеевич |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | мультимодальная большая языковая модель ; промышленная диагностика ; обнаружение аномалий ; Qwen2.5-VL ; MMAD ; LoRA ; мультиисточниковые данные ; multimodal large language model ; industrial diagnosis ; anomaly detection ; AMAD ; multi-source data |
| Тип документа | Выпускная квалификационная работа бакалавра |
| Язык | Русский |
| Уровень высшего образования | Бакалавриат |
| Код специальности ФГОС | 27.03.04 |
| Группа специальностей ФГОС | 270000 - Управление в технических системах |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-5798 |
| Права доступа | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\42868 |
| Дата создания записи | 21.08.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет возможно после подготовки администраторами необходимых файлов
Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
В работе рассматривается применение мультимодальной большой языковой модели для диагностики неисправностей промышленного оборудования по изображениям и текстовым данным. Актуальность исследования связана с необходимостью повышения качества промышленного контроля, сокращения объема ручной инспекции и расширения возможностей интеллектуальных систем в задачах обнаружения и анализа дефектов. Цель работы заключается в исследовании адаптации модели Qwen2.5-VL к задачам промышленной диагностики на основе эффективной тонкой настройки параметров и объединения данных из нескольких источников. В качестве основного набора данных используется MMAD, сформированный на базе открытых промышленных датасетов MVTec AD, MVTec LOCO AD, VisA и GoodsAD. Набор содержит изображения, вопросы, варианты ответов, правильные ответы, текстовые описания и маски дефектов. В работе выполнен обзор предметной области, рассмотрены особенности MMAD и обоснован выбор архитектуры Qwen2.5-VL. Для адаптации модели предлагается использовать метод LoRA, позволяющий сократить количество обучаемых параметров и уменьшить вычислительные затраты. Практическая значимость работы заключается в разработке подхода к построению мультимодального модуля диагностики, способного решать задачи обнаружения, классификации, локализации и описания дефектов, а также анализа их возможного влияния.
This work considers the use of a multimodal large language model for industrial equipment fault diagnosis based on image and text data. The relevance of the study is determined by the need to improve industrial inspection quality, reduce manual checking, and enhance intelligent systems for defect detection and analysis. The aim of the work is to investigate the adaptation of the Qwen2.5-VL model to industrial diagnostic tasks using parameter-efficient fine-tuning and data fusion from multiple sources. The main dataset used in the study is MMAD, which is built on open industrial datasets including MVTec AD, MVTec LOCO AD, VisA, and GoodsAD. The dataset contains images, questions, answer options, correct answers, textual descriptions, and defect masks. The work includes a review of the application domain, an analysis of the MMAD dataset, and a justification for choosing the Qwen2.5-VL architecture. The LoRA method is proposed for model adaptation in order to reduce the number of trainable parameters and computational costs. The practical significance of the work lies in the development of an approach for building a multimodal diagnostic module capable of solving defect detection, classification, localization, description, and defect impact analysis tasks.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|