Детальная информация

Название Применение машинного обучения для анализа биомеханики человека при выполнении физических упражнений: выпускная квалификационная работа магистра: направление 01.04.03 «Механика и математическое моделирование» ; образовательная программа 01.04.03_03 «Механика и цифровое производство» = Application of Machine Learning for Human Biomechanics Analysis During Physical Exercises
Авторы Волков Денис Сергеевич
Научный руководитель Ле-Захаров Александр Аневич
Организация Санкт-Петербургский политехнический университет Петра Великого. Физико-механический институт
Выходные сведения Санкт-Петербург, 2026
Коллекция Выпускные квалификационные работы ; Общая коллекция
Тематика оценка позы человека ; распознавание действий ; физически информированные модели ; motion patches ; VLM ; human pose estimation ; action recognition ; physics - aware models
Тип документа Выпускная квалификационная работа магистра
Язык Русский
Уровень высшего образования Магистратура
Код специальности ФГОС 01.04.03
Группа специальностей ФГОС 010000 - Математика и механика
DOI 10.18720/SPBPU/3/2026/vr/vr26-4309
Права доступа Доступ по паролю из сети Интернет (чтение, печать, копирование)
Дополнительно Новинка
Ключ записи ru\spstu\vkr\45280
Дата создания записи 08.09.2026

Разрешенные действия

Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Группа Анонимные пользователи
Сеть Интернет

Цель работы~--- повысить точность распознавания действий человека (HAR) и качество генерируемых рекомендаций за счёт включения физически осмысленных динамических признаков в контур мультимодальной модели. В рамках работы разработана архитектура, объединяющая кинематический регрессор CLIFF, физически информированный трансформер PhysPT и языковую модель. Кинематические и динамические данные (поза, моменты сил, контактные силы) преобразуются в промежуточное представление motion patches, которое кодируется предобученным Vision Transformer ViT-B/16 в компактный эмбеддинг. Этот эмбеддинг подаётся в языковую модель в качестве motion-токена, заменяя первый токен текстового запроса. Для экспериментальной оценки использован бенчмарк QEVD-FIT-COACH. Проведённые абляционные эксперименты показали, что включение динамических признаков улучшает метрику BERTScore F1 на 41~\% по сравнению с кинематическим базовым вариантом, а также повышает ROUGE-L и Temporal F-Score. Визуализация физических параметров подтверждает корректность воспроизводимой динамики.

The goal is to improve the accuracy of human action recognition (HAR) and the quality of generated recommendations by incorporating physically meaningful dynamic features into a multimodal model pipeline. The proposed architecture combines the CLIFF kinematic regressor, the physics-aware PhysPT transformer, and a compact vision-language model. Kinematic and dynamic data (pose, joint torques, contact forces) are transformed into an intermediate motion patches representation, which is encoded by a pretrained Vision Transformer ViT-B/16 into a compact embedding. This embedding is fed into the language model as a motion token, replacing the first token of the textual prompt. The QEVD-FIT-COACH benchmark was used for experimental evaluation. Ablation experiments showed that incorporating dynamic features improves the BERTScore F1 metric by 41~\% compared to the kinematic baseline, and also increases ROUGE-L and Temporal F-Score. Visualization of physical parameters confirms the correctness of the reproduced dynamics.

Место доступа Группа пользователей Действие
Локальная сеть ИБК СПбПУ Все
Прочитать Печать Загрузить
Интернет Авторизованные пользователи СПбПУ
Прочитать Печать Загрузить
Интернет Анонимные пользователи
...