Details

Title Применение машинного обучения для анализа биомеханики человека при выполнении физических упражнений: выпускная квалификационная работа магистра: направление 01.04.03 «Механика и математическое моделирование» ; образовательная программа 01.04.03_03 «Механика и цифровое производство» = Application of Machine Learning for Human Biomechanics Analysis During Physical Exercises
Creators Волков Денис Сергеевич
Scientific adviser Ле-Захаров Александр Аневич
Organization Санкт-Петербургский политехнический университет Петра Великого. Физико-механический институт
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects оценка позы человека ; распознавание действий ; физически информированные модели ; motion patches ; VLM ; human pose estimation ; action recognition ; physics - aware models
Document type Master graduation qualification work
Language Russian
Level of education Master
Speciality code (FGOS) 01.04.03
Speciality group (FGOS) 010000 - Математика и механика
DOI 10.18720/SPBPU/3/2026/vr/vr26-4309
Rights Доступ по паролю из сети Интернет (чтение, печать, копирование)
Additionally New arrival
Record key ru\spstu\vkr\45280
Record create date 9/8/2026

Allowed Actions

Action 'Read' will be available if you login or access site from another network

Action 'Download' will be available if you login or access site from another network

Group Anonymous
Network Internet

Цель работы~--- повысить точность распознавания действий человека (HAR) и качество генерируемых рекомендаций за счёт включения физически осмысленных динамических признаков в контур мультимодальной модели. В рамках работы разработана архитектура, объединяющая кинематический регрессор CLIFF, физически информированный трансформер PhysPT и языковую модель. Кинематические и динамические данные (поза, моменты сил, контактные силы) преобразуются в промежуточное представление motion patches, которое кодируется предобученным Vision Transformer ViT-B/16 в компактный эмбеддинг. Этот эмбеддинг подаётся в языковую модель в качестве motion-токена, заменяя первый токен текстового запроса. Для экспериментальной оценки использован бенчмарк QEVD-FIT-COACH. Проведённые абляционные эксперименты показали, что включение динамических признаков улучшает метрику BERTScore F1 на 41~\% по сравнению с кинематическим базовым вариантом, а также повышает ROUGE-L и Temporal F-Score. Визуализация физических параметров подтверждает корректность воспроизводимой динамики.

The goal is to improve the accuracy of human action recognition (HAR) and the quality of generated recommendations by incorporating physically meaningful dynamic features into a multimodal model pipeline. The proposed architecture combines the CLIFF kinematic regressor, the physics-aware PhysPT transformer, and a compact vision-language model. Kinematic and dynamic data (pose, joint torques, contact forces) are transformed into an intermediate motion patches representation, which is encoded by a pretrained Vision Transformer ViT-B/16 into a compact embedding. This embedding is fed into the language model as a motion token, replacing the first token of the textual prompt. The QEVD-FIT-COACH benchmark was used for experimental evaluation. Ablation experiments showed that incorporating dynamic features improves the BERTScore F1 metric by 41~\% compared to the kinematic baseline, and also increases ROUGE-L and Temporal F-Score. Visualization of physical parameters confirms the correctness of the reproduced dynamics.

Network User group Action
ILC SPbPU Local Network All
Read Print Download
Internet Authorized users SPbPU
Read Print Download
Internet Anonymous
...