Details
| Title | Применение машинного обучения для анализа биомеханики человека при выполнении физических упражнений: выпускная квалификационная работа магистра: направление 01.04.03 «Механика и математическое моделирование» ; образовательная программа 01.04.03_03 «Механика и цифровое производство» = Application of Machine Learning for Human Biomechanics Analysis During Physical Exercises |
|---|---|
| Creators | Волков Денис Сергеевич |
| Scientific adviser | Ле-Захаров Александр Аневич |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Физико-механический институт |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | оценка позы человека ; распознавание действий ; физически информированные модели ; motion patches ; VLM ; human pose estimation ; action recognition ; physics - aware models |
| Document type | Master graduation qualification work |
| Language | Russian |
| Level of education | Master |
| Speciality code (FGOS) | 01.04.03 |
| Speciality group (FGOS) | 010000 - Математика и механика |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-4309 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\45280 |
| Record create date | 9/8/2026 |
Allowed Actions
–
Action 'Read' will be available if you login or access site from another network
Action 'Download' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
Цель работы~--- повысить точность распознавания действий человека (HAR) и качество генерируемых рекомендаций за счёт включения физически осмысленных динамических признаков в контур мультимодальной модели. В рамках работы разработана архитектура, объединяющая кинематический регрессор CLIFF, физически информированный трансформер PhysPT и языковую модель. Кинематические и динамические данные (поза, моменты сил, контактные силы) преобразуются в промежуточное представление motion patches, которое кодируется предобученным Vision Transformer ViT-B/16 в компактный эмбеддинг. Этот эмбеддинг подаётся в языковую модель в качестве motion-токена, заменяя первый токен текстового запроса. Для экспериментальной оценки использован бенчмарк QEVD-FIT-COACH. Проведённые абляционные эксперименты показали, что включение динамических признаков улучшает метрику BERTScore F1 на 41~\% по сравнению с кинематическим базовым вариантом, а также повышает ROUGE-L и Temporal F-Score. Визуализация физических параметров подтверждает корректность воспроизводимой динамики.
The goal is to improve the accuracy of human action recognition (HAR) and the quality of generated recommendations by incorporating physically meaningful dynamic features into a multimodal model pipeline. The proposed architecture combines the CLIFF kinematic regressor, the physics-aware PhysPT transformer, and a compact vision-language model. Kinematic and dynamic data (pose, joint torques, contact forces) are transformed into an intermediate motion patches representation, which is encoded by a pretrained Vision Transformer ViT-B/16 into a compact embedding. This embedding is fed into the language model as a motion token, replacing the first token of the textual prompt. The QEVD-FIT-COACH benchmark was used for experimental evaluation. Ablation experiments showed that incorporating dynamic features improves the BERTScore F1 metric by 41~\% compared to the kinematic baseline, and also increases ROUGE-L and Temporal F-Score. Visualization of physical parameters confirms the correctness of the reproduced dynamics.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|