Детальная информация

Название Статистическое моделирование и прогнозирование в футболе на основе данных матчевой статистики и машинного обучения: выпускная квалификационная работа бакалавра: направление 01.03.02 «Прикладная математика и информатика» ; образовательная программа 01.03.02_02 «Системное программирование» = Statistical Modeling and Forecasting in Football Based on Match Statistics Data and Machine Learning
Авторы Тишковец Сергей Евгеньевич
Научный руководитель Крашенинников Сергей Вениаминович
Другие авторы Иванов Д. Ю.
Организация Санкт-Петербургский политехнический университет Петра Великого. Физико-механический институт
Выходные сведения Санкт-Петербург, 2026
Коллекция Выпускные квалификационные работы ; Общая коллекция
Тематика футбол ; статистическое моделирование ; машинное обучение ; прогнозирование ; спортивная аналитика ; рыночная стоимость ; football ; statistical modeling ; machine learning ; predictive analytics ; market value
Тип документа Выпускная квалификационная работа бакалавра
Язык Русский
Уровень высшего образования Бакалавриат
Код специальности ФГОС 01.03.02
Группа специальностей ФГОС 010000 - Математика и механика
DOI 10.18720/SPBPU/3/2026/vr/vr26-3296
Права доступа Доступ по паролю из сети Интернет (чтение, печать)
Дополнительно Новинка
Ключ записи ru\spstu\vkr\41403
Дата создания записи 31.07.2026

Разрешенные действия

Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Группа Анонимные пользователи
Сеть Интернет

Проект сопоставляет предиктивную мощность классического статистического аппарата, ML-алгоритмов и нейросетевых архитектур. Основной фокус исследования направлен на экстраполяцию футбольных результатов и расчет трансферных ценников. Для реализации идеи авторы последовательно закрыли следующий пул задач: 1. Агрегировали массивы матчевой статистики европейской «Большой пятерки» за период 2014–2023 гг. 2. Математически обосновали корректность применения распределения Пуассона для описания забитых мячей. 3. Обучили статистические и ML-модели решать задачи классификации исходов и регрессии стоимости. 4. Изолировали стилевые паттерны футболистов через алгоритмы кластеризации. 5. Спроектировали рекуррентную архитектуру LSTM для извлечения зависимостей из временных рядов. 6. Выполнили кросс-оценку обученных алгоритмов по метрикам точности и интерпретируемости. Вычислительные тесты математически подтвердили превосходство нелинейных алгоритмов над базовыми линейными аналогами. Аналитическое ядро опирается на математическое моделирование и методы интеллектуального анализа. Сквозь вычислительный пайплайн прогнали матрицу из 16 000 матчей. Архитектура CatBoost закрыла задачу предсказания исходов с точностью 76%, параллельно выдав высокий коэффициент детерминации стоимости. Полносвязная сеть MLP остановилась на отметке 75%, доказав реальную применимость DL-методов в подобном классе задач. Программный код написан на языке Python с подключением библиотек pandas и scikit-learn, а также фреймворков CatBoost и TensorFlow/Keras.

This research benchmarks the predictive capabilities of classical statistics, ML algorithms, and deep neural networks when determining player market values and predicting match outcomes. The project pipeline required solving the following technical tasks: 1. Scraping and merging tournament data from the European "Top-5" leagues spanning 2014 to 2023. 2. Providing strict mathematical validation for using the Poisson distribution to model goal scoring. 3. Training robust statistical and ML models to handle outcome classification and pricing regression. 4. Utilizing clustering techniques to segment athletes based on distinct playing styles. 5. Engineering an LSTM recurrent neural network to extract deep patterns from dynamic time series. 6. Running a cross-evaluation of the deployed architectures regarding their accuracy and interpretability. We pulled the core datasets directly from Kaggle, Transfermarkt, and SoFIFA, aggregating a massive volume of historical transfers and match metrics. Computational runs proved that non-linear algorithmic frameworks significantly outperform baseline linear approaches. The core analysis relies heavily on mathematical modeling (specifically, a Dixon-Coles modification) and data mining strategies (gradient boosting). The models processed a final matrix of 16,000 football matches. CatBoost estimators hit a 76% accuracy rate in outcome classification while demonstrating a solid value determination coefficient. DL methods maintained strict parity: the MLP network recorded a 75% accuracy. The entire software stack was implemented in Python using pandas, scikit-learn, CatBoost, and TensorFlow/Keras.

Место доступа Группа пользователей Действие
Локальная сеть ИБК СПбПУ Все
Прочитать Печать
Интернет Авторизованные пользователи СПбПУ
Прочитать Печать
Интернет Анонимные пользователи
...