Details

Title Статистическое моделирование и прогнозирование в футболе на основе данных матчевой статистики и машинного обучения: выпускная квалификационная работа бакалавра: направление 01.03.02 «Прикладная математика и информатика» ; образовательная программа 01.03.02_02 «Системное программирование» = Statistical Modeling and Forecasting in Football Based on Match Statistics Data and Machine Learning
Creators Тишковец Сергей Евгеньевич
Scientific adviser Крашенинников Сергей Вениаминович
Other creators Иванов Д. Ю.
Organization Санкт-Петербургский политехнический университет Петра Великого. Физико-механический институт
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects футбол ; статистическое моделирование ; машинное обучение ; прогнозирование ; спортивная аналитика ; рыночная стоимость ; football ; statistical modeling ; machine learning ; predictive analytics ; market value
Document type Bachelor graduation qualification work
Language Russian
Level of education Bachelor
Speciality code (FGOS) 01.03.02
Speciality group (FGOS) 010000 - Математика и механика
DOI 10.18720/SPBPU/3/2026/vr/vr26-3296
Rights Доступ по паролю из сети Интернет (чтение, печать)
Additionally New arrival
Record key ru\spstu\vkr\41403
Record create date 7/31/2026

Allowed Actions

Action 'Read' will be available if you login or access site from another network

Group Anonymous
Network Internet

Проект сопоставляет предиктивную мощность классического статистического аппарата, ML-алгоритмов и нейросетевых архитектур. Основной фокус исследования направлен на экстраполяцию футбольных результатов и расчет трансферных ценников. Для реализации идеи авторы последовательно закрыли следующий пул задач: 1. Агрегировали массивы матчевой статистики европейской «Большой пятерки» за период 2014–2023 гг. 2. Математически обосновали корректность применения распределения Пуассона для описания забитых мячей. 3. Обучили статистические и ML-модели решать задачи классификации исходов и регрессии стоимости. 4. Изолировали стилевые паттерны футболистов через алгоритмы кластеризации. 5. Спроектировали рекуррентную архитектуру LSTM для извлечения зависимостей из временных рядов. 6. Выполнили кросс-оценку обученных алгоритмов по метрикам точности и интерпретируемости. Вычислительные тесты математически подтвердили превосходство нелинейных алгоритмов над базовыми линейными аналогами. Аналитическое ядро опирается на математическое моделирование и методы интеллектуального анализа. Сквозь вычислительный пайплайн прогнали матрицу из 16 000 матчей. Архитектура CatBoost закрыла задачу предсказания исходов с точностью 76%, параллельно выдав высокий коэффициент детерминации стоимости. Полносвязная сеть MLP остановилась на отметке 75%, доказав реальную применимость DL-методов в подобном классе задач. Программный код написан на языке Python с подключением библиотек pandas и scikit-learn, а также фреймворков CatBoost и TensorFlow/Keras.

This research benchmarks the predictive capabilities of classical statistics, ML algorithms, and deep neural networks when determining player market values and predicting match outcomes. The project pipeline required solving the following technical tasks: 1. Scraping and merging tournament data from the European "Top-5" leagues spanning 2014 to 2023. 2. Providing strict mathematical validation for using the Poisson distribution to model goal scoring. 3. Training robust statistical and ML models to handle outcome classification and pricing regression. 4. Utilizing clustering techniques to segment athletes based on distinct playing styles. 5. Engineering an LSTM recurrent neural network to extract deep patterns from dynamic time series. 6. Running a cross-evaluation of the deployed architectures regarding their accuracy and interpretability. We pulled the core datasets directly from Kaggle, Transfermarkt, and SoFIFA, aggregating a massive volume of historical transfers and match metrics. Computational runs proved that non-linear algorithmic frameworks significantly outperform baseline linear approaches. The core analysis relies heavily on mathematical modeling (specifically, a Dixon-Coles modification) and data mining strategies (gradient boosting). The models processed a final matrix of 16,000 football matches. CatBoost estimators hit a 76% accuracy rate in outcome classification while demonstrating a solid value determination coefficient. DL methods maintained strict parity: the MLP network recorded a 75% accuracy. The entire software stack was implemented in Python using pandas, scikit-learn, CatBoost, and TensorFlow/Keras.

Network User group Action
ILC SPbPU Local Network All
Read Print
Internet Authorized users SPbPU
Read Print
Internet Anonymous
...