Детальная информация
| Название | Статистическое моделирование и прогнозирование в футболе на основе данных матчевой статистики и машинного обучения: выпускная квалификационная работа бакалавра: направление 01.03.02 «Прикладная математика и информатика» ; образовательная программа 01.03.02_02 «Системное программирование» = Statistical Modeling and Forecasting in Football Based on Match Statistics Data and Machine Learning |
|---|---|
| Авторы | Тишковец Сергей Евгеньевич |
| Научный руководитель | Крашенинников Сергей Вениаминович |
| Другие авторы | Иванов Д. Ю. |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Физико-механический институт |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | футбол ; статистическое моделирование ; машинное обучение ; прогнозирование ; спортивная аналитика ; рыночная стоимость ; football ; statistical modeling ; machine learning ; predictive analytics ; market value |
| Тип документа | Выпускная квалификационная работа бакалавра |
| Язык | Русский |
| Уровень высшего образования | Бакалавриат |
| Код специальности ФГОС | 01.03.02 |
| Группа специальностей ФГОС | 010000 - Математика и механика |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-3296 |
| Права доступа | Доступ по паролю из сети Интернет (чтение, печать) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\41403 |
| Дата создания записи | 31.07.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
Проект сопоставляет предиктивную мощность классического статистического аппарата, ML-алгоритмов и нейросетевых архитектур. Основной фокус исследования направлен на экстраполяцию футбольных результатов и расчет трансферных ценников. Для реализации идеи авторы последовательно закрыли следующий пул задач: 1. Агрегировали массивы матчевой статистики европейской «Большой пятерки» за период 2014–2023 гг. 2. Математически обосновали корректность применения распределения Пуассона для описания забитых мячей. 3. Обучили статистические и ML-модели решать задачи классификации исходов и регрессии стоимости. 4. Изолировали стилевые паттерны футболистов через алгоритмы кластеризации. 5. Спроектировали рекуррентную архитектуру LSTM для извлечения зависимостей из временных рядов. 6. Выполнили кросс-оценку обученных алгоритмов по метрикам точности и интерпретируемости. Вычислительные тесты математически подтвердили превосходство нелинейных алгоритмов над базовыми линейными аналогами. Аналитическое ядро опирается на математическое моделирование и методы интеллектуального анализа. Сквозь вычислительный пайплайн прогнали матрицу из 16 000 матчей. Архитектура CatBoost закрыла задачу предсказания исходов с точностью 76%, параллельно выдав высокий коэффициент детерминации стоимости. Полносвязная сеть MLP остановилась на отметке 75%, доказав реальную применимость DL-методов в подобном классе задач. Программный код написан на языке Python с подключением библиотек pandas и scikit-learn, а также фреймворков CatBoost и TensorFlow/Keras.
This research benchmarks the predictive capabilities of classical statistics, ML algorithms, and deep neural networks when determining player market values and predicting match outcomes. The project pipeline required solving the following technical tasks: 1. Scraping and merging tournament data from the European "Top-5" leagues spanning 2014 to 2023. 2. Providing strict mathematical validation for using the Poisson distribution to model goal scoring. 3. Training robust statistical and ML models to handle outcome classification and pricing regression. 4. Utilizing clustering techniques to segment athletes based on distinct playing styles. 5. Engineering an LSTM recurrent neural network to extract deep patterns from dynamic time series. 6. Running a cross-evaluation of the deployed architectures regarding their accuracy and interpretability. We pulled the core datasets directly from Kaggle, Transfermarkt, and SoFIFA, aggregating a massive volume of historical transfers and match metrics. Computational runs proved that non-linear algorithmic frameworks significantly outperform baseline linear approaches. The core analysis relies heavily on mathematical modeling (specifically, a Dixon-Coles modification) and data mining strategies (gradient boosting). The models processed a final matrix of 16,000 football matches. CatBoost estimators hit a 76% accuracy rate in outcome classification while demonstrating a solid value determination coefficient. DL methods maintained strict parity: the MLP network recorded a 75% accuracy. The entire software stack was implemented in Python using pandas, scikit-learn, CatBoost, and TensorFlow/Keras.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|