Details
| Title | Разработка и валидация модели машинного обучения для прогнозирования заболеваний на основе клинических данных: выпускная квалификационная работа магистра: направление 02.04.01 «Математика и компьютерные науки» ; образовательная программа 02.04.01_03 «Искусственный интеллект и машинное обучение» = Development and validation of a machine learning model for disease prediction based on clinical data |
|---|---|
| Creators | Гази Шайхо Ахмад |
| Scientific adviser | Заборовский Владимир Сергеевич |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | прогнозирования заболеваний ; машинного обучения ; высокую точность ; клинические решения ; скрытых закономерностей ; disease prediction ; machine learning ; high accuracy ; clinical decisions ; hidden patterns |
| Document type | Master graduation qualification work |
| Language | Russian |
| Level of education | Master |
| Speciality code (FGOS) | 02.04.01 |
| Speciality group (FGOS) | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-5549 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\44829 |
| Record create date | 9/4/2026 |
Allowed Actions
–
Action 'Read' will be available if you login or access site from another network
Action 'Download' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
В последние годы прогнозирование заболеваний привлекло значительное внимание специалистов в области компьютерных наук и медицины, в результате был разработан ряд моделей для диагностики и прогнозирования течения различных заболеваний, эти модели позволяют принимать более обоснованные клинические решения, оценивая вероятность конкретных исходов на основе множества факторов, определяющих состояние пациента, базы данных о здоровье пациентов содержат огромные объемы информации, связанной с диабетом и результатами лабораторных анализов, что делает выявление скрытых закономерностей в этих массивах данных критически важной задачей, в которой методы машинного обучения играют ключевую роль, в этом исследовании разработан и проверен интерпретируемый алгоритм машинного обучения для прогнозирования диабета с использованием базы данных диабета из популяции индейцев Пема, пропущенные значения были заменены с использованием метода медианного присвоения, а дисбаланс классов был устранен путем применения алгоритма SMOTE исключительно к обучающему набору данных. Четыре алгоритма кластеризации — случайный лес, XGBoost, LightGBM и градиентный бустинг — были сравнены с использованием десятикратной перекрестной проверки, а для интерпретации модели использовался анализ SHAP. Предложенный механизм показывает, что комбинированное обучение с интерпретацией SHAP обеспечивает точные, клинически значимые и надежные прогнозы риска развития диабета, гарантируя высокую точность идентификации и выявления заболевания.
In recent years, disease prediction has garnered significant attention from computer scientists and medical professionals, consequently, a range of models have been developed to diagnose and predict the course of various diseases. These models facilitate more informed clinical decisions by assessing the probability of specific outcomes based on multiple factors that determine a patients condition, patient health databases contain vast amounts of information related to diabetes and laboratory test results, making the identification of hidden patterns within these massive datasets a critical challenge—one in which machine learning techniques play a pivotal role, this study develops and validates an interpretable machine learning pathway for predicting diabetes using a diabetes database from the Pema Indian population, missing values were replaced using the median assignment method, and class imbalances were addressed by applying SMOTE exclusively to the training set. Four clustering algorithms—random forest, XGBoost, LightGBM, and gradient boosting—were compared using ten-fold cross-validation, with SHAP analysis used to interpret the model, the proposed mechanism shows that combined learning with SHAP interpretation provides accurate, clinically significant, and reliable predictions of diabetes risk, ensuring high accuracy in disease identification and detection.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|