Детальная информация

Название Разработка и валидация модели машинного обучения для прогнозирования заболеваний на основе клинических данных: выпускная квалификационная работа магистра: направление 02.04.01 «Математика и компьютерные науки» ; образовательная программа 02.04.01_03 «Искусственный интеллект и машинное обучение» = Development and validation of a machine learning model for disease prediction based on clinical data
Авторы Гази Шайхо Ахмад
Научный руководитель Заборовский Владимир Сергеевич
Организация Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности
Выходные сведения Санкт-Петербург, 2026
Коллекция Выпускные квалификационные работы ; Общая коллекция
Тематика прогнозирования заболеваний ; машинного обучения ; высокую точность ; клинические решения ; скрытых закономерностей ; disease prediction ; machine learning ; high accuracy ; clinical decisions ; hidden patterns
Тип документа Выпускная квалификационная работа магистра
Язык Русский
Уровень высшего образования Магистратура
Код специальности ФГОС 02.04.01
Группа специальностей ФГОС 020000 - Компьютерные и информационные науки
DOI 10.18720/SPBPU/3/2026/vr/vr26-5549
Права доступа Доступ по паролю из сети Интернет (чтение, печать, копирование)
Дополнительно Новинка
Ключ записи ru\spstu\vkr\44829
Дата создания записи 04.09.2026

Разрешенные действия

Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Группа Анонимные пользователи
Сеть Интернет

В последние годы прогнозирование заболеваний привлекло значительное внимание специалистов в области компьютерных наук и медицины, в результате был разработан ряд моделей для диагностики и прогнозирования течения различных заболеваний, эти модели позволяют принимать более обоснованные клинические решения, оценивая вероятность конкретных исходов на основе множества факторов, определяющих состояние пациента, базы данных о здоровье пациентов содержат огромные объемы информации, связанной с диабетом и результатами лабораторных анализов, что делает выявление скрытых закономерностей в этих массивах данных критически важной задачей, в которой методы машинного обучения играют ключевую роль, в этом исследовании разработан и проверен интерпретируемый алгоритм машинного обучения для прогнозирования диабета с использованием базы данных диабета из популяции индейцев Пема, пропущенные значения были заменены с использованием метода медианного присвоения, а дисбаланс классов был устранен путем применения алгоритма SMOTE исключительно к обучающему набору данных. Четыре алгоритма кластеризации — случайный лес, XGBoost, LightGBM и градиентный бустинг — были сравнены с использованием десятикратной перекрестной проверки, а для интерпретации модели использовался анализ SHAP. Предложенный механизм показывает, что комбинированное обучение с интерпретацией SHAP обеспечивает точные, клинически значимые и надежные прогнозы риска развития диабета, гарантируя высокую точность идентификации и выявления заболевания.

In recent years, disease prediction has garnered significant attention from computer scientists and medical professionals, consequently, a range of models have been developed to diagnose and predict the course of various diseases. These models facilitate more informed clinical decisions by assessing the probability of specific outcomes based on multiple factors that determine a patients condition, patient health databases contain vast amounts of information related to diabetes and laboratory test results, making the identification of hidden patterns within these massive datasets a critical challenge—one in which machine learning techniques play a pivotal role, this study develops and validates an interpretable machine learning pathway for predicting diabetes using a diabetes database from the Pema Indian population, missing values were replaced using the median assignment method, and class imbalances were addressed by applying SMOTE exclusively to the training set. Four clustering algorithms—random forest, XGBoost, LightGBM, and gradient boosting—were compared using ten-fold cross-validation, with SHAP analysis used to interpret the model, the proposed mechanism shows that combined learning with SHAP interpretation provides accurate, clinically significant, and reliable predictions of diabetes risk, ensuring high accuracy in disease identification and detection.

Место доступа Группа пользователей Действие
Локальная сеть ИБК СПбПУ Все
Прочитать Печать Загрузить
Интернет Авторизованные пользователи СПбПУ
Прочитать Печать Загрузить
Интернет Анонимные пользователи
...