Детальная информация
| Название | Разработка и валидация модели машинного обучения для прогнозирования заболеваний на основе клинических данных: выпускная квалификационная работа магистра: направление 02.04.01 «Математика и компьютерные науки» ; образовательная программа 02.04.01_03 «Искусственный интеллект и машинное обучение» = Development and validation of a machine learning model for disease prediction based on clinical data |
|---|---|
| Авторы | Гази Шайхо Ахмад |
| Научный руководитель | Заборовский Владимир Сергеевич |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | прогнозирования заболеваний ; машинного обучения ; высокую точность ; клинические решения ; скрытых закономерностей ; disease prediction ; machine learning ; high accuracy ; clinical decisions ; hidden patterns |
| Тип документа | Выпускная квалификационная работа магистра |
| Язык | Русский |
| Уровень высшего образования | Магистратура |
| Код специальности ФГОС | 02.04.01 |
| Группа специальностей ФГОС | 020000 - Компьютерные и информационные науки |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-5549 |
| Права доступа | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\44829 |
| Дата создания записи | 04.09.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
В последние годы прогнозирование заболеваний привлекло значительное внимание специалистов в области компьютерных наук и медицины, в результате был разработан ряд моделей для диагностики и прогнозирования течения различных заболеваний, эти модели позволяют принимать более обоснованные клинические решения, оценивая вероятность конкретных исходов на основе множества факторов, определяющих состояние пациента, базы данных о здоровье пациентов содержат огромные объемы информации, связанной с диабетом и результатами лабораторных анализов, что делает выявление скрытых закономерностей в этих массивах данных критически важной задачей, в которой методы машинного обучения играют ключевую роль, в этом исследовании разработан и проверен интерпретируемый алгоритм машинного обучения для прогнозирования диабета с использованием базы данных диабета из популяции индейцев Пема, пропущенные значения были заменены с использованием метода медианного присвоения, а дисбаланс классов был устранен путем применения алгоритма SMOTE исключительно к обучающему набору данных. Четыре алгоритма кластеризации — случайный лес, XGBoost, LightGBM и градиентный бустинг — были сравнены с использованием десятикратной перекрестной проверки, а для интерпретации модели использовался анализ SHAP. Предложенный механизм показывает, что комбинированное обучение с интерпретацией SHAP обеспечивает точные, клинически значимые и надежные прогнозы риска развития диабета, гарантируя высокую точность идентификации и выявления заболевания.
In recent years, disease prediction has garnered significant attention from computer scientists and medical professionals, consequently, a range of models have been developed to diagnose and predict the course of various diseases. These models facilitate more informed clinical decisions by assessing the probability of specific outcomes based on multiple factors that determine a patients condition, patient health databases contain vast amounts of information related to diabetes and laboratory test results, making the identification of hidden patterns within these massive datasets a critical challenge—one in which machine learning techniques play a pivotal role, this study develops and validates an interpretable machine learning pathway for predicting diabetes using a diabetes database from the Pema Indian population, missing values were replaced using the median assignment method, and class imbalances were addressed by applying SMOTE exclusively to the training set. Four clustering algorithms—random forest, XGBoost, LightGBM, and gradient boosting—were compared using ten-fold cross-validation, with SHAP analysis used to interpret the model, the proposed mechanism shows that combined learning with SHAP interpretation provides accurate, clinically significant, and reliable predictions of diabetes risk, ensuring high accuracy in disease identification and detection.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|