Детальная информация
| Название | Разработка и сравнение методов обработки и анализа геномных данных с высокой разреженностью для задач популяционной генетики: выпускная квалификационная работа бакалавра: направление 01.03.02 «Прикладная математика и информатика» ; образовательная программа 01.03.02_04 «Биоинформатика» = Development and comparison of methods for processing and analyzing sparse data for population genetics tasks |
|---|---|
| Авторы | Тыщенко Анастасия Дмитриевна |
| Научный руководитель | Самсонова Мария Георгиевна |
| Другие авторы | Самсонова А. А. |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Физико-механический институт |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | белый медведь ; SNP ; машинное обучение ; классификация популяций ; FST ; LASSO ; Random Forest ; XGBoost ; разреженные данные ; биомаркеры ; polar bear ; machine learning ; population classification ; sparse data ; biomarkers |
| Тип документа | Выпускная квалификационная работа бакалавра |
| Язык | Русский |
| Уровень высшего образования | Бакалавриат |
| Код специальности ФГОС | 01.03.02 |
| Группа специальностей ФГОС | 010000 - Математика и механика |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-2122 |
| Права доступа | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\41519 |
| Дата создания записи | 31.07.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
Данная работа посвящена разработке и сравнению методов анализа полноге номных SNP-данных с высокой долей пропусков для решения задач популяционной генетики белого медведя (Ursus maritimus) Российской Арктики с привлечением алгоритмов машинного обучения. Предмет исследования: генетическая диффе ренциация популяций белого медведя на основе анализа SNP-маркеров из истори ческих образцов (музейные коллекции, период сбора 1883–2000 гг.). Цель работы: разработка и сравнение методов обработки и анализа полногеномных SNP-данных с высокой разреженностью для идентификации информативных биомаркеров, разделяющих популяции, и оценки точности классификации географической при надлежности образцов. Методология: Реализован пайплайн предобработки данных, включающий фильтрацию по пропускам и частоте минорного аллеля (MAF), отбор SNP по максимальному попарному FST (метод Хадсона), стратифицированное разделение выборки на обучающую и тестовую. Выполнено сравнение двух методов кодирования генотипов (one-hot и count-based). Применены три алгоритма клас сификации с учителем: LASSO (L1-регуляризованная логистическая регрессия), Random Forest и XGBoost. Для каждого метода проведён подбор гиперпараметров (кросс-валидация, байесовская оптимизация). Качество моделей оценивалось по метрикам Balanced Accuracy и F1-macro. Анализ важности признаков позволил ран жировать SNP по их вкладу в классификацию и сформировать панели кандидатных биомаркеров. Результаты: Показано, что отбор SNP по максимальному попарному FST позволяет выделить маркеры, дифференцирующие восточную группиров ку (East). LASSO и XGBoost показали сопоставимую эффективность (Balanced Accuracy = 0.3143), при этом XGBoost единственный выделил панель из 20 SNP, статистически значимо превосходящую случайный набор (p = 0.03). Random Forest продемонстрировал более низкое качество (Balanced Accuracy = 0.3000). Count– based кодирование оказалось предпочтительнее one-hot для XGBoost. Выявлены два SNP (NW_024423709.1_30379, NW_024424664.1_28063), стабильно входящие в топ-5 важности LASSO и Random Forest. Область применения: Разработанный пайплайн может быть использован для анализа популяционной структуры других видов на основе исторической ДНК с высокой долей пропусков. Полученные результаты могут быть учтены при актуализации стратегий сохранения белого медведя в условиях изменения климата. Выводы: Линейная модель (LASSO) и градиентный бустинг (XGBoost) показали сопоставимую эффективность на слабо дифференцированных данных. XGBoost продемонстрировал способность выделять компактную панель информативных SNP. Общая слабая генетическая диффе ренциация (средний FST < 0.04) и низкая объяснённая дисперсия PCA (первые 5 компонент объясняют 7.18%) указывают на высокую мобильность особей и активный поток генов между популяциями Российской Арктики.
This work is devoted to the development and comparison of methods for analyzing whole-genome SNP data with a high proportion of missing values for solving problems of population genetics of the polar bear (Ursus maritimus) in the Russian Arctic using machine learning algorithms. Subject of research: genetic differentiation of polar bear populations based on the analysis of SNP markers from historical samples (museum collections, collection period 1883–2000). Objective: development and comparison of methods for processing and analyzing highly sparse whole-genome SNP data for identifying informative biomarkers that differentiate populations and assessing the accuracy of classification of geographical origin of samples. Methodology: A data preprocessing pipeline was implemented, including filtering by missing rate and minor allele frequency (MAF), SNP selection by maximum pairwise FST (Hudson’s method), stratified train/test split. Two genotype encoding methods (one-hot and count-based) were compared. Three supervised classification algorithms were applied: LASSO (L1-regularized logistic regression), Random Forest, and XGBoost. Hyperparameter tuning was performed for each method (cross-validation, Bayesian optimization). Model quality was assessed using Balanced Accuracy and F1-macro. Feature importance analysis allowed ranking SNPs by their contribution to classification and forming panels of candidate biomarkers. Results: SNP selection by maximum pairwise FST allowed identifying markers differentiating the eastern group (East). LASSO and XGBoost showed comparable performance (Balanced Accuracy = 0.3143), while XGBoost was the only method that identified a panel of 20 SNPs significantly outperforming a random set (p = 0.03). Random Forest showed lower quality (Balanced Accuracy = 0.3000). Count-based encoding proved preferable to one-hot for XGBoost. Two SNPs (NW_024423709.1_30379, NW_024424664.1_28063) were consistently ranked in the top 5 of LASSO and Random Forest importance. Application area: The developed pipeline can be used to analyze the population structure of other species based on historical DNA with a high proportion of missing data. The obtained results can be taken into account when updating polar bear conservation strategies under climate change. Conclusions: Linear model (LASSO) and gradient boosting (XGBoost) showed comparable performance on weakly differentiated data. XGBoost demonstrated the ability to identify a compact panel of informative SNPs. The overall weak genetic differentiation (mean FST < 0.04) and low explained variance of PCA (first 5 components explain 7.18%) indicate high individual mobility and active gene flow between populations of the Russian Arctic.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|
- Разработка и сравнение методов обработки и анализа геномных данных с высокой разреженностью для задач популяционной генетики
- Введение
- 1. Постановка задачи и предварительный анализ данных
- 2. Анализ генетической дифференциации и снижение размерности данных
- 3. Анализ нагрузок главных компонент и выявление информативных SNP
- 4. Методы обработки и кодирования SNP-данных
- Заключение
- Список использованных источников