Details

Title Разработка и сравнение методов обработки и анализа геномных данных с высокой разреженностью для задач популяционной генетики: выпускная квалификационная работа бакалавра: направление 01.03.02 «Прикладная математика и информатика» ; образовательная программа 01.03.02_04 «Биоинформатика» = Development and comparison of methods for processing and analyzing sparse data for population genetics tasks
Creators Тыщенко Анастасия Дмитриевна
Scientific adviser Самсонова Мария Георгиевна
Other creators Самсонова А. А.
Organization Санкт-Петербургский политехнический университет Петра Великого. Физико-механический институт
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects белый медведь ; SNP ; машинное обучение ; классификация популяций ; FST ; LASSO ; Random Forest ; XGBoost ; разреженные данные ; биомар­керы ; polar bear ; machine learning ; population classification ; sparse data ; biomarkers
Document type Bachelor graduation qualification work
Language Russian
Level of education Bachelor
Speciality code (FGOS) 01.03.02
Speciality group (FGOS) 010000 - Математика и механика
DOI 10.18720/SPBPU/3/2026/vr/vr26-2122
Rights Доступ по паролю из сети Интернет (чтение, печать, копирование)
Additionally New arrival
Record key ru\spstu\vkr\41519
Record create date 7/31/2026

Allowed Actions

Action 'Read' will be available if you login or access site from another network

Action 'Download' will be available if you login or access site from another network

Group Anonymous
Network Internet

Данная работа посвящена разработке и сравнению методов анализа полноге­ номных SNP-данных с высокой долей пропусков для решения задач популяционной генетики белого медведя (Ursus maritimus) Российской Арктики с привлечением алгоритмов машинного обучения. Предмет исследования: генетическая диффе­ ренциация популяций белого медведя на основе анализа SNP-маркеров из истори­ ческих образцов (музейные коллекции, период сбора 1883–2000 гг.). Цель работы: разработка и сравнение методов обработки и анализа полногеномных SNP-данных с высокой разреженностью для идентификации информативных биомаркеров, разделяющих популяции, и оценки точности классификации географической при­ надлежности образцов. Методология: Реализован пайплайн предобработки данных, включающий фильтрацию по пропускам и частоте минорного аллеля (MAF), отбор SNP по максимальному попарному FST (метод Хадсона), стратифицированное разделение выборки на обучающую и тестовую. Выполнено сравнение двух методов кодирования генотипов (one-hot и count-based). Применены три алгоритма клас­ сификации с учителем: LASSO (L1-регуляризованная логистическая регрессия), Random Forest и XGBoost. Для каждого метода проведён подбор гиперпараметров (кросс-валидация, байесовская оптимизация). Качество моделей оценивалось по метрикам Balanced Accuracy и F1-macro. Анализ важности признаков позволил ран­ жировать SNP по их вкладу в классификацию и сформировать панели кандидатных биомаркеров. Результаты: Показано, что отбор SNP по максимальному попарному FST позволяет выделить маркеры, дифференцирующие восточную группиров­ ку (East). LASSO и XGBoost показали сопоставимую эффективность (Balanced Accuracy = 0.3143), при этом XGBoost единственный выделил панель из 20 SNP, статистически значимо превосходящую случайный набор (p = 0.03). Random Forest продемонстрировал более низкое качество (Balanced Accuracy = 0.3000). Count– based кодирование оказалось предпочтительнее one-hot для XGBoost. Выявлены два SNP (NW_024423709.1_30379, NW_024424664.1_28063), стабильно входящие в топ-5 важности LASSO и Random Forest. Область применения: Разработанный пайплайн может быть использован для анализа популяционной структуры других видов на основе исторической ДНК с высокой долей пропусков. Полученные результаты могут быть учтены при актуализации стратегий сохранения белого медведя в условиях изменения климата. Выводы: Линейная модель (LASSO) и градиентный бустинг (XGBoost) показали сопоставимую эффективность на слабо дифференцированных данных. XGBoost продемонстрировал способность выделять компактную панель информативных SNP. Общая слабая генетическая диффе­ ренциация (средний FST < 0.04) и низкая объяснённая дисперсия PCA (первые 5 компонент объясняют 7.18%) указывают на высокую мобильность особей и активный поток генов между популяциями Российской Арктики.

This work is devoted to the development and comparison of methods for analyzing whole-genome SNP data with a high proportion of missing values for solving problems of population genetics of the polar bear (Ursus maritimus) in the Russian Arctic using machine learning algorithms. Subject of research: genetic differentiation of polar bear populations based on the analysis of SNP markers from historical samples (museum collections, collection period 1883–2000). Objective: development and comparison of methods for processing and analyzing highly sparse whole-genome SNP data for identifying informative biomarkers that differentiate populations and assessing the accuracy of classification of geographical origin of samples. Methodology: A data preprocessing pipeline was implemented, including filtering by missing rate and minor allele frequency (MAF), SNP selection by maximum pairwise FST (Hudson’s method), stratified train/test split. Two genotype encoding methods (one-hot and count-based) were compared. Three supervised classification algorithms were applied: LASSO (L1-regularized logistic regression), Random Forest, and XGBoost. Hyperparameter tuning was performed for each method (cross-validation, Bayesian optimization). Model quality was assessed using Balanced Accuracy and F1-macro. Feature importance analysis allowed ranking SNPs by their contribution to classification and forming panels of candidate biomarkers. Results: SNP selection by maximum pairwise FST allowed identifying markers differentiating the eastern group (East). LASSO and XGBoost showed comparable performance (Balanced Accuracy = 0.3143), while XGBoost was the only method that identified a panel of 20 SNPs significantly outperforming a random set (p = 0.03). Random Forest showed lower quality (Balanced Accuracy = 0.3000). Count-based encoding proved preferable to one-hot for XGBoost. Two SNPs (NW_024423709.1_30379, NW_024424664.1_28063) were consistently ranked in the top 5 of LASSO and Random Forest importance. Application area: The developed pipeline can be used to analyze the population structure of other species based on historical DNA with a high proportion of missing data. The obtained results can be taken into account when updating polar bear conservation strategies under climate change. Conclusions: Linear model (LASSO) and gradient boosting (XGBoost) showed comparable performance on weakly differentiated data. XGBoost demonstrated the ability to identify a compact panel of informative SNPs. The overall weak genetic differentiation (mean FST < 0.04) and low explained variance of PCA (first 5 components explain 7.18%) indicate high individual mobility and active gene flow between populations of the Russian Arctic.

Network User group Action
ILC SPbPU Local Network All
Read Print Download
Internet Authorized users SPbPU
Read Print Download
Internet Anonymous
  • Разработка и сравнение методов обработки и анализа геномных данных с высокой разреженностью для задач популяционной генетики
    • Введение
    • 1. Постановка задачи и предварительный анализ данных
    • 2. Анализ генетической дифференциации и снижение размерности данных
    • 3. Анализ нагрузок главных компонент и выявление информативных SNP
    • 4. Методы обработки и кодирования SNP-данных
    • Заключение
    • Список использованных источников
...