Details
| Title | Программный инструмент для технического и UX аудита веб-сайтов с помощью методов машинного обучения: выпускная квалификационная работа магистра: направление 09.04.04 «Программная инженерия» ; образовательная программа 09.04.04_02 «Основы анализа и разработки приложений с большими объемами распределенных данных» = A software tool for technical and UX auditing of websites using machine learning methods |
|---|---|
| Creators | Чумакова Ольга Романовна |
| Scientific adviser | Ковалев Артем Дмитриевич |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Институт компьютерных наук и кибербезопасности |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | технический аудит ; UX-аудит ; веб-сайт ; машинное обучение ; кластеризация ; kmeans ; technical audit ; UX audit ; website ; machine learning ; clustering |
| Document type | Master graduation qualification work |
| Language | Russian |
| Level of education | Master |
| Speciality code (FGOS) | 09.04.04 |
| Speciality group (FGOS) | 090000 - Информатика и вычислительная техника |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-4912 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\45085 |
| Record create date | 9/4/2026 |
Allowed Actions
–
Action 'Read' will be available if you login or access site from another network
Action 'Download' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
Выпускная квалификационная работа магистра посвящена разработке программного инструмента для комплексного технического и UX-аудита веб сайтов с применением методов машинного обучения. Проведён анализ существующих решений в области автоматизированного аудита, выявлены их ключевые ограничения: фрагментарность анализа, шаблонность рекомендаций, технологическая зависимость и высокая стоимость. В рамках работы предложен метод комплексного аудита, основанный на трёх ключевых принципах: двухэтапный сбор данных, многоуровневый анализ на основе детерминированных правил и применение методов машинного обучения, а также генерация приоритизированного отчёта с конкретными рекомендациями. Разработана модульная конвейерная архитектура программного комплекса, обеспечивающая слабую связанность компонентов и возможность независимого тестирования. Предложенный метод реализован в программном средстве на языке Python с использованием библиотек Requests, BeautifulSoup для сбора данных, Selenium WebDriver для извлечения вычисленных стилей, а также Scikit-learn, Pandas и Matplotlib для реализации алгоритма кластеризации KMeans. Описана обработка данных Google Analytics для использования алгоритмами машинного обучения. Разработана структура хранения результатов, обеспечивающая изоляцию данных разных сеансов аудита и возможность интеграции в CI/CDконвейеры. При проектировании использовался конвейерный подход, позволяющий последовательно выполнять модули проверки ссылок, сбора стилей, UX-анализа, кластеризации пользователей и генерации отчёта. В экспериментальной части проведён анализ трёх разнотипных веб сайтов с последующей ручной верификацией выявленных проблем. Выполнена оценка качества разработанного инструмента по метрикам Precision, Recall и F1-score, а также сравнение с существующим инструментом Lighthouse. Дополнительно проведена кластеризация пользователей на основе открытого датасета Google Analytics с расчётом силуэтного коэффициента. Приводятся расчёты метрик точности для детерминированных проверок и оценки качества кластеризации.
The masters thesis is devoted to the development of a software tool for comprehensive technical and UX audit of websites using machine learning methods. An analysis of existing solutions in the field of automated audit was carried out, and their key limitations were identified: fragmentation of analysis, template-based recommendations, technological dependence, and high cost. The study proposes a comprehensive audit method based on three key principles: two-stage data collection, multi-level analysis based on deterministic rules combined with machine learning methods, and generation of a prioritized report with specific recommendations. A modular pipeline architecture of the software system was developed, ensuring low coupling of components and the possibility of independent testing. The proposed method is implemented in a software tool written in Python using the Requests and BeautifulSoup libraries for data collection, Selenium WebDriver for extracting computed styles, as well as Scikit-learn, Pandas, and Matplotlib for implementing the KMeans clustering algorithm. The processing of Google Analytics data for use by machine learning algorithms is described. A result storage structure was developed that ensures isolation of data from different audit sessions and the possibility of integration into CI/CD pipelines. The design employs a pipeline approach that allows sequential execution of modules for link checking, style collection, UX analysis, user clustering, and report generation. The experimental part includes the analysis of three diverse websites followed by manual verification of the identified issues. The quality of the developed tool was evaluated using Precision, Recall, and F1-score metrics, along with a comparison with the existing Lighthouse tool. Additionally, user clustering was performed based on an open Google Analytics dataset with calculation of the silhouette coefficient. Calculations of accuracy metrics for deterministic checks and clustering quality assessment are presented.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|