Details

Title Тематическое моделирование корпуса текстов сюжетов видеоигр на основе их описаний в онлайн агрегаторе: выпускная квалификационная работа бакалавра: направление 45.03.04 «Интеллектуальные системы в гуманитарной сфере» ; образовательная программа 45.03.04_01 «Цифровые технологии и иностранные языки» = Topic Modeling of a Video Game Plot Corpus Based on Their Descriptions in an Online Aggregator
Creators Зайцева Анна Николаевна
Scientific adviser Агафонова Марина Павловна
Organization Санкт-Петербургский политехнический университет Петра Великого. Гуманитарный институт
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects тематическое моделирование ; автоматическая обработка текста ; компьютерная лингвистика ; NLP ; веб-скрейпинг ; описания видеоигр ; нарративный дизайн ; образовательные игры ; topic modeling ; automatic text processing ; computational linguistics ; web scraping ; video game descriptions ; narrative design ; educational games
Document type Bachelor graduation qualification work
Language Russian
Level of education Bachelor
Speciality code (FGOS) 45.03.04
Speciality group (FGOS) 450000 - Языкознание и литературоведение
DOI 10.18720/SPBPU/3/2026/vr/vr26-3071
Rights Доступ по паролю из сети Интернет (чтение)
Additionally New arrival
Record key ru\spstu\vkr\41920
Record create date 8/12/2026

Allowed Actions

Action 'Read' will be available if administrator prepare required files

Group Anonymous
Network Internet

Работа посвящена выявлению и интерпретации латентных тематических структур корпуса текстовых описаний видеоигр, собранных из агрегатора Steam, а также оценке их потенциала применения в нарративном дизайне обу-чающих игр. В ходе исследования решались задачи: 1) систематизация теоретико-методологических основ тематического моделирования; 2) автоматический сбор и фильтрация корпуса описаний видеоигр; 3) лингвистическая предобработка и векторизация текстов; 4) построение тематических моделей методами NMF, LDA и BERTopic; 5) сравнительная оценка моделей по комплексу метрик; 6) интерпретация тематических кластеров и их сопоставление с жанровой разметкой Steam; 7) определение направлений применения результатов в проектировании обучающих видеоигр. Корпус сформирован на основе глобального рейтинга продаж Steam и включает 1023 русскоязычных описания. Предобработка включала очистку от HTML-разметки, токенизацию, фильтрацию стоп-слов и лемматизацию. Срав-нительный анализ показал превосходство NMF по когерентности и разнообразию тем. Содержательная интерпретация позволила сгруппировать 35 топиков в девять концептуальных блоков, отражающих нарративно-атмосферную специфику (боевые и военные нарративы, симуляторы, выживание и хоррор, приключения, стратегии, космические нарративы и др.). Сопоставление с жанровой системой Steam подтвердило основную гипотезу: латентная структура корпуса не сводится к жанровой разметке и выявляет нарративные измерения, не фиксируемые формальными тегами. Результаты проецированы на задачи проектирования обучающих видеоигр в трёх режимах: прямое содержательное соответствие, нарративное обрамление и структурно-механическое заимствование. В процессе работы были использованы следующие информационные технологии, программное обеспечение, облачные сервисы и базы данных: язык программирования Python; облачная среда Google Colaboratory; библиотеки requests, BeautifulSoup, pandas, pymorphy3, NLTK, scikit-learn, gensim, BERTopic, sentence-transformers, UMAP, HDBSCAN, Matplotlib, pyLDAvis; публичные API платформы Steam (SteamSpy API, Steam Store API) для автоматического сбора данных методом веб-скрейпинга.

The study is devoted to identifying and interpreting latent topic structures within a corpus of video game text descriptions collected from the Steam aggregator, as well as assessing their potential application in the narrative design of educational games. The following tasks were addressed in the course of the research: 1) systema-tization of the theoretical and methodological foundations of topic modeling; 2) au-tomated collection and filtering of the video game description corpus; 3) linguistic preprocessing and text vectorization; 4) construction of topic models using NMF, LDA, and BERTopic methods; 5) comparative evaluation of models using a set of metrics; 6) interpretation of topic clusters and their comparison with Steams genre tagging system; 7) identification of potential applications of the results in the design of educational video games. The corpus was compiled based on the Steam global sales ranking and includes 1,023 Russian-language descriptions. Preprocessing involved HTML markup removal, tokenization, stopword filtering, and lemmatization. Comparative analysis demonstrated the superiority of NMF in terms of coherence and topic diversity. Substantive interpretation made it possible to group 35 topics into nine conceptual clusters reflecting narrative and atmospheric specifics (combat and military narratives, simulators, survival and horror, adventures, strategies, space narratives, etc.). Comparison with Steams genre system confirmed the main hypothesis: the latent structure of the corpus cannot be reduced to genre tagging and reveals narrative dimensions not captured by formal tags. The results were projected onto educational video game design tasks in three modes: direct content correspondence, narrative framing, and structural-mechanical borrowing. The following information technologies, software, cloud services, and databases were used in the course of the work: the Python programming language; the Google Colaboratory cloud environment; the libraries requests, BeautifulSoup, pandas, pymorphy3, NLTK, scikit-learn, gensim, BERTopic, sentence-transformers, UMAP, HDBSCAN, Matplotlib, and pyLDAvis; and the public APIs of the Steam platform (SteamSpy API, Steam Store API) for automated data collection via web scraping.

Network User group Action
ILC SPbPU Local Network All
Internet Authorized users SPbPU
Internet Anonymous
...