Details

Title Сентимент-анализ корпуса песен современных англоязычных исполнителей: выпускная квалификационная работа бакалавра: направление 45.03.04 «Интеллектуальные системы в гуманитарной сфере» ; образовательная программа 45.03.04_01 «Цифровые технологии и иностранные языки» = Sentiment Analysis of a Corpus of Contemporary English-Speaking Artists Songs
Creators Орлова Мария Михайловна
Scientific adviser Агафонова Марина Павловна
Organization Санкт-Петербургский политехнический университет Петра Великого. Гуманитарный институт
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects сентимент-анализ ; анализ тональности ; машинное обучение ; глубокое обучение ; трансформеры ; BERT ; песенные тексты ; мультилейбл-классификация ; sentiment analysis ; opinion mining ; machine learning ; deep learning ; transformers ; song lyrics ; multi-label classification
Document type Bachelor graduation qualification work
Language Russian
Level of education Bachelor
Speciality code (FGOS) 45.03.04
Speciality group (FGOS) 450000 - Языкознание и литературоведение
DOI 10.18720/SPBPU/3/2026/vr/vr26-3067
Rights Доступ по паролю из сети Интернет (чтение, печать, копирование)
Additionally New arrival
Record key ru\spstu\vkr\41916
Record create date 8/12/2026

Allowed Actions

Action 'Read' will be available if administrator prepare required files

Action 'Download' will be available if you login or access site from another network

Group Anonymous
Network Internet

Объектом исследования является корпус песенных текстов 20 современных англоязычных исполнителей, представленных в мировых чартах (Spotify, Billboard) за период 2000-2023 гг., общим объемом более 5 300 текстов. Предметом исследования являются методы автоматического сентимент-анализа, включая традиционное машинное обучение и современные трансформерные архитектуры и их эффективность в задаче мультилейбловой классификации текстов по девяти категориям шкалы тональности GEMS. Цель исследования представляет собой проведение сравнительного анализа различных подходов к сентимент-анализу песенных текстов и на его основе доработка модели, способной производить мультилейбловую тональную классификацию поэтических текстов с учетом их специфики, а также проведение собственно сентимент-анализа при помощи данной модели. На основе данной цели можно выделить следующие задачи исследования: рассмотреть теоретические основы тональности и сентимент-анализа; собрать и подготовить корпус песенных текстов современных англоязычных исполнителей; выбрать несколько способов и инструментов проведения сентимент-анализа указанного материала; провести оценку качества разных инструментов сентимент-анализа; дообучить трансформерную модель на материале песенных текстов; произвести финальный сентимент-анализ собранного корпуса; сделать выводы о преобладающей тональности корпуса, разнице тональностей у разных исполнителей в разные временные периоды. Для решения поставленных задач использовались следующие методы: общенаучные методы (описание, обобщение, систематизация, наблюдение, классификация и анализ полученных данных); экспериментально-теоретические методы (тестирование, наблюдение, вычислительный эксперимент); статистический метод; методы машинного обучения (логистическая регрессия, метод опорных векторов, случайный лес, градиентный бустинг); методы глубокого обучения (трансформерная архитектура DeBERTa-v3-base). В ходе работы был сформирован корпус из 5 381 текста современных англоязычных исполнителей, охватывающий 20 артистов жанров поп, рэп, рок и др. В условиях практически полного отсутствия открытых размеченных корпусов для анализа эмоций в песенных текстах была разработана многоэтапная стратегия разметки, сочетающая ручную аннотацию (467 текстов), заимствование внешнего корпуса (1 160 текстов, размеченных по шкале GEMS) и псевдоразметку (3 800 текстов) с помощью модели логистической регрессии. Дообученная на указанном материале модель DeBERTa-v3-base достигла F1-macro = 0.7849 и F1-micro = 0.8057 на валидационной выборке, что сопоставимо с результатами современных исследований и подтверждает эффективность трансформерных архитектур для анализа поэтических текстов. Проведен финальный сентимент-анализ всего корпуса, выявивший доминирование эмоций радости (78.4%) и любви (75.8%), а также статистически значимые различия в эмоциональных профилях исполнителей в зависимости от пола и временного периода. Полученные результаты могут быть использованы для персонализации музыкальных рекомендательных систем, анализа общественных настроений и оптимизации музыкального продюсирования.

The object of the study is a corpus of song lyrics by 20 contemporary English-speaking artists featured in global charts (Spotify, Billboard) from 2000 to 2023, totaling over 5 300 texts. The subject of the study is automatic sentiment analysis methods, including traditional machine learning and modern transformer architectures, and their efficiency in performing multi-label classification of emotional tone across nine categories of the GEMS scale. The aim of the study is to conduct a comparative analysis of different approaches to sentiment analysis of song lyrics and, based on this analysis, to develop a model capable of performing multi-label classification of the emotional tone of poetic texts, considering their specific characteristics, as well as to carry out sentiment analysis using this model. Based on this aim, the following research objectives were identified: to examine the theoretical foundations of tonality and sentiment analysis; to compile a corpus of song lyrics by contemporary English-speaking artists; to select several methods of sentiment analysis and tools applicable to the specified material; to evaluate the quality of different sentiment analysis tools; to fine-tune a transformer model on the song lyrics dataset; to perform final sentiment analysis of the compiled corpus; to draw conclusions regarding the predominant tonality of the corpus, differences in tonality across artists and different time periods. The following methods were used to solve the stated tasks: general scientific methods (description, generalization, systematization, observation, classification, and analysis of collected data); experimental and theoretical methods (testing, observation, computational experiment); statistical methods; machine learning methods (logistic regression, support vector machines, random forest, gradient boosting); deep learning methods (DeBERTa-v3-base transformer architecture). A corpus of 5,381 song lyrics was compiled, covering 20 artists from various genres. Given the almost complete absence of publicly available annotated corpora for emotion analysis in song lyrics, a multi-stage annotation strategy was developed, combining manual annotation (467 texts), the integration of an external corpus (1,160 texts annotated according to the GEMS scale), and pseudo-labeling (3,800 texts) using a logistic regression model. The DeBERTa-v3-base model fine-tuned on this corpus achieved an F1-macro of 0.7849 and an F1-micro of 0.8057 on the validation set, which is comparable to the results of current research and confirms the effectiveness of transformer architectures for analyzing poetic texts. A final sentiment analysis of the entire corpus was conducted, revealing a predominance of Joyful activation (78.4%) and Tenderness (75.8%), as well as statistically significant differences in the emotional profiles of artists depending on genre, gender, and time period. The obtained results can be used for personalizing music recommendation systems, analyzing public sentiment, and optimizing music production.

Network User group Action
ILC SPbPU Local Network All
Download
Internet Authorized users SPbPU
Download
Internet Anonymous
...