Details

Title Лингвистические маркеры тональности в англоязычных научно-популярных лекциях: выпускная квалификационная работа бакалавра: направление 45.03.04 «Интеллектуальные системы в гуманитарной сфере» ; образовательная программа 45.03.04_01 «Цифровые технологии и иностранные языки» = Linguistic Markers of Sentiment in English-Language Popular Science Lectures
Creators Чаптыкова Виктория Евгеньевна
Scientific adviser Евтушенко Татьяна Геннадьевна
Organization Санкт-Петербургский политехнический университет Петра Великого. Гуманитарный институт
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects анализ тональности ; лингвистические маркеры ; научно-популярный дискурс ; ted talks ; корпусная лингвистика ; автоматическая обработка текста ; sentiment analysis ; linguistic markers ; popular science discourse ; corpus linguistics ; natural language processing
Document type Bachelor graduation qualification work
Language Russian
Level of education Bachelor
Speciality code (FGOS) 45.03.04
Speciality group (FGOS) 450000 - Языкознание и литературоведение
DOI 10.18720/SPBPU/3/2026/vr/vr26-3066
Rights Доступ по паролю из сети Интернет (чтение)
Additionally New arrival
Record key ru\spstu\vkr\41915
Record create date 8/12/2026

Allowed Actions

Action 'Read' will be available if administrator prepare required files

Group Anonymous
Network Internet

Задачи исследования: изучить теоретические основы анализа тональности; описать жанровую специфику TED Talks; сформировать корпус и провести его предобработку; разработать классификацию маркеров и провести ручную разметку; применить автоматические методы (VADER, Sentence-BERT, DeBERTa в режиме zero-shot NLI); сопоставить результаты ручной и автоматической разметки; описать закономерности распределения маркеров в корпусе. Для решения поставленных задач использованы корпусно-лингвистический метод, дискурс-анализ, статистический анализ, методы автоматической обработки текста и машинного обучения. Материалом исследования послужил корпус из 10 англоязычных лекций TED общим объемом 14 291 токен. В результате исследования разработана авторская классификационная схема, включающая 21 категорию маркеров, объединенную в шесть функциональных групп. Выявлено 348 маркеров тональности. Наилучший результат среди автоматических методов показала логистическая регрессия на основе sentence embeddings (accuracy 68,4%, macro F1 64,7%). Установлены закономерности функциональной специализации маркеров по композиционным частям лекций и устойчивые риторические связки между классами.

The tasks of the research: to study the theoretical foundations of sentiment analysis; to describe the genre specificity of TED Talks; to compile a corpus and perform its preprocessing; to develop a classification of markers and conduct manual annotation; to apply automatic methods (VADER, Sentence-BERT, DeBERTa in zero-shot NLI mode); to compare manual and automatic annotation results; to describe patterns of marker distribution in the corpus. The research methodologies include corpus-linguistic method, discourse analysis, statistical analysis, natural language processing techniques, and machine learning. The material of the study is a corpus of 10 English-language TED lectures with a total volume of 14 291 tokens. As a result, an original classification scheme has been developed, comprising 21 categories of markers grouped into six functional clusters. Manual annotation of the corpus yielded 348 sentiment markers. The best result among automatic methods was achieved by logistic regression based on sentence embeddings (accuracy 68.4%, macro F1 64.7%). The analysis further revealed patterns of functional specialization across compositional parts of lectures, as well as stable rhetorical clusters between marker classes.

Network User group Action
ILC SPbPU Local Network All
Internet Authorized users SPbPU
Internet Anonymous
...