Детальная информация
| Название | Оптимизация методов атрибуции авторства при распознавании сгенерированных текстов ИИ (на материале сочинений): выпускная квалификационная работа магистра: направление 45.04.04 «Интеллектуальные системы в гуманитарной среде» ; образовательная программа 45.04.04_02 «Цифровая лингвистика» = Optimization of authorship attribution methods for recognition of AI-generated texts (based on essay material) |
|---|---|
| Авторы | Сибагатова Алина Альбертовна |
| Научный руководитель | Дмитриев Александр Владиславович |
| Организация | Санкт-Петербургский политехнический университет Петра Великого. Гуманитарный институт |
| Выходные сведения | Санкт-Петербург, 2026 |
| Коллекция | Выпускные квалификационные работы ; Общая коллекция |
| Тематика | атрибуция авторства ; стилеметрия ; машинное обучение ; сгенерированные тексты ; промпт-инжиниринг ; искусственный интеллект ; логистическая регрессия ; метод опорных векторов ; случайный лес ; authorship attribution ; stylometry ; machine learning ; generated texts ; prompt engineering ; artificial intelligence ; logistic regression ; support vector machine ; random forest |
| Тип документа | Выпускная квалификационная работа магистра |
| Язык | Русский |
| Уровень высшего образования | Магистратура |
| Код специальности ФГОС | 45.04.04 |
| Группа специальностей ФГОС | 450000 - Языкознание и литературоведение |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-5348 |
| Права доступа | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Дополнительно | Новинка |
| Ключ записи | ru\spstu\vkr\45727 |
| Дата создания записи | 10.09.2026 |
Разрешенные действия
–
Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети
| Группа | Анонимные пользователи |
|---|---|
| Сеть | Интернет |
В данной работе рассматривается проблема атрибуции авторства в условиях распространения больших языковых моделей, генерирующих тексты, которые стилистически и структурно похожи на человеческие. Чтобы повысить эффективность их выявления, в исследовании использовалось машинное обучение с применением стилеметрических признаков текстов. Одним из наиболее эффективных методов по результатам работы является метод опорных векторов с нелинейным ядром. Благодаря формированию корпуса текстов и машинному обучению удалось выявить некоторые наиболее информативные лингвостатистические признаки при дифференциации человеческих и сгенерированных текстов. К ним относятся лексическое разнообразие, доля сочинительных союзов, местоимений, глаголов и служебных слов. Было выяснено, что внедрение гибридного подхода, сочетающего классические стилеметрические признаки с методами машинного обучения, может быть эффективным способом для проверки письменных работ в образовательной практике.
This work examines the problem of authorship attribution in the context of the proliferation of large language models generating texts that are stylistically and structurally similar to human-written ones. To improve the effectiveness of their detection, this work used machine learning based on stylometric features of texts. One of the most effective methods is the support vector machine with a nonlinear kernel. Through the compilation of a text corpus and machine learning, it was found certain linguostatistical features are the most informative for differentiating human-written and generated texts. These include lexical diversity, the proportion of coordinating conjunctions, pronouns, verbs and function words. It was found that the introduction of a hybrid approach combining classical stylometric features with machine learning methods can be an effective way to check written works in educational practice.
| Место доступа | Группа пользователей | Действие |
|---|---|---|
| Локальная сеть ИБК СПбПУ | Все |
|
| Интернет | Авторизованные пользователи СПбПУ |
|
| Интернет | Анонимные пользователи |
|
- ВВЕДЕНИЕ
- ГЛАВА 1. МЕТОДОЛОГИЯ АТРИБУЦИИ АВТОРСТВА И ОБНАРУЖЕНИЯ СГЕНЕРИРОВАННЫХ ТЕКСТОВ
- 1.1 Теоретические основы атрибуции авторства текстов
- 1.1.1 Проблема определения авторства и ее развитие
- 1.1.2 Классические стилеметрические и лингвостатистические методы атрибуции
- 1.1.3 Современные подходы на основе машинного и глубокого обучения (автоматическая атрибуция авторства)
- 1.1.4 Основные метрики оценки качества моделей
- 1.1.5 Кросс-валидация
- 1.2 Системы и методы обнаружения текстовых заимствований
- 1.2.1 Академическая честность и роль систем антиплагиата
- 1.2.2 Виды плагиата и методы его обнаружения
- 1.2.3 Ограничения антиплагиатных систем для детекции сгенерированных текстов
- 1.3 Нормативно-правовые основы использования искусственного интеллекта в образовании
- 1.4 Генеративные языковые модели и промптинг
- 1.4.1 История развития больших языковых моделей
- 1.4.2 Классификация методов промптинга в генеративных ИИ
- 1.4.3 Влияние промптинга на стилистику, структуру и семантику выходного текста
- 1.1 Теоретические основы атрибуции авторства текстов
- ВЫВОДЫ ПО ГЛАВЕ 1
- ГЛАВА 2. ОПТИМИЗАЦИЯ МЕТОДОВ АТРИБУЦИИ АВТОРСТВА
- 2.1 Организация исследования и формирование корпуса текстов
- 2.2 Извлечение и анализ стилеметрических признаков
- 2.3 Построение моделей классификации
- 2.4 Интерпретация результатов моделей
- 2.5 Анализ n-gram
- 2.6 Практические рекомендации по выявлению сгенерированных текстов
- 2.7 Ограничения исследования
- ВЫВОДЫ ПО ГЛАВЕ 2
- ЗАКЛЮЧЕНИЕ
- СПИСОК ИСПОЛЬЗОВАННЫХ ИСТОЧНИКОВ
- ПРИЛОЖЕНИЯ
- ПРИЛОЖЕНИЕ А
- ПРИЛОЖЕНИЕ Б