Details
| Title | Оптимизация методов атрибуции авторства при распознавании сгенерированных текстов ИИ (на материале сочинений): выпускная квалификационная работа магистра: направление 45.04.04 «Интеллектуальные системы в гуманитарной среде» ; образовательная программа 45.04.04_02 «Цифровая лингвистика» = Optimization of authorship attribution methods for recognition of AI-generated texts (based on essay material) |
|---|---|
| Creators | Сибагатова Алина Альбертовна |
| Scientific adviser | Дмитриев Александр Владиславович |
| Organization | Санкт-Петербургский политехнический университет Петра Великого. Гуманитарный институт |
| Imprint | Санкт-Петербург, 2026 |
| Collection | Выпускные квалификационные работы ; Общая коллекция |
| Subjects | атрибуция авторства ; стилеметрия ; машинное обучение ; сгенерированные тексты ; промпт-инжиниринг ; искусственный интеллект ; логистическая регрессия ; метод опорных векторов ; случайный лес ; authorship attribution ; stylometry ; machine learning ; generated texts ; prompt engineering ; artificial intelligence ; logistic regression ; support vector machine ; random forest |
| Document type | Master graduation qualification work |
| Language | Russian |
| Level of education | Master |
| Speciality code (FGOS) | 45.04.04 |
| Speciality group (FGOS) | 450000 - Языкознание и литературоведение |
| DOI | 10.18720/SPBPU/3/2026/vr/vr26-5348 |
| Rights | Доступ по паролю из сети Интернет (чтение, печать, копирование) |
| Additionally | New arrival |
| Record key | ru\spstu\vkr\45727 |
| Record create date | 9/10/2026 |
Allowed Actions
–
Action 'Read' will be available if you login or access site from another network
Action 'Download' will be available if you login or access site from another network
| Group | Anonymous |
|---|---|
| Network | Internet |
В данной работе рассматривается проблема атрибуции авторства в условиях распространения больших языковых моделей, генерирующих тексты, которые стилистически и структурно похожи на человеческие. Чтобы повысить эффективность их выявления, в исследовании использовалось машинное обучение с применением стилеметрических признаков текстов. Одним из наиболее эффективных методов по результатам работы является метод опорных векторов с нелинейным ядром. Благодаря формированию корпуса текстов и машинному обучению удалось выявить некоторые наиболее информативные лингвостатистические признаки при дифференциации человеческих и сгенерированных текстов. К ним относятся лексическое разнообразие, доля сочинительных союзов, местоимений, глаголов и служебных слов. Было выяснено, что внедрение гибридного подхода, сочетающего классические стилеметрические признаки с методами машинного обучения, может быть эффективным способом для проверки письменных работ в образовательной практике.
This work examines the problem of authorship attribution in the context of the proliferation of large language models generating texts that are stylistically and structurally similar to human-written ones. To improve the effectiveness of their detection, this work used machine learning based on stylometric features of texts. One of the most effective methods is the support vector machine with a nonlinear kernel. Through the compilation of a text corpus and machine learning, it was found certain linguostatistical features are the most informative for differentiating human-written and generated texts. These include lexical diversity, the proportion of coordinating conjunctions, pronouns, verbs and function words. It was found that the introduction of a hybrid approach combining classical stylometric features with machine learning methods can be an effective way to check written works in educational practice.
| Network | User group | Action |
|---|---|---|
| ILC SPbPU Local Network | All |
|
| Internet | Authorized users SPbPU |
|
| Internet | Anonymous |
|
- ВВЕДЕНИЕ
- ГЛАВА 1. МЕТОДОЛОГИЯ АТРИБУЦИИ АВТОРСТВА И ОБНАРУЖЕНИЯ СГЕНЕРИРОВАННЫХ ТЕКСТОВ
- 1.1 Теоретические основы атрибуции авторства текстов
- 1.1.1 Проблема определения авторства и ее развитие
- 1.1.2 Классические стилеметрические и лингвостатистические методы атрибуции
- 1.1.3 Современные подходы на основе машинного и глубокого обучения (автоматическая атрибуция авторства)
- 1.1.4 Основные метрики оценки качества моделей
- 1.1.5 Кросс-валидация
- 1.2 Системы и методы обнаружения текстовых заимствований
- 1.2.1 Академическая честность и роль систем антиплагиата
- 1.2.2 Виды плагиата и методы его обнаружения
- 1.2.3 Ограничения антиплагиатных систем для детекции сгенерированных текстов
- 1.3 Нормативно-правовые основы использования искусственного интеллекта в образовании
- 1.4 Генеративные языковые модели и промптинг
- 1.4.1 История развития больших языковых моделей
- 1.4.2 Классификация методов промптинга в генеративных ИИ
- 1.4.3 Влияние промптинга на стилистику, структуру и семантику выходного текста
- 1.1 Теоретические основы атрибуции авторства текстов
- ВЫВОДЫ ПО ГЛАВЕ 1
- ГЛАВА 2. ОПТИМИЗАЦИЯ МЕТОДОВ АТРИБУЦИИ АВТОРСТВА
- 2.1 Организация исследования и формирование корпуса текстов
- 2.2 Извлечение и анализ стилеметрических признаков
- 2.3 Построение моделей классификации
- 2.4 Интерпретация результатов моделей
- 2.5 Анализ n-gram
- 2.6 Практические рекомендации по выявлению сгенерированных текстов
- 2.7 Ограничения исследования
- ВЫВОДЫ ПО ГЛАВЕ 2
- ЗАКЛЮЧЕНИЕ
- СПИСОК ИСПОЛЬЗОВАННЫХ ИСТОЧНИКОВ
- ПРИЛОЖЕНИЯ
- ПРИЛОЖЕНИЕ А
- ПРИЛОЖЕНИЕ Б