Details

Title Оптимизация методов атрибуции авторства при распознавании сгенерированных текстов ИИ (на материале сочинений): выпускная квалификационная работа магистра: направление 45.04.04 «Интеллектуальные системы в гуманитарной среде» ; образовательная программа 45.04.04_02 «Цифровая лингвистика» = Optimization of authorship attribution methods for recognition of AI-generated texts (based on essay material)
Creators Сибагатова Алина Альбертовна
Scientific adviser Дмитриев Александр Владиславович
Organization Санкт-Петербургский политехнический университет Петра Великого. Гуманитарный институт
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects атрибуция авторства ; стилеметрия ; машинное обучение ; сгенерированные тексты ; промпт-инжиниринг ; искусственный интеллект ; логистическая регрессия ; метод опорных векторов ; случайный лес ; authorship attribution ; stylometry ; machine learning ; generated texts ; prompt engineering ; artificial intelligence ; logistic regression ; support vector machine ; random forest
Document type Master graduation qualification work
Language Russian
Level of education Master
Speciality code (FGOS) 45.04.04
Speciality group (FGOS) 450000 - Языкознание и литературоведение
DOI 10.18720/SPBPU/3/2026/vr/vr26-5348
Rights Доступ по паролю из сети Интернет (чтение, печать, копирование)
Additionally New arrival
Record key ru\spstu\vkr\45727
Record create date 9/10/2026

Allowed Actions

Action 'Read' will be available if you login or access site from another network

Action 'Download' will be available if you login or access site from another network

Group Anonymous
Network Internet

В данной работе рассматривается проблема атрибуции авторства в условиях распространения больших языковых моделей, генерирующих тексты, которые стилистически и структурно похожи на человеческие. Чтобы повысить эффективность их выявления, в исследовании использовалось машинное обучение с применением стилеметрических признаков текстов. Одним из наиболее эффективных методов по результатам работы является метод опорных векторов с нелинейным ядром. Благодаря формированию корпуса текстов и машинному обучению удалось выявить некоторые наиболее информативные лингвостатистические признаки при дифференциации человеческих и сгенерированных текстов. К ним относятся лексическое разнообразие, доля сочинительных союзов, местоимений, глаголов и служебных слов. Было выяснено, что внедрение гибридного подхода, сочетающего классические стилеметрические признаки с методами машинного обучения, может быть эффективным способом для проверки письменных работ в образовательной практике.

This work examines the problem of authorship attribution in the context of the proliferation of large language models generating texts that are stylistically and structurally similar to human-written ones. To improve the effectiveness of their detection, this work used machine learning based on stylometric features of texts. One of the most effective methods is the support vector machine with a nonlinear kernel. Through the compilation of a text corpus and machine learning, it was found certain linguostatistical features are the most informative for differentiating human-written and generated texts. These include lexical diversity, the proportion of coordinating conjunctions, pronouns, verbs and function words. It was found that the introduction of a hybrid approach combining classical stylometric features with machine learning methods can be an effective way to check written works in educational practice.

Network User group Action
ILC SPbPU Local Network All
Read Print Download
Internet Authorized users SPbPU
Read Print Download
Internet Anonymous
  • ВВЕДЕНИЕ
  • ГЛАВА 1. МЕТОДОЛОГИЯ АТРИБУЦИИ АВТОРСТВА И ОБНАРУЖЕНИЯ СГЕНЕРИРОВАННЫХ ТЕКСТОВ
    • 1.1 Теоретические основы атрибуции авторства текстов
      • 1.1.1 Проблема определения авторства и ее развитие
      • 1.1.2 Классические стилеметрические и лингвостатистические методы атрибуции
      • 1.1.3 Современные подходы на основе машинного и глубокого обучения (автоматическая атрибуция авторства)
      • 1.1.4 Основные метрики оценки качества моделей
      • 1.1.5 Кросс-валидация
    • 1.2 Системы и методы обнаружения текстовых заимствований
      • 1.2.1 Академическая честность и роль систем антиплагиата
      • 1.2.2 Виды плагиата и методы его обнаружения
      • 1.2.3 Ограничения антиплагиатных систем для детекции сгенерированных текстов
    • 1.3 Нормативно-правовые основы использования искусственного интеллекта в образовании
    • 1.4 Генеративные языковые модели и промптинг
      • 1.4.1 История развития больших языковых моделей
      • 1.4.2 Классификация методов промптинга в генеративных ИИ
      • 1.4.3 Влияние промптинга на стилистику, структуру и семантику выходного текста
  • ВЫВОДЫ ПО ГЛАВЕ 1
  • ГЛАВА 2. ОПТИМИЗАЦИЯ МЕТОДОВ АТРИБУЦИИ АВТОРСТВА
    • 2.1 Организация исследования и формирование корпуса текстов
    • 2.2 Извлечение и анализ стилеметрических признаков
    • 2.3 Построение моделей классификации
    • 2.4 Интерпретация результатов моделей
    • 2.5 Анализ n-gram
    • 2.6 Практические рекомендации по выявлению сгенерированных текстов
    • 2.7 Ограничения исследования
  • ВЫВОДЫ ПО ГЛАВЕ 2
  • ЗАКЛЮЧЕНИЕ
  • СПИСОК ИСПОЛЬЗОВАННЫХ ИСТОЧНИКОВ
  • ПРИЛОЖЕНИЯ
  • ПРИЛОЖЕНИЕ А
  • ПРИЛОЖЕНИЕ Б
...