Детальная информация

Название Использование метрик однородности текстовых корпусов для прогнозирования успеха дообучения моделей нейронного перевода: выпускная квалификационная работа магистра: направление 45.04.04 «Интеллектуальные системы в гуманитарной среде» ; образовательная программа 45.04.04_02 «Цифровая лингвистика» = Using text corpus homogeneity metrics to predict the outcome of fine-tuning a neural machine translation model
Авторы Коваленко Владислав Сергеевич
Научный руководитель Дмитриев Александр Владиславович
Организация Санкт-Петербургский политехнический университет Петра Великого. Гуманитарный институт
Выходные сведения Санкт-Петербург, 2026
Коллекция Выпускные квалификационные работы ; Общая коллекция
Тематика нейронный машинный перевод ; однородность текстов ; дообучение моделей ; neural machine translation ; text homogeneity ; fine-tuning
Тип документа Выпускная квалификационная работа магистра
Язык Русский
Уровень высшего образования Магистратура
Код специальности ФГОС 45.04.04
Группа специальностей ФГОС 450000 - Языкознание и литературоведение
DOI 10.18720/SPBPU/3/2026/vr/vr26-5351
Права доступа Доступ по паролю из сети Интернет (чтение, печать, копирование)
Дополнительно Новинка
Ключ записи ru\spstu\vkr\45730
Дата создания записи 10.09.2026

Разрешенные действия

Действие 'Прочитать' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Действие 'Загрузить' будет доступно, если вы выполните вход в систему или будете работать с сайтом на компьютере в другой сети

Группа Анонимные пользователи
Сеть Интернет

С появлением открытых моделей машинного перевода и больших языковых моделей практика дообучения моделей на своих собственных данных становится всё более распространённой среди профессиональных переводчиков. При этом даже при установленных базовой модели, алгоритма обработки данных и гиперпараметрах обучения результат этого процесса будет значительно отличаться от корпуса к корпусу. Данная работа рассматривает влияние однородности обучающих корпусов на результат дообучения моделей машинного перевода. В рамках работы проведён ряд настроек одной базовой модели на разных корпусах, а к самим корпусам применены разные методы определения однородности: на базе частотных списков, эмбеддингов и результатов классификации. Эксперимент показал, что применение классификации на балансированном списке классов позволяет достаточно точно определить тематическое разнообразие подобных корпусов. Полученные результаты однородности не коррелируют с результатами дообучения полностью, но показывают наличие связи между ними и позволяют выделить более и менее подходящие для задачи дообучения данные. Для более точного прогнозирования результатов настройки требуется также учитывать другие параметры обучающего корпуса.

As open-weight machine translation models and large language models become more widely available, professional translators start turning to fine-tuning these models on their own text data. And yet, even if one were to use the same base model, the same text processing pipeline, and the same hyperparameters, the outcome of that process will greatly vary depending on the text corpus used for training. This work concerns the influence of training data homogeneity on the outcome of fine-tuning machine translation models. A number of tunings were performed on different data using the same base model, and training corpora were examined using different methods of calculating text homogeneity: using frequency lists, embeddings and thematic classification. The results of the exper-iment have shown that using thematic classification with a balanced list of classes allows one to accurately infer the thematic diversity of a given corpus. The result-ing homogeneity metrics do not fully correlate with the finetuning results, but show that there is a connection between the two and that some corpora are less suited for finetuning than others. In order to more accurately predict the out-come of fine-tuning, one would need to also consider other features of the training corpus.

Место доступа Группа пользователей Действие
Локальная сеть ИБК СПбПУ Все
Прочитать Печать Загрузить
Интернет Авторизованные пользователи СПбПУ
Прочитать Печать Загрузить
Интернет Анонимные пользователи
...