Details

Title Использование метрик однородности текстовых корпусов для прогнозирования успеха дообучения моделей нейронного перевода: выпускная квалификационная работа магистра: направление 45.04.04 «Интеллектуальные системы в гуманитарной среде» ; образовательная программа 45.04.04_02 «Цифровая лингвистика» = Using text corpus homogeneity metrics to predict the outcome of fine-tuning a neural machine translation model
Creators Коваленко Владислав Сергеевич
Scientific adviser Дмитриев Александр Владиславович
Organization Санкт-Петербургский политехнический университет Петра Великого. Гуманитарный институт
Imprint Санкт-Петербург, 2026
Collection Выпускные квалификационные работы ; Общая коллекция
Subjects нейронный машинный перевод ; однородность текстов ; дообучение моделей ; neural machine translation ; text homogeneity ; fine-tuning
Document type Master graduation qualification work
Language Russian
Level of education Master
Speciality code (FGOS) 45.04.04
Speciality group (FGOS) 450000 - Языкознание и литературоведение
DOI 10.18720/SPBPU/3/2026/vr/vr26-5351
Rights Доступ по паролю из сети Интернет (чтение, печать, копирование)
Additionally New arrival
Record key ru\spstu\vkr\45730
Record create date 9/10/2026

Allowed Actions

Action 'Read' will be available if you login or access site from another network

Action 'Download' will be available if you login or access site from another network

Group Anonymous
Network Internet

С появлением открытых моделей машинного перевода и больших языковых моделей практика дообучения моделей на своих собственных данных становится всё более распространённой среди профессиональных переводчиков. При этом даже при установленных базовой модели, алгоритма обработки данных и гиперпараметрах обучения результат этого процесса будет значительно отличаться от корпуса к корпусу. Данная работа рассматривает влияние однородности обучающих корпусов на результат дообучения моделей машинного перевода. В рамках работы проведён ряд настроек одной базовой модели на разных корпусах, а к самим корпусам применены разные методы определения однородности: на базе частотных списков, эмбеддингов и результатов классификации. Эксперимент показал, что применение классификации на балансированном списке классов позволяет достаточно точно определить тематическое разнообразие подобных корпусов. Полученные результаты однородности не коррелируют с результатами дообучения полностью, но показывают наличие связи между ними и позволяют выделить более и менее подходящие для задачи дообучения данные. Для более точного прогнозирования результатов настройки требуется также учитывать другие параметры обучающего корпуса.

As open-weight machine translation models and large language models become more widely available, professional translators start turning to fine-tuning these models on their own text data. And yet, even if one were to use the same base model, the same text processing pipeline, and the same hyperparameters, the outcome of that process will greatly vary depending on the text corpus used for training. This work concerns the influence of training data homogeneity on the outcome of fine-tuning machine translation models. A number of tunings were performed on different data using the same base model, and training corpora were examined using different methods of calculating text homogeneity: using frequency lists, embeddings and thematic classification. The results of the exper-iment have shown that using thematic classification with a balanced list of classes allows one to accurately infer the thematic diversity of a given corpus. The result-ing homogeneity metrics do not fully correlate with the finetuning results, but show that there is a connection between the two and that some corpora are less suited for finetuning than others. In order to more accurately predict the out-come of fine-tuning, one would need to also consider other features of the training corpus.

Network User group Action
ILC SPbPU Local Network All
Read Print Download
Internet Authorized users SPbPU
Read Print Download
Internet Anonymous
...