Автоматическое восстановление берестяных грамот методами маскированного языкового моделирования


Автоматическое восстановление берестяных грамот методами маскированного языкового моделирования

Еремеев М.А. (НИУ ВШЭ, Москва, Россия)
Хумонен И.С. (AXXX, Москва, Россия; ИЦДИИ ИСП РАН, Москва, Россия)
Голядкин М.Ю. (AXXX, Москва, Россия; ИЦДИИ ИСП РАН, Москва, Россия)
Фитискина А.А. (НИУ ВШЭ, Москва, Россия)
Макаров И.А. (AXXX, Москва, Россия; ИЦДИИ ИСП РАН, Москва, Россия)

Аннотация

Настоящая работа посвящена задаче автоматического восстановления лакун в новгородских берестяных грамотах, представляющей особую сложность из-за небольшого объёма доступного корпуса и отличительных черт древненовгородского диалекта. Мы представляем систематическое сравнение трёх BERT-подобных энкодеров – mBERT, BERTislav и ModernBERT – на уровне символов и токенов, в режимах без дообучения и после дообучения, на специально подготовленном корпусе древнерусских и церковнославянских текстов. После доменного дообучения ModernBERT демонстрирует лучший результат реконструкции, достигая точности по первому кандидату 30.72% на реальных лакунах и 91.40% на искусственно замаскированном тексте при предсказании по токенам. Однако на уровне символов дообученные энкодеры не превосходят простую символьную n-граммную модель, что указывает на структурное несоответствие между субсловным предобучением и посимвольным предсказанием. Также мы обучили линейные классификаторы на замороженных векторных представлениях для предсказания жанра и периода создания документа: полученные представления несут полезный сигнал для датировки, тогда как жанр оказывается преимущественно поверхностным орфографическим свойством, которое не хуже, а порой и лучше улавливает символьная модель на признаках TF-IDF.

Ключевые слова

берестяные грамоты; восстановление лакун; древненовгородский диалект; древнерусский; церковнославянский; маскированное языковое моделирование; малоресурсные языки.

Издание

Труды Института системного программирования РАН, том 38, вып. 6, часть 1, 2026, стр. 177-192.

ISSN 2220-6426 (Online), ISSN 2079-8156 (Print).

DOI: 10.15514/ISPRAS-2026-38(6)-11

Для цитирования

Еремеев М.А., Хумонен И.С., Голядкин М.Ю., Фитискина А.А., Макаров И.А. Автоматическое восстановление берестяных грамот методами маскированного языкового моделирования. Труды Института системного программирования РАН, том 38, вып. 6, часть 1, 2026, стр. 177-192. DOI: 10.15514/ISPRAS-2026-38(6)-11.

Полный текст статьи в формате pdf (на английском) Вернуться к содержанию тома