Новости
Автоматическое восстановление берестяных грамот методами маскированного языкового моделирования
Аннотация
Настоящая работа посвящена задаче автоматического восстановления лакун в новгородских берестяных грамотах, представляющей особую сложность из-за небольшого объёма доступного корпуса и отличительных черт древненовгородского диалекта. Мы представляем систематическое сравнение трёх BERT-подобных энкодеров – mBERT, BERTislav и ModernBERT – на уровне символов и токенов, в режимах без дообучения и после дообучения, на специально подготовленном корпусе древнерусских и церковнославянских текстов. После доменного дообучения ModernBERT демонстрирует лучший результат реконструкции, достигая точности по первому кандидату 30.72% на реальных лакунах и 91.40% на искусственно замаскированном тексте при предсказании по токенам. Однако на уровне символов дообученные энкодеры не превосходят простую символьную n-граммную модель, что указывает на структурное несоответствие между субсловным предобучением и посимвольным предсказанием. Также мы обучили линейные классификаторы на замороженных векторных представлениях для предсказания жанра и периода создания документа: полученные представления несут полезный сигнал для датировки, тогда как жанр оказывается преимущественно поверхностным орфографическим свойством, которое не хуже, а порой и лучше улавливает символьная модель на признаках TF-IDF.
Ключевые слова
Издание
Труды Института системного программирования РАН, том 38, вып. 6, часть 1, 2026, стр. 177-192.
ISSN 2220-6426 (Online), ISSN 2079-8156 (Print).
DOI: 10.15514/ISPRAS-2026-38(6)-11
Для цитирования
Полный текст статьи в формате pdf (на английском)
Вернуться к содержанию тома