Метод автоматической проверки и исправления форматирования текстовых документов в образовательной среде
Метод автоматической проверки и исправления форматирования текстовых документов в образовательной среде
Аннотация
В работе предлагается метод автоматической проверки и исправления форматирования образовательных и научных документов, учитывающий разнообразие локальных стандартов оформления, принятых в отдельных учебных заведениях. Существующие решения либо жёстко привязаны к одному институциональному шаблону и не поддерживают автоматическое исправление, либо основаны на машинном обучении и анализируют структуру документа без детерминированной, основанной на правилах коррекции. Для устранения этого разрыва предложенный метод объединяет три компонента: древовидный расширяемый шаблон, формализующий локальные правила форматирования для каждого типа абзаца; алгоритм классификации, определяющий тип абзаца по совокупности визуальных, структурных и контекстных признаков; и механизм коррекции, сопоставляющий обнаруженные нарушения с конкретными корректирующими действиями. Метод реализован в виде клиент-серверного прототипа на базе ASP.NET Core и библиотеки OpenXML, при этом шаблон форматирования хранится в виде структурированного файла на языке XML. Апробация проводилась на выборке из 10 студенческих отчётов (1018 абзацев), ранее проверенных учебными ассистентами НИУ ВШЭ – Пермь. Точность классификации абзацев составила 87,2%, наибольшее число ошибок связано с разграничением списков, обычного текста и заголовков в документах без стилевого форматирования. Полнота выявления нарушений форматирования составила 90,8%, а 83,1% обнаруженных нарушений были устранены автоматически без внесения новых несоответствий. Автоматическая проверка документа объёмом 15-25 страниц занимала около одной минуты, тогда как большинство учебных ассистентов сообщали о затратах в 15-30 минут на ручную проверку документа сопоставимого объёма, то есть время проверки сокращается более чем в десять раз. Полученные результаты показывают, что сочетание адаптируемого шаблона правил с классификацией абзацев по нескольким признакам обеспечивает точную, прозрачную и переносимую между разными институциональными стандартами проверку форматирования, тогда как автоматическое исправление пока ограничено локально устранимыми нарушениями.
Ключевые слова
Издание
Труды Института системного программирования РАН, том 38, вып. 5, 2026, стр. 325-336.
ISSN 2220-6426 (Online), ISSN 2079-8156 (Print).
DOI: 10.15514/ISPRAS-2026-38(5)-18
Для цитирования
Полный текст статьи в формате pdf (на английском)
Вернуться к содержанию тома