Автоматизированное формирование журналов событий на основе неструктурированных Интернет-источников для задач анализа процессов


Автоматизированное формирование журналов событий на основе неструктурированных Интернет-источников для задач анализа процессов

Воронова К.Д. (НИУ ВШЭ, Пермь, Россия)
Лядова Л.Н. (НИУ ВШЭ, Пермь, Россия)

Аннотация

В статье представлен подход к автоматизированному структурированию информации о событиях, извлекаемой из неструктурированных текстовых Интернет-источников, для задач углублённого анализа процессов. Во многих практических случаях сведения о событиях, происходящих в рамках различных процессов, представлены не в виде готовых журналов событий, а распределены по новостным публикациям, отчётам и другим текстовым материалам. Это существенно усложняет применение средств анализа процессов, использующих данные, представленные в определённых форматах (например XES), поскольку требует выполнить поиск релевантных текстов, их интерпретацию и преобразование в структурированное представление, пригодное для анализа с помощью существующих средств Process Mining. Задача ещё более усложняется, если необходимо извлекать дополнительные атрибуты, связанные с описанными событиями, что даёт возможность выявить более глубокие закономерности, характеризующие исследуемые процессы, применять новые методы анализа процессов, учитывающие эти характеристики. Предлагаемый подход основан на сочетании онтологического представления знаний о предметных областях и источниках данных и больших языковых моделей, генеративного искусственного интеллекта. Онтологический слой используется для описания предметных областей исследуемых процессов, открытых источников информации о них, пользовательских запросов и результатов обработки найденной информации, тогда как генеративные модели обеспечивают поиск релевантной информации, извлечение данных о событиях и их первичную обработку и структурирование. Для реализации подхода предложена общая архитектура решения, позволяющего автоматизировать получение текстовых данных из различных источников на основе пользовательских запросов, сформированных с использованием онтологии, предобработку полученных данных с использованием генеративных моделей, структурирование и нормализацию извлечённых данных о событиях, а также подготовку данных для формирования журналов событий в заданных форматах. Для иллюстрации возможностей предложенного подхода рассматривается контролируемый экспериментальный сценарий. Проведённые эксперименты показали, что описанное программное решение позволяет находить релевантные текстовые материалы, выделять события и их атрибуты, а также формировать структурированное представление, пригодное для последующего преобразования в журнал событий. Вместе с тем результаты показали необходимость дополнительной нормализации данных и экспертной интерпретации части извлечённой информации.

Ключевые слова

поиск информации; обработка текстов на естественных языках; интеллектуальный анализ текстов; извлечение информации о событиях; протоколирование событий; подход, основанный на онтологии; подход на основе ИИ; генеративные модели; большая языковая модель; ко

Издание

Труды Института системного программирования РАН, том 38, вып. 4, часть 1, 2026, стр. 153-170.

ISSN 2220-6426 (Online), ISSN 2079-8156 (Print).

DOI: 10.15514/ISPRAS-2026-38(4)-8

Для цитирования

Воронова К.Д., Лядова Л.Н. Автоматизированное формирование журналов событий на основе неструктурированных Интернет-источников для задач анализа процессов. Труды Института системного программирования РАН, том 38, вып. 4, часть 1, 2026, стр. 153-170. DOI: 10.15514/ISPRAS-2026-38(4)-8.

Полный текст статьи в формате pdf (на английском) Вернуться к содержанию тома