L. D. Kanteev, Yu. O. Kostyukov, D. V. Luciv, D. V. Koznov, M. N. Smirnov, “Discovering near duplicate text in software documentation”, Труды ИСП РАН, 2017, том 29, выпуск 4,страницы 303

Discovering near duplicate text in software documentation

[Обнаружение неточно повторяющегося текста в документации программного обеспечения]

L. D. Kanteev, Yu. O. Kostyukov, D. V. Luciv, D. V. Koznov, M. N. Smirnov

Saint Petersburg State University

Аннотация: При создании документации программного обеспечения часто применяется копирование и вставка с последующим редактированием, в результате чего возникает много повторяющегося текста. Такие повторы усложняют и удорожают поддержку документации, особенно в случае длительных жизненных циклов программного обеспечения и документации. Ещё более усложняет ситуацию то, что зачастую информация повторяется приблизительно, т.е. одна и та же информация может быть многократно представлена с разными уровнями детализации, в различных контекстах и т.д. В данной работе предложен алгоритм, предназначенный для обнаружения неточных повторов в документации программного обеспечения. Алгоритм основан на модели N-грамм и реализован с использованием Natural Language Toolkit. Алгоритм апробирован на документации нескольких проектов с открытым исходным кодом.

Ключевые слова: документация программного обеспечения, нечёткие повторы, обработка текстов на естественных языках, модель N-грамм.

Язык публикации: английский

DOI: 10.15514/ISPRAS-2017-29(4)-21