<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Publishing DTD v1.3 20210610//EN" "JATS-journalpublishing1-3.dtd">
<article article-type="research-article" dtd-version="1.3" xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xml:lang="ru"><front><journal-meta><journal-id journal-id-type="publisher-id">kemsu</journal-id><journal-title-group><journal-title xml:lang="ru">СибСкрипт</journal-title><trans-title-group xml:lang="en"><trans-title>SibScript</trans-title></trans-title-group></journal-title-group><issn pub-type="ppub">2949-2122</issn><issn pub-type="epub">2949-2092</issn><publisher><publisher-name>Kemerovo State University</publisher-name></publisher></journal-meta><article-meta><article-id custom-type="elpub" pub-id-type="custom">kemsu-970</article-id><article-categories><subj-group subj-group-type="heading"><subject>Research Article</subject></subj-group><subj-group subj-group-type="section-heading" xml:lang="ru"><subject>Математика</subject></subj-group><subj-group subj-group-type="section-heading" xml:lang="en"><subject>MATHEMATICS</subject></subj-group></article-categories><title-group><article-title>АВТОМАТИЧЕСКАЯ КЛАССИФИКАЦИЯ СЛАБОСТРУКТУРИРОВАННЫХ ДОКУМЕНТОВ, УЧАСТВУЮЩИХ В НАУЧНО-ОБРАЗОВАТЕЛЬНОМ ПРОЦЕССЕ</article-title><trans-title-group xml:lang="en"><trans-title>AUTOMATIC CLASSIFICATION OF SEMISTRUCTURED DOCUMENTS IN SCIENTIFIC AND EDUCATIONAL PROCESS</trans-title></trans-title-group></title-group><contrib-group><contrib contrib-type="author" corresp="yes"><name-alternatives><name name-style="eastern" xml:lang="ru"><surname>Гудов</surname><given-names>А. М.</given-names></name><name name-style="western" xml:lang="en"><surname>Gudov</surname><given-names>A. M.</given-names></name></name-alternatives><bio xml:lang="ru"><p>Гудов Александр Михайлович – доктор технических наук, доцент, заведующий кафедрой ЮНЕСКО по новым информационным технологиям КемГУ</p></bio><bio xml:lang="en"><p>Alexander M. Gudov – Doctor of Technical Sciences, Associate Professor, Head of the UNESCO Department for New Information Technologies</p></bio><email xlink:type="simple">good@kemsu.ru</email><xref ref-type="aff" rid="aff-1"/></contrib><contrib contrib-type="author" corresp="yes"><name-alternatives><name name-style="eastern" xml:lang="ru"><surname>Завозкин</surname><given-names>С. Ю.</given-names></name><name name-style="western" xml:lang="en"><surname>Zavozkin</surname><given-names>S. Yu.</given-names></name></name-alternatives><bio xml:lang="ru"><p>Завозкин Сергей Юрьевич – кандидат технических наук, доцент кафедры ЮНЕСКО по новым информационным технологиям КемГУ</p></bio><bio xml:lang="en"><p>Sergey Yu. Zavozkin – Candidate of Technical Sciences, Assistant Professor at the UNESCO Department for New Information Technologies</p></bio><email xlink:type="simple">shade@kemsu.ru</email><xref ref-type="aff" rid="aff-1"/></contrib><contrib contrib-type="author" corresp="yes"><name-alternatives><name name-style="eastern" xml:lang="ru"><surname>Шевнин</surname><given-names>В. А.</given-names></name><name name-style="western" xml:lang="en"><surname>Shevnin</surname><given-names>V. A.</given-names></name></name-alternatives><bio xml:lang="ru"><p>Шевнин Василий Алексеевич – аспирант кафедры ЮНЕСКО по новым информационным технологиям КемГУ</p></bio><bio xml:lang="en"><p>Vasily A. Shevnin – post-graduate student at the UNESCO Department for New Information Technologies</p></bio><email xlink:type="simple">vaaaasyaaaa@gmail.com</email><xref ref-type="aff" rid="aff-1"/></contrib></contrib-group><aff-alternatives id="aff-1"><aff xml:lang="ru"><institution>Кемеровский государственный университет</institution><country>Россия</country></aff><aff xml:lang="en"><institution>Kemerovo State University</institution><country>Russian Federation</country></aff></aff-alternatives><pub-date pub-type="collection"><year>2014</year></pub-date><pub-date pub-type="epub"><day>18</day><month>03</month><year>2016</year></pub-date><volume>0</volume><issue>4-3</issue><fpage>43</fpage><lpage>47</lpage><permissions><copyright-statement>Copyright &amp;#x00A9; Гудов А.М., Завозкин С.Ю., Шевнин В.А., 2014</copyright-statement><copyright-year>2014</copyright-year><copyright-holder xml:lang="ru">Гудов А.М., Завозкин С.Ю., Шевнин В.А.</copyright-holder><copyright-holder xml:lang="en">Gudov A.M., Zavozkin S.Y., Shevnin V.A.</copyright-holder><license xml:lang="ru" license-type="creative-commons-attribution" xlink:href="https://creativecommons.org/licenses/by/4.0/" xlink:type="simple"><license-p>Данная работа распространяется под лицензией Creative Commons Attribution 4.0.</license-p></license><license xml:lang="en" license-type="creative-commons-attribution" xlink:href="https://creativecommons.org/licenses/by/4.0/" xlink:type="simple"><license-p>This work is licensed under a Creative Commons Attribution 4.0 License.</license-p></license></permissions><self-uri xlink:href="https://www.sibscript.ru/jour/article/view/970">https://www.sibscript.ru/jour/article/view/970</self-uri><abstract><p>Ежедневно в научно-образовательном процессе любого учебного учреждения используется множество слабоструктурированных документов. Одним из подходов, позволяющих единообразно обрабатывать такие документы, является работа не с самими документами, а с их метаданными. Однако эффективность такого подхода в случае большого числа слабоструктурированных документов может быть достигнута лишь при наличии эффективного, с точки зрения использования вычислительных ресурсов, механизма автоматического извлечения метаданных из содержимого документов, который можно разбить на три этапа: определение класса документа; кластеризация документов, класс которых не удалось определить; извлечение метаданных из документа уже известного класса. Данная работа посвящена поиску возможных решений на первом этапе – автоматической классификации слабоструктурированных документов. В работе введено понятие слабоструктурированного документа, представлены критерии эффективности методов классификации, проведен сравнительный анализ методов в соответствии с первыми пятью критериями. Для оценки по дополнительно разработанным двум критериям были реализованы методы: многослойные нейронные сети, Роккио, k-ближайших соседей. Результаты проведенного анализа показали, что наибольшую эффективность при решении данной задачи с точки зрения соотношения точность/скорость показывают нейронные сети, но точность классификации на слабоструктурированных документах не является достаточной. Выдвинута гипотеза, что точность методов можно повысить, используя при классификации не только ключевые слова, но и известную структуру документа.</p></abstract><trans-abstract xml:lang="en"><p>Numerous semi-structured documents are used daily in education and research activities at universities. Dealing with metadata rather than documents themselves is one of the ways of processing documents uniformly. However, as far as many semi-structured documents are concerned, this method is considered to be efficient only in case of the existing procedure of automatic extraction of documents content metadata. The procedure includes 3 stages: document class identification, clusterization of the documents whose classes could not be identified, extraction of metadata from the documents of identified classes. The paper is dedicated to possible solutions for the first stage, i.e. automatic classification of semi-structured documents. The paper includes the definition of a semi-structured document, criteria of methods efficiency classification, comparative analysis of different methods regarding 5 top criteria. To estimate 2 additionally developped criteria the following methods are used: multilayer neural networks, Rocchio algorithm, k-nearest neighbor method. Based on the analysis results, the neural networks method appears to be the most efficient in the context of accuracy and speed correlation. However, classification accuracy is not enough when dealing with semi-structured documents. The authors suppose the accuracy of the methods can be improved by using not only key words but also determined document structure during classification process.</p></trans-abstract><kwd-group xml:lang="ru"><kwd>слабоструктурированные документы</kwd><kwd>метаданные</kwd><kwd>автоматическое извлечение</kwd><kwd>автоматическая</kwd></kwd-group><kwd-group xml:lang="en"><kwd>semi-structured documents</kwd><kwd>metadata</kwd><kwd>automatic extraction</kwd><kwd>automatic</kwd></kwd-group></article-meta></front><back><ref-list><title>References</title><ref id="cit1"><label>1</label><citation-alternatives><mixed-citation xml:lang="ru">Галушкин А. И. Синтез многослойных систем распознавания образов. М.: Энергия. 1974.</mixed-citation><mixed-citation xml:lang="en">Галушкин А. И. Синтез многослойных систем распознавания образов. М.: Энергия. 1974.</mixed-citation></citation-alternatives></ref><ref id="cit2"><label>2</label><citation-alternatives><mixed-citation xml:lang="ru">Гудов А. М., Завозкин С. Ю., Меньшиков А. С. Модуль автоматического определения метаданных документа в системе электронного документооборота вуза // Вестник КемГУ. 2006. № 1(25). С. 31 – 36.</mixed-citation><mixed-citation xml:lang="en">Гудов А. М., Завозкин С. Ю., Меньшиков А. С. Модуль автоматического определения метаданных документа в системе электронного документооборота вуза // Вестник КемГУ. 2006. № 1(25). С. 31 – 36.</mixed-citation></citation-alternatives></ref><ref id="cit3"><label>3</label><citation-alternatives><mixed-citation xml:lang="ru">Гудов А. М., Завозкин С. Ю., Шевнин В. А. Автоматическое извлечение метаданных из слабоструктурированных документов, участвующих в научно-образовательном процессе // Информационные технологии и математическое моделирование (ИТММ-2013): материалы XII Всероссийской научно-практической конференции с международным участием (им. А. Ф. Терпугова), 29 – 30 ноября 2013 г. Ч. I.</mixed-citation><mixed-citation xml:lang="en">Гудов А. М., Завозкин С. Ю., Шевнин В. А. Автоматическое извлечение метаданных из слабоструктурированных документов, участвующих в научно-образовательном процессе // Информационные технологии и математическое моделирование (ИТММ-2013): материалы XII Всероссийской научно-практической конференции с международным участием (им. А. Ф. Терпугова), 29 – 30 ноября 2013 г. Ч. I.</mixed-citation></citation-alternatives></ref><ref id="cit4"><label>4</label><citation-alternatives><mixed-citation xml:lang="ru">Кристофер Д. Маннинг, Правхакар Рагхаван, Хайнрих Шютце. Введение в информационный поиск [пер. с англ.] М.: И. Д. Вильямс, 2011.</mixed-citation><mixed-citation xml:lang="en">Кристофер Д. Маннинг, Правхакар Рагхаван, Хайнрих Шютце. Введение в информационный поиск [пер. с англ.] М.: И. Д. Вильямс, 2011.</mixed-citation></citation-alternatives></ref><ref id="cit5"><label>5</label><citation-alternatives><mixed-citation xml:lang="ru">Лебедев А. Словарь русского языка ispell // Кафедра физики полупроводников. 2014. Режим доступа: scon155.phys.msu.su/~swan/orthography.html (дата обращения: 30.01.2014).</mixed-citation><mixed-citation xml:lang="en">Лебедев А. Словарь русского языка ispell // Кафедра физики полупроводников. 2014. Режим доступа: scon155.phys.msu.su/~swan/orthography.html (дата обращения: 30.01.2014).</mixed-citation></citation-alternatives></ref><ref id="cit6"><label>6</label><citation-alternatives><mixed-citation xml:lang="ru">Пескова О. В. Методы автоматической классификации текстовых электронных документов // НТИ. (Серия 2: Информационные процессы и системы). 2006. № 3. С. 13 – 20.</mixed-citation><mixed-citation xml:lang="en">Пескова О. В. Методы автоматической классификации текстовых электронных документов // НТИ. (Серия 2: Информационные процессы и системы). 2006. № 3. С. 13 – 20.</mixed-citation></citation-alternatives></ref><ref id="cit7"><label>7</label><citation-alternatives><mixed-citation xml:lang="ru">Толчеев В. О. Модифицированный и обобщенный метод ближайшего соседа для классификации библиографически текстовых документов // Заводская лаборатория, диагностика материалов. 2009. Т. 75. № 7. С. 63 – 70.</mixed-citation><mixed-citation xml:lang="en">Толчеев В. О. Модифицированный и обобщенный метод ближайшего соседа для классификации библиографически текстовых документов // Заводская лаборатория, диагностика материалов. 2009. Т. 75. № 7. С. 63 – 70.</mixed-citation></citation-alternatives></ref></ref-list><fn-group><fn fn-type="conflict"><p>The authors declare that there are no conflicts of interest present.</p></fn></fn-group></back></article>
