Библиометрический анализ как отдельное направление науки появляется в 1960-е годы. Это понятие тесно связано с использованием математических и статистических методов в исследованиях научных публикаций. Библиометрический анализ с точки зрения науки определяется как дисциплина, которая занимается изучением документов на основе количественного анализа источников информации. Целью данной дисциплины является получение данных о динамике, структуре, эффективности и закономерностях развития исследуемых областей [16].
Библиометрический или наукометрический анализ - это область исследований, которая помогает анализировать текущие тенденции в литературе, относящиеся к определенной области, и обеспечивает руководящие принципы и мотивацию для будущей исследовательской работы. При библиометрическом анализе извлекаются различные показатели эффективности, такие как: общее количество статей, общее количество цитирований и цитируемость на статью.
С профессиональной точки зрения библиометрия определяется как совокупность методов количественного отображения, которые измеряют постоянно меняющиеся связи между данными по определенным индикаторам. Методы анализа информационного потока позволяют определить [17]:
Темпы развития различных областей науки
Направления развития различных областей науки
Основные связи между проблемами и областями
Вклад отдельных исследователей, университетов, журналов, стран, организаций в развитие конкретной области науки
Существует два направления библиометрического анализа информационных потоков:
Изучение статистических данных исследуемых материалов. Результаты данного подхода характеризуются количественными показателями. С помощью этого подхода можно проследить динамику исследуемых областей или проблем. Полученные путем реализации этого подхода результаты обычно нуждаются в дальнейшем изучении.
Структурная библиометрия. При реализации этого подхода необходимо выделить связь между информационными потоками. Данный подход может осуществлять как количественный анализ, так и цитатный анализ. Результатом применения структурного подхода является выявление качественной оценки исследуемых материалов через количественные показатели.
Во все времена научная деятельность определялась как производство нового знания. Однако наука является не только генератором новой информации, но также основным потребителем этой информации [17].
На сегодняшний день поиск объективных показателей состояния различных отраслей является главной задачей развития науки. Финансирование и развитие научных исследований напрямую зависит от точности экспертной оценки при библиометрическом анализе. Точность оценки показателей определяет, какое направление исследования предпочтительнее на сегодняшний день.
Для получения точных и объективных результатов анализа необходимо правильно составить программу сбора и обработки первоначальных данных. Иначе исходные данные могут оказаться непригодными для исследования, и, как следствие полученные результаты анализа будут неверны.
Таким образом, для получения точных результатов библиометрического анализа необходимым условием является наличие проблемно-ориентированных баз данных. Существуют определенные требования для таких баз данных [20]:
Возможность проведения библиометрического анализа с помощью различных информационных систем
Интеграция исходных данных в едином информационном пространстве
Возможность стандартизованного доступа к данному ресурсу
Данные по определенной предметно-ориентированной тематике должны полностью отображать состояние исследуемой области
Для проведения библиометрического исследования необходимо определить единицу анализа. Этой единицей может служить слово или выражение, которое определяет предмет, проблему, отрасль или направление. По изменениям частоты встречаемости этих единиц можно определить основные документы, в которых уделяется большее внимание изучаемой области [18].
Результатом библиометрического анализа является графическое, количественное или качественное представление показателей эффективности. Также результатом может служить предоставление экспертной оценки. Данные показатели могут оценивать степень новизны и актуальности исследуемой области, прослеживать динамику количества публикаций во времени и т. д. Тем не менее, наибольший вклад в науку заключается в возможности получения нового знания, которое содержит в себе анализ и синтез имеющейся информации.
Таким образом, библиометрический анализ - это новое направление науки, которое помогает анализировать статистические данные исследований с целью получения новых знаний. Существует два подхода исследования информационных потоков: направление, основанное на количественных показателях и направление, основанное на качественных показателях.
Однако главный недостаток заключается в том, что большинство библиометрических исследований используют субъективные и неформальные подходы к определению темы. Для избежания предвзятости необходимо использовать методы, которые основываются на вероятностных показателях [19].
2.2 Тематическое моделирование
Развитие цифровых технологий и увеличение роли информации на сегодняшний день отвело методам анализа текста особую роль. Тематический анализ данных применяется при поиске, оценке, систематизации, отборе информации, анализе, диагностике и прогнозировании событий или поведения субъекта. Благодаря этому он получил широкое распространение в системах безопасности.
Тематический анализ -- это систематический метод разделения и систематизации большого количества данных, полученных в качественных исследованиях, суть которого состоит в маркировании отдельных наблюдений и цитат определёнными кодами для облегчения поиска важных тем [24].
На сегодняшний день существует большое количество методов тематического анализа текстовой информации. Всю совокупность представленных методов можно разделить на 2 группы:
Лингвистический анализ, который предполагает использование алгоритмов семантического анализа текста и применение семантической сети в качестве модели представления текста. Области знания в данном случае представляются в виде дерева. Таким образом, определение темы можно представить в виде отдельных узлов семантической сети. К каждому термину или понятию составляется список документов. После определения конечного понятия или термина явно или неявно указанного в запросе производится поиск документа непосредственно внутри списка соотносящегося с данным понятием или термином.
Статистический анализ (частотный анализ в разных вариациях). Смысл такого вида анализа обычно заключается в подсчете количества повторений конкретных слов в тексте. Целью статистического анализа данных является использование результатов подсчета для конкретных исследований [25].
Статистический анализ данных можно использовать для решения задачи выявления ключевых слов любого документа. Абсолютно в любых документах и текстах можно выявить статистические закономерности.
Для того чтобы сделать выявление значимых слов более эффективным, необходимо предварительно исключить из исследуемого текста некоторые слова, которые априори не могут являться значимыми и поэтому являются шумом. Такие слова обычно называют нейтральными или стоповыми словами.
На сегодняшний день исследователи сталкиваются с большим количеством проблем связанных с тематическим анализом данных. Обычно такого рода проблемы возникают на ранних стадиях исследования. Наиболее вероятными проблемами являются [24]:
Большое количество данных: результаты исследований в огромных текстах и больших заметках могут быть нечитабельными, из-за этого могут возникнуть проблемы с трудностью выбора главного.
Отсутствие объективности: исследователь игнорирует точки зрения, которые не соответствуют его убеждениям.
Противоречивость данных: иногда исследуемые данные от одного или разных участников могут содержать противоречия, которые исследователи должны иметь в виду и учитывать при анализе.
Поверхностный анализ: анализ проводится очень поверхностно, с фокусом внимания только на запоминающихся событиях и цитатах, без учета емких заметок.
Отсутствие ясности в результатах: невозможно однозначно интерпретировать данные, так как результат анализа некорректный.
Главным недостатком является то, что при большинстве библиометрических исследований используют субъективные подходы к определению темы. Однако существует ряд формальных методов, которые позволяют идентифицировать темы в корпусе документов на основе частотности слов. Эти методы тематического анализа разработаны в рамках машинного обучения.
В тематическом моделировании тема определяется как набор слов, часто встречающихся в текстах, относящихся к данной предметной области. Предполагается, что существует конечное множество тем T, и каждое использование термина W в каждом документе D связано с некоторой темой T2, которая неизвестна [26].
Совокупность документов рассматривается как набор тем, выбранных случайным образом, определенных на конечном множестве. Таким образом, вероятностное тематическое моделирование основано на идее, что документы - это смеси тем, где тема - это распределение вероятностей по словам. Представление научных работ в виде смеси тем открывает много новых возможностей анализа, но этот подход до сих пор используется сравнительно редко.
В данной магистерской диссертации для определения основных терминов и тем используется метод Латентного размещения Дирихле (LDA). Данный метод основан на вероятностной модели, в котором темы определяются вероятностями появления каждого слова из заданного набора. Документы могут определяться как сочетания тем. Главной особенностью метода LDA является то, что темы не обязательно должны быть различными и слова могут встречаться в нескольких темах. Поэтому данный подход может давать нечеткие результаты при определении тем [27].
Метод Латентного размещения определяет термины, по которым можно попытаться определить вероятную тему. Для применения метода LDA необходима предварительная обработка текста: удаление пунктуации, удаление стоп слов и лемматизация слов. Благодаря этому применение данного метода позволит избежать предвзятости.
На сегодняшний день методы тематического анализа широко используются в исследованиях и относятся к области искусственного интеллекта. Известно, что методика тематического моделирования дает полезные библиометрические результаты. Представление тем как распределений слов и документов как распределений тем также позволяет нам исследовать многие аспекты. В частности, это исследование уникальности тематической направленности научных журналов, исследование связей между темами на основе пересечения набора определяющих их слов.
2.3 Применение библиометрического анализа в области Индустрии 4.0
Концепция Индустрии 4.0 рождает огромный интерес, как у представителей бизнеса, так и в научных кругах. Доказательством этому является рост инвестиций в цифровые технологии, рост научных публикаций на тему четвертой промышленной революции, представление Индустрии 4.0 как стратегического плана развития промышленности в ряде стран. Внедрение технологий четвертой промышленной революции предоставляет предприятиям огромные выгоды, такие как повышение качества продукции, сокращение сроков выполнения производственных заказов и сокращение затрат.
Несмотря на то, что количество научных работ на данную тему с каждым годом увеличивается, существует очень мало систематических и обширных обзоров исследований, отражающих динамичный характер этой темы. Также следует отметить, что на сегодняшний день не выявлены основные технологии, связанные с понятием Индустрии 4.0. Существует две принципиально различные позиции, которые определяют четвертую промышленную революцию с точки зрения технологий. Одни склонны считать, что Индустрия 4.0 - это интеллектуальная рекомбинация существующих технологий и некоторых новых технологий. Другие утверждают, что это новая волна технологий, которая принципиально отличается от предыдущих технологий. Для решения этих проблем необходимо провести анализ применения библиометрии в области Индустрии 4.0.
Следует отметить, что понятие «Индустрия 4.0» впервые использовалось лишь в 2011 году в Германии. До этого цифровые технологии рассматривались как самостоятельные единицы.
Для выявления основных направлений и ключевых технологий Индустрии 4.0 были изучены научные публикации некоторых авторов.
Filippo Chiarello и соавторы [32] провели анализ публикаций для выявления отраслевых технологий Индустрии 4.0. Главной целью этого исследования являлось создание общей семантики для четвертой промышленной революции. Основной подход был основан на ключевых словах, которые должны быть идентифицированы в различных областях документов (название, аннотация, ключевые слова, полный текст статьи) и использоваться в качестве запросов. В данной работе были использованы исследования, опубликованные до 2017 года. В качестве источника данных авторы выбрали бесплатную онлайн-энциклопедию Wikipedia. Также в качестве исходных данных были использованы официальные правительственные документы ряда стран и наиболее цитируемые работы по Индустрии 4.0, взятые из базы данных Scopus.