Статья: Использование возможностей цифровой библиотеки Google в исследовании непрерывного образования

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Корпус русского языка в Google Books

На русском языке поисковик Google Books стал постепенно создаваться начиная с 2007 г. [18]. «К этому моменту в России уже существовали подобные сервисы, в роли которых можно рассматривать любую крупную электронную библиотеку, однако базы данных отечественных электронных библиотек либо специализировались на опред е- ленных категориях литературы, либо были не столь массивны, как планировал Google» [18]. Сравнимые с Google Books и Ngram Viewer сервисы на русском языке предоставляет Национальный корпус русского языка, однако, по данным В. Д. Соловьева, его объем в 200 раз меньше оцифрованных текстов в цифровой библиотеке GoogleТрудно сказать, насколько данное сравнение корректно, так как в цифровых библиотеках Google Books не учитываются грамматические особенности русского языка, и каждая словоформа считается как отдельное слово. Например, словоформы «образования» и «образованию» будут рассматриваться как разные слова., которая насчитывает 67 млрд слов Информация взята из доклада В. Д. Соловьева (Казанский федеральный университет), размещенного по адресу: https://www.youtube.com/watch?v=qPi0Ay2EYTc 6 октября 2016 г.

Cohen, P. In 500 Billion Words, New Window on Culture // New York Times. 2010. 16 Dec.. Несмотря на разницу в объемах «пословных» (т. е. n-gram-ированных) оцифрованных текстов в русскоязычных библиотеках, важно понимать и учитывать, что больший объем исторических текстов на русском языке попал в библиотеку Google из архивов ведущих американских университетов и библиотек, что не могло не отразиться на контенте.

Научные походы к анализу баз данных из библиотек Google

Развитие инструментов Ngram Viewer дало начало новому научному направлению, получившему название культуромика (Culturomics). Культуромика - это форма компьютерной лексикологии, которая изучает поведение человека и культурные тенденции через количественный анализ цифровых текстов1. Термин впервые появился в 2010 г. в статье Ж. Б. Мишеля и Э. Либермана Эйдена [12] при описании количественного анализа больших массивов цифровых текстов как метода изучения культуры. В последние годы культурономика получила распространение среди отечественных ученых и тех, кому интересно исследование развития культуры и языка. В качестве примеров сошлюсь на работы уже упомянутого ранее В. Д. Соловьева и его коллег, например, публикацию, посвященную лексическому подходу к оценке динамики уровня благополучия в обществе, который позволяет анализировать восприятие жизни людьми, зафиксированное в цифровых библиотеках Google Books [4]. Другие примеры - анализ репрезентаций капитализма в русской языковой среде в XIX и XX вв., представленный в работе С. Н. Рот, Н. А. Трофимова, А. Е. Мкртичян [см. 3]; аналогичное исследование А. А. Костригина, А. С. Некрасовой, Э. Л. Демещук концепта «бессознательное» в течение последних 200 лет в корпусе русского языка [2].

Работа с цифровыми базами данных также развивается в рамках так называемых цифровых гуманитарных наук (Digital Humanities) на пересечении гуманитарного и компьютерного знания. Это более широкая область научного исследования, которая не ограничивается обращением к культуре и языку.

Работа с базами данных Google Books при помощи инструментов Ngram Viewer чаще всего предполагает использование только количественных методов исследования, например, контент анализа, связанного с подсчетом искомых единиц в текстах и визуализацию их в виде графиков с возможностью последующего анализа. Однако автор данной статьи предлагает сочетать количественные и качественные методы исследования при работе с Google Books и Ngram Viewer, используя данные, получаемые на одном уровне, для исследования следующего уровня комплексом качественных социально-лингвистических методов исследования, например таких, как контекстный анализ, семантический анализ, тематический, риторический и дискурсивный анализ, каждый из которых может стать предметом отдельной статьи. Некоторые примеры такого анализа приведем в данной статье.

Теоретическую основу исследовательской методологии, которую конструирует и описывает автор данного материала, составили:

- лингво-педагогический подход к исследованию непрерывного образования (Колесникова, 2016 [17]; Игнатович, 2017 [14]);

- теория термина (Ойген Вустер; Фердинанд де Соссюр; Лотте);

- комплексные лингвистические, лингво-социологические, лингво-социальные подходы к анализу текста, включая контент-анализ, дискурсивный анализ, семантический и тематический анализ, риторический анализ текста.

Теория термина как концептуальная основа сбора данных в цифровых библиотеках Google Books

Теория термина сложилась в рамках деятельности трех научных школ - Венской, Пражской и Российской (Советской). Теория термина получила оформление в работах Ойгена Вустера (1898-1977), который исследовал становление технического языка в промышленности и инженерии Германии в 1900-1920 гг. Труды Ойгена Вустера дали начало Венской школе терминологии, опирающейся на его «Общую теорию терминологии» [65, р. 33-35] и разрабатывающей подходы к стандартизации терминологии, в том числе международной.

Вклад в развитие теории терминологии внес Фердинард де Соссюр (18571913), основоположник функциональной лингвистики, предложивший, например, разграничивать язык и речь. Исследуя системы концептов в разных языках, в книге, изданной в 1910 г., он отмечал, что репрезентация концептов в двух сравниваемых языках никогда не идентична . Идеи де Соссюра легли в основу Пражской школы терминологии (Вилем Матезиус, Николай Трубецкой, Роман Якобсон, Эмил Вачек и др.), которая исследует функциональный аспект языка как основу теории терминологии. Представители школы изучают стандартный язык как средство коммуникации во всех сферах социальной жизни, включая культуру, цивилизацию и технологии. Термин рассматривается как мельчайшая единица функционального языка, а терминологическая система - как система наименований, которые репрезентуют систему концепций (понятий) [см. 5, с. 35-36].

Российская школа терминологии была основана в 1933 г. вскоре после перевода книги Ойгена Вустера «Internationale Sprachnormung in der Technik» на русский язык. Инициаторами нового научного направления выступили профессор С. А. Чаплыгин и выдающийся терминолог Д. С. Лотте. В 1961 г. Д. С. Лотте опубликовал монографию «Основы построения научно-технической терминологии», куда вошли основные положения научного направления.

Термин - это лексическая единица, состоящая из одного или нескольких слов, служащая репрезентацией понятия или концепта внутри предметной области [8, с. 9]. Термин является символом, репрезентующим концепт в предметной области [9] или прямой репрезентацией концепта в предметной области [8]. Концепт может быть репрезентован одним или несколькими терминами, а также выражен неязыковыми знаками (например, наскальные изображения являются репрезентацией различных первобытных представлений (концептов), которые могли не иметь вербального выражения). Термины существуют в речи, т. е. в тексте и контексте. Так, например, значение термина «воспитание» в XXI в. может существенно отличаться от его трактовки в XVIII в. Современные термины «тьютор», «коуч», «фасилитатор» в русском и английском языках могут также иметь значительные различия [19].

Для исследователя, обращающегося к цифровой коллекции текстов Google Books с целью анализа концептов, принципиальны два положения теории терминологии:

1. Один и тот же концепт может быть выражен несколькими терминами.

2. Концепт может быть представлен различными терминами в разные исторические периоды.

Мы исходим из того, что реконструкция истории развития концепта непрерывного образования может быть осуществлена с позиции двух разных подходов. Первый подход предполагает изучение концепта без привязки к формальным терминам «непрерывное образование», «lifelong education», «lifelong learning», которые закрепились в русском и английском языках значительно позднее появления самой идеи. Данный подход опирается на теорию термина, теорию концептуализации и основные положения семиотики. Так, например, в социально-педагогической концепции Яна Амоса Коменского не используется термин «непрерывное образование», однако общий корпус высказанных идей позволяет относить данную концепцию к области непрерывного образования.

Второй подход, опирающийся на теорию термина, предлагает исследование концепции через изучение терминов, в которых она формально представлена. В нашем случае речь идет о поиске словосочетания «непрерывное образование» в текстовых массивах корпуса русского языка. Второй подход может рассматриваться как научное основание для организации исследования с использованием данных Google Books.

Ниже приведен алгоритм работы с базой данных Google Books на примере исследования термина «непрерывное образование». В ходе сбора данных автор статьи руководствовался двумя исследовательскими вопросами:

1. Каково качество исследовательских данных (репрезентации непрерывного образования) в цифровой библиотеке Google Books?

2. Как полученные данные конструируют историю развития концепта непрерывного образования в СССР в выбранный период?

Репрезентация «непрерывного образования» в цифровой коллекции Google Books

Для исследования репрезентации непрерывного образования в цифровой коллекции Google Books обратимся к сайту

https://books.google.com/ngrams. В строке поиска оформим запрос на поиск словосочетания «непрерывное образование» (см. рис. 1).

При настройке поиска необходимо выбрать:

- период из доступных на данный момент дат от 1500 до 2009 [between 1500 and 2009];

- язык [from the corpus];

- диапазон «выравнивания» [smoothing], который позволяет выравнивать графики и делать их более читаемыми. Например, автоматически предлагаемый стандартный индекс выравнивания «3» выравнивает данные в диапазоне трех лет вместо одного года. Для иллюстрации приведем пример выравнивания с индексом «0» (левый график) и «3» (правый график) при запросе на поиск трех словосочетании «непрерывное образование», «непрерывное обучение» и «непрерывное воспитание».

Рис. 1. Сравнение двух графиков с разными диапазонами выравнивания (на 10 августа 2019 г.)

Как видно из графиков, индекс выравнивания позволяет оптимизировать визуальную репрезентацию данных.

При определении временного промежутка для поиска установим диапазон с 1800 до 2008 г. (рис. 2) (цифровые данные за 2009 г. доступны как отдельная опция).

Рис. 2. Репрезентация «непрерывного образования» в цифровой коллекции Google Books (на 23 октября 2019 г.)

Как видно из графика, словосочетание «непрерывное образование» встречается в текстах в период с 1873 по 1879 г., 1887-1893 (точно установить даты можно наведением курсора на график, см. рис. 3), с 1900 г. до настоящего времени с пиками в 1990 г. и в 2004 гг.

Рис. 3. Уточнение дат на графике (на 23 октября 2019 г.)

Чтобы убедиться, что график отражает реальные данные, проверим каждое из первых десятилетии на графике начиная с 1870 г. Для этого необходимо навести курсор на любое из окон с датами под заголовком Search in Google Books под графиком (см. рис. 4) и, для удобства работы с данными, открыть его в новой вкладке. Разбивка на десятилетия позволяет конкретизировать поиск и сократить количество источников, попадающих в выборку, для более эффективного управления полученными данными.

Рис. 4. Окно поиска данных в Google Books

В открывшемся окне Google необходимо уточнить временной промежуток, в нашем случае это с 1870 по 1899 г. Для этого необходимо найти в меню настройку даты (см. рис. 5) и установить временной диапазон.

Рис. 5. Настройка временного промежутка для поиска

Первые результаты поиска показывают, что в цифровой коллекции на русском языке с 1870 по 1879 г. тексты, содержащие словосочетание «непрерывное образование», отсутствуют, соответственно график содержит ошибку (см. рис. 5).

В результате аналогичных запросов в промежутках с 1880 по 1989 г., с 1890 по 1899 г. были получены три ссылки на документы, опубликованные в 1895 г. Все три документа относятся к образованию и содержат аттрибутив «непрерывный», однако ни в одном из текстов не используется словосочетание «непрерывное образование» (см. рис. 6). Таким образом, поисковая машина Google Books может автоматически перестраивать запрос с поиска термина на поиск свободного словосочетания в случаях, когда термины в текстах искомого периода отсутствуют.

Рис. 6. Результаты «ручного» поиска словосочетания «непрерывное образование» в промежутке с 1880 по 1889 г.

В результате поискового запроса с 1910 по 1919 г. был обнаружен первый источник, содержащий словосочетание «непрерывное образование» (см. рис 7).

Рис. 7. Результаты «ручного» поиска словосочетания «непрерывное образование» в промежутке с 1910 по 1919 г.

Ссылка привела к полному тексту ежемесячного журнала «Морской сборник» (1919. № 1), на страницах которого был опубликован текст Николая Кладо под заголовком «Этюды по стратегии» (С. 117-143). На странице 138 непрерывное образование упоминается в следующем контексте:

«Обладая громадным военным и общим образованием, зная несколько языков, выписывая положительно все лучшие журналы Европы, этот великий человек рекомендовал широкое военное образование и своим подчиненным. “Генералу”, говорил Суворов, “необходимо непрерывное образование себя науками с помощью чтениев” - “Читай Юлия Цесаря Аннибала и Бонапарта” отвечал он на вопрос - как сделаться хорошим полководцем, указав, таким образом, тот же путь к познанию военного дела, какой впоследствии указал и Наполеон».

«Выбери себе героя», прибавлял он, «иди за ним, догоняй его, поравняйся с ним, обгони его. Я выбрал Кесаря» (Кладо Н. Этюды по стратегии // Морской сборник. 1919. № 1 (январь). С. 138).

В тексте цитаты присутствует ссылка на второе издание книги: Морозов Н. А. «Воспитание генерала и офицера как основа побед и поражений: Исторический очерк из жизни русской армии эпохи наполеоновских войн и времен плацпарада», напечатанное в Вильно в 1910 г. (первое издание вышло в 1909 г.).

Источник: https://otherreferats.allbest.ru/download/1306977/