Статья: Корпусная грамотность как малоизученная проблема: содержание и специфика понятия

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

КОРПУСНАЯ ГРАМОТНОСТЬ КАК МАЛОИЗУЧЕННАЯ ПРОБЛЕМА: СОДЕРЖАНИЕ И СПЕЦИФИКА ПОНЯТИЯ

Оксана Шиллова

Анотація

Висвітлено проблему так званої «корпусної грамотності» користувачів мовних корпусів. Вивчено історію питання переважно на матеріалі англомовної, російськомовної та чеськомовної наукової літератури. Проаналізовано зміст, межі і специфіку поняття «корпусна грамотність», що з'явилося в науковій літературі на початку ХХІ століття. На основі критичного аналізу й узагальнення наукових джерел запропоновано дефініцію поняття «корпусна грамотність», встановлено чинники, що визначають зміст і специфіку цього поняття при його застосуванні в різних галузях роботи з мовою (викладання мови, перекладацька діяльність, дослідницька діяльність та ін.). Порушено питання про корпусну грамотність лінгвістів, що належать до інших, ніж корпусна лінгвістика, мовознавчих напрямів.

Ключові слова: користувач корпусу, корпусна грамотність, корпусна компетенція, мовний корпус.

Annotation

CORPUS LITERACY AS AN UNDERRESEARCHED PROBLEM: THE CONTENT AND SPECIFICITY OF THE CONCEPT Aksana Schillova

Czech Language Institute of the Czech Academy of Sciences, Prague, Czech Republic.

Background: The rapid development of information technologies and corpus linguistics in our century has made language corpora accessible to a wide range of users. Corpora are constantly growing and improving and many of them are free available on the Internet today. Nevertheless, courses on corpus linguistics and on working with corpora still have not been universally integrated into the university core curricula of philological disciplines. Under these circumstances, it is relevant to discuss the question of the so-called «corpus literacy» which reflects the correspondence (or noncorrespondence) between users' competencies and the requirements that must be met when using corpora in research, teaching, translation, or any other work concerned with language data. In the present paper, the corpus literacy is considered an essential condition for the quality and effectiveness of the use of language corpora.

Purpose: The article aims a) to summarize and critically analyse literature on the corpus literacy, mainly in English, Russian, and Czech, b) to consider the content of the concept of «corpus literacy», its specifics and boundaries, c) to establish the factors influencing its content, d) to deduce the definition of this concept based on the generalizations made. A sub-purpose of the article is to raise the issue of corpus literacy among linguists of other fields than corpus linguistics.

Results: Following conclusions can be drawn from the present theoretical study: 1) the corpus literacy is an underresearched and underdiscussed topic as far as the Russian a Czech contexts are concerned. This issue has been actively discussed in the English language literature since the early 2000s (apparently for the first time in Mukherjee's works), however, mainly in the context of problems related to integrating corpora into practice teaching English as a foreign language in different countries; 2) the corpus literacy does not arise by itself; it should be purposefully developed; 3) the corpus literacy should be developed both by future and current language specialists; 4) the issue of the corpus literacy should be addressed at universities by integrating corresponding courses into philological core curricula, organizing courses for in-service specialists, compiling corresponding study guides, etc.; 5) the corpus literacy is a generalized concept that has many specific implementations, the volume and content of which are influenced by various interrelated factors; in particular, what users use the corpora, for what purpose, which corpus resources are used; 6) the corpus literacy can be defined as a set of general and specific knowledge, skills, and abilities developed by certain corpus users within a certain educational process in order to effectively use a certain corpus (corpora) in a certain occupation.

Discussion: The corpus literacy is a vast area for research and the theoretical investigation in this area is intended to lay theoretical foundations for the preparation of textbooks on the use of language corpora by non-specialists (i. e., by non-corpus linguists). The following issues are to be considered in future studies: sources and ways of developing the corpus literacy, the concept of the efficiency of the corpora use (what is it and how to evaluate or measure it), the content and boundaries of general and specific components of the corpus literacy, the state of the corpus literacy among linguists of other fields than corpus linguistics (in the Czech context).

Keywords: language corpus, corpus literacy, corpus competence, corpus user.

Введение

Возникновение множества общедоступных языковых корпусов Поскольку литературы по корпусной лингвистике очень много (на английском, чешском, русском и других языках), существует много дефиниций понятия «языковой корпус». Здесь мы приведем одну из них (выделения курсивом принадлежит авторам цитаты). «Под лингвистическим, или языковым, корпусом текстов (или обычно просто корпусом текстов) понимается большой, представленный в машиночитаемом формате, унифицированный, структурированный, размеченный, филологически компетентный массив языковых данных, предназначенный для решения конкретных лингвистических задач» (Захаров - Богданова 2020: 11). в разных странах для разных языков является характерной чертой нашего времени. Бурное развитие информационных технологий, Интернет и компьютер «в каждом доме» позволили корпусной лингвистике М. Копотев дает следующее определение корпусной лингвистики: «Корпусная лингвистика (англ. corpus linguistics) - 1) раздел компьютерной лингвистики, связанный с созданием корпусов; 2) раздел языкознания, использующий корпуса текстов для анализа данных с помощью корпусных методов» (Копотев 2014: 198-199). Ф. Чермак более краток: корпусная лингвистика - это «наука о корпусе и работе с ним, а также новая одноименная дисциплина» (Cermak 2017: 10), перевод с чешского наш. - О. Ш. Встречаются и широкие определения: «... корпусная лингвистика - это не направление, связанное с определенным ярусом языковой системы (как фонетика, лексикология или синтаксис), или определенной теорией (как функциональная или генеративная грамматика), или аспектом анализа (формальным, семантическим или прагматическим). Это скорее идеология, согласно которой результаты лингвистического исследования должны опираться прежде всего на анализ текстов (устных или письменных), а не на интуицию исследователя или информанта» (Лаврентьев 2004: 121). В целом, существует столько определений корпусной лингвистики, что дефиниционный анализ данного понятия мог бы стать содержанием отдельной публикации. Ср., В. Захаров считает корпусную лингвистику «феноменом» (Захаров 2016: 150) и характеризует сущность данного феномена следующим образом: «Корпусная лингвистика не является монолитным набором категорий или методов, это некое гетерогенное поле, внутри которого варьируются различные подходы к созданию и использованию корпусов» (Захаров 2016: 150). Терминологическую расплывчатость, характерную для корпусной лингвистики как дисциплины, некоторые авторы связывают также с «молодостью» данного научного направления (см., напр., Ганиева 2007: 104)., которая еще 20-30 лет назад была делом узкого круга специалистов, стать одним из флагманов современной науки о языке, а вместе с тем горячей темой для споров и обсуждений в лингвистических сообществах См., например, любопытную научную полемику между энтузиастами и реалистами в отношении языковых корпусов, которая параллельно имела место быть в русской (ср. Перцов 2006; Плунгян 2008; Шмелев 2010) и чешской лингвистике (ср. Cech 2014; Sticha 2015; Chromy 2017)..

На главной странице сайта Национального корпуса русского языка (далее - НКРЯ) www.ruscorpora.ru в рубрике «другие корпуса» представлен список корпусов русского языка, а также других языков (славянских, других индоевропейских, неиндоевропейских, искусственных), с комментарием об их доступности («доступен для онлайн-поиска», «доступен для скачивания», «требуется регистрация» и т. п.) и прямыми ссылками на интернет-страницы соответствующих корпусных проектов, который насчитывает около 150 корпусов (https://ruscorpora.ru/new/corpora-other.html, дата обращения: 13.09.2021). Михаил Копотев, ссы - лаясь на международные специализированные каталоги CLARIN (www.clarin.eu) и ELRA (www.elra.info), говорит о существовании более чем трех тысяч языко - вых корпусов в мире (Копотев 2014: 23).

Чешский национальный корпус (ЧНК), активным пользователем которого является автор настоящей статьи, считается «одним из наиболее известных» (Захаров - Богданова 2020: 90) и оценивается специалистами как корпусный ресурс мирового уровня - по объему и вариативности охваченного языкового материала, а также по технической оснащенности самого корпуса, который отличается высокоразвитым инструментарием поиска и статистического анализа языковых данных (Резникова 2009: 403 и след.; Hebal-Jezierska 2014a: 29) На русском языке об особенностях ЧНК и возможностях, которые данный ресурс предоставляет своим пользователям, можно прочитать, например, в статьях московского богемиста Андрея Изотова (Изотов 2013; Изотов 2015; Изотов 2018 и др.). См. также сайт ЧНК: www.korpus.cz.

Корпуса предоставляют в распоряжение пользователей беспрецендентное количество языковых данных, подготовленных усилиями специалистов по корпусной лингвистике к использованию в лингвистических исследованиях. Каждый общедоступный корпус имеет свой сайт в Интернете с определенным дизайном, структурой и содержанием, с определенной поисковой машиной (или, как говорят специалисты, корпусным менеджером), предоставляющей различные возможности поиска (по словоформе, лексеме, грамматическим признакам, по текстам определенных жанров, годов издания и т. п.), а также различные функции по статистической обработке данных (частотная дистрибуция, меры ассоциации и т. д.). Языковые корпуса являются общедоступным достижением современного языкознания, и с этим трудно не согласиться.

Однако в то время как корпусная лингвистика набирает обороты и появляются новые корпуса все больших и больших объемов Интернет-корпуса, насчитывающие миллиарды словоупотреблений, называются корпусами третьего поколения и возникли относительно недавно, ср.: «TenTen corpora» (Jakubicek et al. 2013) и «Генеральный интернеткорпус русского языка» (ГИКРЯ) (Беликов и др. 2013) стали доступными с 2013 г., интернет-корпуса «Aranea» - c 2014 г. (Benko 2014), интернет-корпус чешского языка «ONLINE» в рамках ЧНК был обнародован в 2020 г. (Cvrcek 2020). Корпуса второго поколения (размеченные корпуса с объемом 100 млн слов и больше) возникали с 90-х гг. 20-го века. Образцом послужил первый такой корпус - British National Corpus (https://www.english-corpora.org/bnc/). Корпусами первого поколения считаются одномиллионные корпуса-первопроходцы, которые еще не содержали разметки, как Брауновский корпус (A Standard Corpus of Present-Day Edited American English, for use with Digital Computers (Brown). 1964, 1971, 1979. Compiled by W. N. Francis and H. Kucera. Brown University.

Providence, Rhode Island. Freely available at: https://www.sketchengine.eu/brown-corpus/) или Ланкастерский корпус (University of Oxford, Lancaster-Oslo-Bergen corpus of modem English (LOB): [tagged, horizontal format] / Stig Johansson, Oxford Text Archive, http://hdl.handle.net/20.500.12024/0167). О трех поколениях корпусов см., например, в (Cvrcek et al. 2017)., а корпусные технологии беспрерывно совершенствуются (см., например, об этом в сноске 10), остается нерешенной и даже малообсуждаемой проблема подготовленности адресата кор - пусов, в первую очередь лингвистов иных направлений, чем корпусная лингвис - тика, к использованию ими в их исследовательской деятельности данных высокотехнологичных ресурсов.

Тот очевидный факт, что работать с корпусами неподготовленным пользователям трудно, а также тот факт, что курсы по корпусной лингвистике до сих пор не являются повсеместно внедренными в вузовские программы филологических специальностей Например, в alma mater Чешского национального корпуса - на Философском факультете Карлова университета в Праге - в актуальных учебных программах по русистике и украинистике (бакалаврских и магистерских) предметы, связанные с корпусной лингвистикой, отсутствуют вовсе. Что касается богемистики, в трехлетней бакалаврской программе специальности «Чешский язык и литература» присутствует лишь один обязательный курс «Введение в работу с языковыми корпусами», на который отводится всего 26 часов в течение одного семестра. В обязательной программе двухлетнего магистерского обучения по специальности «Чешский язык и литература» спецкурсов по корпусной лингвистике уже нет, см. учебные планы специальностей на сайте факультета по адресу: https://www.ff.cuni.cz/studium/studijni-obory-plany/studijni-plany/ (дата обращения: 05.10.2021).

В данных условиях трудно представить, каким именно образом у студентов могут сформироваться знания, умения и навыки в области использования корпусов в лингвистических исследованиях. Следующий проблемный вопрос: откуда взяться этим знаниям и умениям у самих преподавателей, если большинство из них получали образование еще в «докорпусную эпоху»?, и стали главными импульсами для возникновения настоящей статьи.

Основные сведения о настоящей статье

1.1. Теоретические предпосылки статьи. Проблема подготовленности пользователей к работе с корпусами, которая в данной статье рассматривается как проблема так называемой «корпусной грамотности» пользователей, является малоизученной темой, поэтому анализу состояния и истории данного вопроса мы посвящаем отдельную главу, см. главу 2 «Корпусная грамотность: Состояние вопроса».

1.2. Объект и предмет исследования. Объектом рассмотрения в настоящей статье является понятие о «корпусной грамотности» пользователей, отражающее соответствие или несоотвествие их компетенций тем требованиям, которые несет собой использование языкового корпуса в исследовательской, педагогической, переводческой или какой-либо другой деятельности, сопряженной с языковыми данными. Предметом анализа является содержание и специфика понятия «корпусная грамотность».

1.3. Цели и задачи работы. Главной целью настоящей статьи является исследование и освещение понятия о корпусной грамотности корпусных пользователей как явлении, неотъемлемо сопровождающем функционирование языковых корпусов. Частной целью данной работы является поднять и рассмотреть вопрос о корпусной грамотности среди одной из категорий пользователей, а именно среди лингвистов, представляющих иные области языкознания, чем корпусная лингвистика.

Для реализации поставленных целей требуется решить следующие задачи:

1) найти и рассмотреть научную литературу, в которой поднимается и освещается проблема корпусной грамотности;

2) обобщить опыт исследователей, которые занимались изучением и обсуждением данной проблемы, и определить малоисследованные или неисследованные ее аспекты;

3) обсудить содержание понятия «корпусная грамотность», его специфику, границы, и уточнить составляющие данного понятия в случае его применения по отношению к лингвистам иных направлений, чем корпусная лингвистика, как корпусным пользователям; вывести дефиницию данного понятия на основе сделанных обобщений.

1.4. Источники исследования и методы их анализа. Поскольку настоящее исследование носит теоретический характер, его источниками выступают прежде всего научные публикации по исследуемой теме, а главным методом работы является критический анализ и обобщение найденных источников. Для поиска научной литературы, в которой освещается или по крайней мере затрагивается тема корпусной грамотности, мы использовали следующие общедоступные онлайн-ресурсы (здесь и далее в данном пункте статьи дата последнего обращения: 1.10.2021):

1) eLIBRARY.ru - крупнейшая в России научная электронная библиотека, интегрированная с Российским индексом научного цитирования (РИНЦ), доступная в Интернете по адресу: www.elibrary.ru;

2) Google Scholar - онлайн-инструмент поиска научных публикаций и их цитирований, доступный в Интернете по адресу: https://scholar.google.com/;

3) Biblio - репозиторий научных публикаций, основанных на материалах Чешского национального корпуса (ЧНК), доступный на сайте ЧНК по адресу: https://www.korpus.cz/biblio.

Источник: https://otherreferats.allbest.ru/download/1389340/