Важным аспектом процесса поиска является формализация информационной потребности. Обычно эта формализация заключается в составлении списка ключевых понятий предметной области и определения семантических связей между ними, т.е. выявление набора понятий и терминов, характеризующих информационную потребность. Поиск должен начинаться всесторонним лексическим анализом искомой информации. Для этого из любого источника нужно получить прецедент подробного и грамотного описания исследуемого вопроса. Анализ этого описания включает следующие действия:
Удаление из текста-прецедента стоп-слов и определение частоты вхождения каждого термина.
Распределение терминов в порядке убывания частоты их вхождения в текст и выбор диапазона частот (посередине этого упорядоченного списка).
Выбор из диапазона списка 10-20 терминов (ключевых слов для поиска), которые и будут использоваться в поиске.
Составление запроса из ключевых слов в порядке их следования в списке терминов. Чтобы результат не исказился, следует изучить особенности синтаксиса запросов конкретной поисковой системы.
Студенты должны четко понять, чтобы увеличить процент полезной информации на выходе нужно использовать много ключевых слов. Практика так же показывает, что наиболее эффективной формой обучения поиску данных в Интернете является работа над заданиями, в которых нужна не информация сама по себе, а информация, рассматриваемая в контексте некоторой конкретной работы или жгучей потребности в данных определенного характера.
Методы информационного поиска
Более или менее серьезный подход к любой задаче начинается с анализа возможных методов ее решения. Поиск информации в Интернете может быть произведен по нескольким методам, значительно различающимся как по эффективности и качеству поиска, так и по типу извлекаемой информации. В ряде случаев приходится использовать весьма трудоемкие методы - результат того стоит.
Можно выделить следующие основные методы поиска информации в Интернете, которые, в зависимости от целей и задач ищущего, используются по отдельности или в комбинации друг с другом:
Непосредственный поиск с использованием гипертекстовых ссылок;
Поскольку все сайты в пространстве WWW фактически оказываются связанными между собой, поиск информации может быть произведен путем последовательного просмотра связанных страниц с помощью браузера.
Хотя этот полностью ручной метод поиска выглядит полным анахронизмом в Сети, содержащей более 60 млн узлов, "ручной" просмотр Web-страниц часто оказывается единственно возможным на заключительных этапах информационного поиска, когда механическое "копание" уступает место более глубокому анализу. Использование каталогов, классифицированных и тематических списков и всевозможных небольших справочников также относится к этому виду поиска.
Использование поисковых машин;
Сегодня этот метод является одним из основных и фактически единственным при проведении предварительного поиска. Результатом последнего может являться список ресурсов Cети, подлежащих детальному рассмотрению.
Как правило, применение поисковых машин основано на использовании ключевых слов, которые передаются поисковым серверам в качестве аргументов поиска: что искать. Если делать все правильно, то формирование списка ключевых слов требует предварительной работы по составлению тезауруса.
Поиск с применением специальных средств;
Этот полностью автоматизированный метод может оказаться весьма эффективным для проведения первичного поиска.
Одна из технологий этого метода основана на применении специализированных программ – спайдеров, которые в автоматическом режиме просматривают Web-страницы, отыскивая на них искомую информацию. Фактически это автоматизированный вариант просмотра с помощью гипертекстовых ссылок, описанный выше (поисковые машины для построения своих индексных таблиц используют похожие методы). Нет нужды говорить, что результаты автоматического поиска обязательно требуют последующей обработки.
Применение данного метода целесообразно, если использование поисковых машин не может дать необходимых результатов (например, в силу нестандартности запроса, который не может быть адекватно задан существующими средствами поисковых машин). В ряде случаев этот метод может быть очень эффективен.
Выбор между использованием спайдера или поисковых серверов являет собой вариант классического выбора между применением универсальных или специализированных средств.
Анализ новых ресурсов.
Поиск по новообразованным ресурсам может оказаться необходимым при проведении повторных циклов поиска, поиска наиболее свежей информации или для анализа тенденций развития объекта исследования в динамике.
Другой возможной причиной может явиться то, что большинство поисковых машин обновляет свои индексы со значительной задержкой, вызванной гигантскими объемами обрабатываемых данных, и эта задержка обычно тем больше, чем менее популярна интересующая вас тема. Это соображение может оказаться весьма существенным при проведении поиска в узкоспециальной предметной области.
Технология поиска с использованием поисковых машин
Поскольку проведение информационного поиска преследует практические цели – маркетинговые, производственные, сугубо утилитарные и тому подобные, – практическая ценность информационного ресурса может зависеть и от географического расположения соответствующего источника. Поэтому перед началом информационного поиска необходимо определить географический регион поиска
Для эффективного использования поисковых серверов необходим список ключевых слов, организованный с учетом семантических отношений между ними, т.е. тезаурус. При составлении тезауруса необходимо предусмотреть обработку синонимов, омонимов и морфологических вариаций ключевых слов.
Использование законов Зипфа
Число, показывающее сколько раз встречается слово в тексте, называется частотой вхождения слова. Если расположить частоты по мере убывания и пронумеровать, то порядковый номер частоты называется ранг частоты. Вероятность обнаружения слова в тексте = частота вхождения слова / число слов в тексте. Зипф нашел, что если умножить вероятность обнаружения слова в тексте на ранг частоты, то получившаяся величина приблизительно постоянна для всех текстов на одном языке:
С = (частота вхождения слов X ранг частоты) / число слов
Это значит, что график зависимости ранга от частоты - равносторонняя гипербола.
Зипф также установил, что зависимость количества слов с данной частотой от частоты - также гипербола и постоянная для всех текстов в пределах одного языка.
Что можно извлечь из этих законов? Исследования вышеуказанных зависимостей для различных текстов показали, что наиболее значимые слова текста лежат в средней части диаграммы, так как слова с максимальной частотой как правило являются предлогами, частицами, местоимениями, в английском языке - артиклями (так называемые "стоп-слова"), а редко встречающиеся слова в большинстве случаев не имеют решающего значения. Основываясь на этой закономерности, можно предложить следующую методику.
Составление списка ключевых слов
Правильный набор ключевых слов имеет определяющее значение для оптимального поиска информации. К примеру, задав поисковой машине в качестве ключевого слова "МАРП", мы получим список документов, в которых встречается эта аббревиатура (Московское Агентство по Развитию Предпринимательства). Но если нас интересуют документы по более широкой теме, например: развитие предпринимательства, и мы сформируем простой запрос из этих двух слов, то поисковая машина выдаст нам список из сотен тысяч наименований, ориентироваться в котором будет весьма непросто.
Поэтому для составления оптимального набора ключевых слов используют процедуру, основанную на применении законов Зипфа, которая заключается в следующем: берут любой текст-источник, близкий к искомой теме, т.е. "образец", и анализируют его, выделяя значимые слова. В качестве текста-источника может служить книга, статья, Web-страница, любой другой документ. Анализ текста производится таким образом:
Удаление из текста стоп-слов.
Вычисление частоты вхождения каждого слова и составление списка, в котором слова расположены в порядке убывания их частоты.
Выбор диапазона частот, лежащего в середине списка, и отбор из этого диапазона слов, наиболее полно соответствующих смыслу текста.
Составление запроса к поисковой машине в форме перечисления отобранных таким образом ключевых слов, связанных логическим оператором ИЛИ (OR). Запрос в таком виде позволяет обнаружить тексты, в которых встречается хотя бы одно из перечисленных слов.
Отбор поисковых машин
Число документов, полученных в результате поиска по этому запросу, может быть огромно. Однако, благодаря ранжированию документов (расположению их в порядке убывания частоты вхождения слов запроса в документ), применяемому в большинстве поисковых машин, на первых страницах списка практически все документы окажутся релевантными, причем документ-источник может находиться далеко от начала.
Более адекватной представляется структура тезауруса в виде так называемых семантических срезов, где для каждого основного термина отдельно строится таблица сопутствующих слов и слов шумовых (которые не должны встречаться в источнике), - некоторые поисковые машины (AltaVista) позволяют это использовать. Таким образом, вместо единой иерархической структуры терминов мы получаем пакет таблиц, которые могут расширяться и модифицироваться отдельно.
Устанавливается последовательность использования поисковых машин в соответствии с убыванием ожидаемой эффективности поиска с применением каждой машины.
Всего известно около 180 поисковых серверов, различающихся по регионам охвата, принципам проведения поиска (а следовательно, по входному языку и характеру воспринимаемых запросов), объему индексной базы, скорости обновления информации, способности искать "нестандартную" информацию и тому подобное. Основными критериями выбора поисковых серверов являются объем индексной базы сервера и степень развитости самой поисковой машины, то есть уровень сложности воспринимаемых ею запросов.
Составление и выполнение запросов к поисковым машинам
Это наиболее сложный и трудоемкий этап, связанный с обработкой большого количества информации (в основном шумовой). На основе тезауруса формируются запросы к выбранным поисковым серверам, после чего возможно уточнение запроса с целью отсечения очевидно нерелевантной информации. Затем производится отбор ресурсов, начиная с наиболее интересных, с точки зрения целей поиска. Данные с ресурсов, признанных релевантными, собираются для последующего анализа.
Формирование запросов
Как формат, так и семантика запросов варьируются в зависимости от применяемой поисковой машины и конкретной предметной области. Запросы составляются так, чтобы область поиска была максимально конкретизирована и сужена.
Предпочтение отдается использованию нескольких узких запросов по сравнению с одним расширенным. В общем случае для каждого основного понятия из тезауруса готовится отдельный пакет запросов. Так же производится пробная реализация запросов - как для уточнения и пополнения тезауруса, так и с целью отсечения шумовой информации.
Языки запроса различных машин поиска в основном являются сочетанием следующих функций:
Операторы булевой алгебры AND, OR, NOT:
AND (И) - осуществляется поиск документов, содержащих все термины, соединенные данным оператором;
OR (ИЛИ) - искомый текст должен содержать хотя бы один из терминов, соединенных данным оператором;
NOT (НЕ) - поиск документов, в тексте которых отсутствуют термины, следующие за данным оператором.
Операторы расстояния - ограничивают порядок следования и расстояния между словами, например:
NEAR - второй термин должен находиться на расстоянии от первого, не превышающем определенного числа слов;
FOLLOWED BY - термины следуют в заданном порядке;
ADJ - термины, соединенные оператором, являются смежными.
Возможность усечения терминов – использование символа " * " вместо окончания термина позволяет включить в искомый список все слова, производные от его начальной части (шаблона).
Учет морфологии языка – машина автоматически учитывает все формы данного термина, возможные в языке, на котором ведется поиск.
Возможность поиска по словосочетанию, фразе.
Ограничение поиска элементом документа (слова запроса должны находиться именно в заголовке, первом абзаце, ссылках и т.д.).
Ограничения по дате опубликования документа.
Ограничения на количество совпадений терминов.
Возможность поиска графических изображений.
Чувствительность к строчным и прописным буквам.
Результат запроса (список ссылок) обрабатывается в два этапа. На первом этапе производится отсечение очевидно нерелевантных источников, попавших в выборку в силу несовершенства поисковой машины или недостаточной "интеллектуальности" запроса. Параллельно проводится семантический анализ, имеющий целью уточнение тезауруса для модификации последующих запросов. Дальнейшая обработка производится путем последовательного обращения на каждый из найденных ресурсов и анализа находящейся там информации.
Проблемы, возникающие в процессе поиска
Одна из проблем является чисто методологической. Для проведения эффективного поиска мы заинтересованы в одновременном решении двух противоположных задач:
увеличение охвата с целью извлечения максимального количества значимой информации;
уменьшение охвата с целью минимизации шумовой информации.
Нетрудно видеть, что одновременно осуществить это довольно сложно, хотя зачастую все-таки возможно. Один из методов, если поисковая машина позволяет, - это введение явных ограничений (запрещенных слов). Другой состоит в правильном формировании запросов, в частности, в предпочтении нескольких конкретизированных запросов одному общему. К сожалению, весьма ограниченный входной язык большинства машин не оставляет особенного простора для творчества в этом направлении.
Другая проблема – многовариантность человеческого языка. Если в английском языке некоторые слова имеют множество различных значений, то русский отличается богатством морфологических вариаций слов, а для полноты поиска необходимо учитывать еще и синонимы.
Часто в области российского Интернета возникают чисто технические трудности из-за различных кодировок информации. Российские поисковые машины распознают кодировки пользователя и искомого сайта, но совместить их удается не всегда.
Еще одна особенность русскоязычной части сети - ее нестабильность. Постоянно изменяются адреса и структура сайтов, они появляются и исчезают, и поисковые машины не успевают обновлять свои базы индексированных данных, поэтому значительная часть списка документов, выданного вам машиной, может оказаться недоступной. Появление в сентябре 1997 г. системы Яndex-Web, обновляющей свои данные раз в неделю, обозначило качественный скачок вперед в решении этой проблемы.
Переписка между отдельными учащимися (например, знаменитый проект «Тандем» по изучению иностранных языков, когда в пару объединяются два носителя разных языков, чьей целью является овладение языком собеседника).
Обсуждение заданной темы или вопроса (в асинхронной телеконференции или форуме). При этом следует учить студентов аргументированию собственной позиции.
Ролевая игра, которую ведет учащийся. Один из учащихся ведет виртуальные встречи с другими учащимися, скрывшись за маской выдуманного персонажа (Ломоносов, Айвазовский,Путин и т. д.). При этом учащиеся могут задавать ему самые разные вопросы, и чтобы ответить на них, ведущему приходится много читать и разбираться в обсуждаемой теме. Данную игру можно проводить как по электронной почте, так и в чате или видеоконференции.
Ролевая игра, которую ведет преподаватель. В качестве примера приведем один из сайтов в Квебеке (Канада). Преподаватели организовали виртуальную деревню конца XIX в. Каждый из них взял на себя разные роли — кузнеца, доктора, почтальона и т. п. Учащиеся, чтобы пообщаться с данными персонажами, должны хорошо представлять себе, какой была жизнь в ту эпоху, а для этого им придется прочитать немало книг.
Виртуальная встреча — учащиеся могут обратиться с вопросами к какой-либо известной личности. Например, к нобелевскому лауреату. Сообщение о встрече сопровождается досье следующего содержания:
как участвовать во встрече;
краткая биография приглашенного;
публикация одного из его произведений (например, статьи);
как будет происходить встреча.
Виртуальные встречи можно проводить с помощью чата или видеоконференции.
Консультации. Могут проводиться по электронной почте, иногда можно в виде чата. В этом случае преподаватель назначает регулярное время, когда он будет в сети, например, по средам с 18.00 до 19.00.
Тематический чат. Он может иметь различные сценарии проведения, но должен отвечать следующим требованиям: до чата рассылается объявление о дате и времени его проведении. Студенты заходят в чат под своими реальными именами и фамилиями.
Присутствие на расстоянии. Видеоконференции могут дать студентам возможность наблюдать за работой лунохода, присутствовать на экспериментальных медицинских операциях и т. п. Например, в ноябре 1999 г. было осуществлено первое заседание арбитражного суда Челябинской области, на котором обвиняемый присутствовал в режиме видеоконференции (в этот момент он находился в местах заключения). За ходом данного заседания могли наблюдать студенты юридического факультета Южно-Уральского государственного университета.
В ходе дистанционного курса возможны:
создание тематических веб-страниц индивидуально и в минигруппах (совместное творчество – одна из наиболее популярных используемых в сети моделей. Учащиеся пишут совместные тексты, создают учебные пособия и т. п., работая в минигруппах и предоставляя всем желающим возможность увидеть и оценить их творчество);
создание веб-квестов для работы по теме и размещение их на сайте курса. Например, огромной популярностью в мире пользуется конкурс ThinkQuest, где учащимся разных стран предлагается создать образовательные странички на любую интересующую их тему.
Главное условие — читатели данных страниц должны получить полное представление о затронутой проблеме;
публикация курсовых и дипломных работ студентов на сайте;
создание банка данных об инженерных, литературных и т. п. находках студентов, банка игр и упражнений;
конкурсы — элемент состязательности дает дополнительную мотивацию для выполнения задания (например, сетевая викторина). В сети публикуются вопросы, на которые нужно ответить за определенный срок (например, неделю). Оцениваются эрудированность и грамотность изложения, а также оформление ответов;
социальные акции — они дают возможность оказания реальной помощи кому-то. Например, в Бельгии студентами факультета сурдо и тифлопедагогики университета Брюсселя была проведена акция поддержки детей. С помощью сетей они организовали сбор средств, которые были перечислены в детские дома для слабослышащих детей;
создание в сети фотосериалов. Современные цифровые фотоаппараты помогут создать серию изображений на заданную тему.