Материал: Мировые информационные образовательные ресурсы. учебное пособие. Канин Д.М., Федорков Е.Д

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Поиск в нечетких множествах. При этом типе поиска весь массив документов описывается как набор нечетких множеств терминов. Каждый термин определяет некую монотонную функцию принадлежности документам документального массива. Когда запрашивается AND, то это интерпретируется как минимум из двух функций, соответствующих терминам запросов, OR - как максимум, NOT - как 1-<значение функции>. В соответствии с полученными значениями результат поиска также ранжируется, как и в случае с поиском по мерам близости. Следует сразу сказать, что этот метод поиска используется только' в исследовательских системах и распространен крайне ограничено.

Пороговые модели. Как было видно из предыдущего изложения, на конечном этапе поиска выборка найденных документов ранжируется. Но, совершенно очевидно, что меры близости или поиск в нечетких множествах приводит к ранжированию всего массива документов в базе данных. Современные информационно-поисковые системы Internet имеют базы данных только индексов, занимающие террабайты. Ранжировать целиком такие массивы – это просто безумная затея. Поэтому применяются пороговые модели, которые задают пороговые значения для документов, выдаваемых пользователю.

Кластерная модель и Вероятностная модель информационного поиска. В кластерной модели может использоваться два подхода. Первый заключается в том, что массив заранее разбивается на подмножества документов и при поиске высчитывается близость запроса некоторому подмножеству. В другом подходе кластер "накручивается" вокруг запроса и ближайших к нему терминов. Наиболее часто эта модель применяется в системах, уточняющих запрос по релевантности найденных документов. При вероятностной модели вычисляется вероятность принадлежности документа классу релевантных запросу документов. При этом используется вероятность принадлежности терминов запроса каждому из документов базы данных.

Коррекция запроса по релевантности. Многие системы применяют механизм коррекции запроса по релевантности. Это означает, что процедура поиска носит интерактивный и итеративный характер. После проведения первичного поиска пользователь отмечает из всего списка найденных документов релевантные. На следующие итерации система расширяет/уточняет запрос пользователя терминами из этих документов и снова выполняет поиск. Так продолжается до тех пор пока пользователь не сочтет, что лучшего результата, чем он уже имеет добиться не удастся. Коррекция запроса по релевантности - это достаточно широко внедренный способ уточнения запросов.

6.3. Информационно-поисковые системы Internet

При описании и классификации информационно-поисковых систем ставилась задача проанализировать наиболее популярные и наиболее типичные системы, которыми пользуются в Сети.

Lycos

Как и большинство систем, Lycos дает возможность использовать простой запрос и более изощренный метод поиска. В простом запросе в качестве поискового критерия вводится предложение на естественном языке. Lycos производит нормализацию запроса, удаляя из него так называемые stop-слова, и только после этого приступает к его выполнению. Почти сразу выдается информация о числе документов на каждое слово, а уже позже и список ссылок на формально релевантные документы. В списке напротив каждого документа указывается его мера близости запросу, число слов из запроса, которые попали в документ и оценочная мера близости, которая может быть больше или меньше формально вычисленной. На апрель 1996 года в Lycos не был реализован булевый поиск, такие планы были анонсированы. Последнее предложение подразумевает только то, что нельзя вводить эти операторы в строке вместе с терминами, но использовать логику через систему меню Lycos позволяет. Последнее относится к расширенной форме запроса, который предназначен для использования искушенными пользователями системы, которые уже научились пользоваться этим механизмом. Таким образом мы видим, что Lycos относится к системе с языком запросов типа "Like this", но предполагается его расширения и на другие способы организации поисковых предписаний.

AltaVista

Наиболее интересным с точки зрения информационно-поискового языка в AltaVista является возможность расширенного поиска. Здесь стоит сразу выделить, что в отличии от многих систем AltaVista поддерживает одноместный оператор NOT. Кроме этого есть еще и оператор NEAR, который реализует возможность контекстного поиска, когда термины должны располагаться рядом в тексте документа. AltaVista разрешает поиск по ключевым фразам, при этом она имеет довольно большой словарь этих фраз. Кроме всего прочего, при поиске.в AltaVista можно задать имя поля где должно встретиться слово. Это может быть гипертекстовая ссылка, applet, название образа, заголовок и ряд других полей. К сожалению, подробно процедура ранжирования в документации по системе не описана, но сказано, что ранжирование применяется как при простом поиске, так и при расширенном запросе. Реально эту систему можно отнести к системе с расширенным булевым поиском.

Yahoo

Данная система появилась в сети одной из первых, и поэтому говорить будем о сегодняшнем состоянии Yahoo, а не о состоянии годовой давности. В настоящее время Yahoo сотрудничает со многими производителями средств информационного поиска и на различных ее серверах используется различное программное обеспечение. На мой взгляд, это самая незатейливая информационная служба, которая сосредоточилась на информации о Web как таковой. ИПЯ Yahoo достаточно прост: все слова следует вводить через пробел и они соединяются либо AND, либо OR. При выдаче не выдается степени соответствия документа запросу, а только подчеркиваются слова из запроса, которые встретились в документе. При этом не производится нормализация лексики и не проводится анализ на "общие" слова. Хорошие результаты поиска получаются только тогда, когда пользователь знает, что информация в базе данных Yahoo точно есть. Ранжирование производится по числу терминов запроса в документе. Yahoo относится к классу простых традиционных систем с ограниченными возможностями поиска.

OpenText

Информационная система OpenText представляет из себя самый коммерциализированный информационный продукт в сети. Все описания больше напоминают рекламу, чем реальное руководство по работе. Система позволяет провести поиск с использованием логических коннекторов, размер запроса ограничен тремя терминами или фразами. В данном случае речь идет о расширенном поиске. При выдаче результатов поиска сообщается степень соответствия документа запросу и размер документа. Система позволяет также улучшить результаты поиска в стиле традиционного булевого поиска. OpenText можно было бы отнести без сомнения к разряду традиционных информационно-поисковых систем, если бы не механизм ранжирования.

InfoSeek

Система InfoSeek обладает довольно развитым информационно-поисковым языком, который позволяет не просто указывать какие термины должны встречаться в документах, но и своеобразно взвешивать их. Достигается это при помощи специальных знаков "+" - термин обязан быть в документе, "-" - термин обязан отсутствовать в документе. Кроме этого InfoSeek позволяет проводит то, что называется контекстным поиском. Это значит, что используя специальную форму запроса можно потребовать последовательной совместной встречаемости слов. Кроме этого можно указать, что некоторые слова должны совместно встречаться не только в одном документе, а даже в отдельном параграфе или заголовке. Есть возможность и указания ключевых фраз. Ключевая фраза от последовательной встречаемости отличается тем, что фраза всегда ищется как единое целое, а при последовательной встречаемости слова могут стоять рядом, но в произвольном порядке. Ранжирование при выдаче осуществляется по числу терминов запроса в документе, по числу фраз запроса в документе, за вычетом общих слов. Все эти факторы используются как вложенные процедуры. Подводя краткое резюме можно сказать, что InfoSeek относится к традиционным системам с элементом взвешивания терминов при поиске.

WAIS

WAIS является одной из наиболее изощренных поисковых систем Internet. В отличии от многих поисковых машин, ИПЯ системы позволяет строить не только вложенные булевые запросы, считать формальную релевантность по различным мерам близости, взвешивать термины запроса и документа, но и осуществлять коррекцию запроса по релевантности. Система также позволяет использовать усечение терминов, разбиение документов на поля и ведение распределенных индексов. Не случайно именно эта система была выбрана в качестве основной поисковой машины для реализации энциклопедии "Британика" на Internet.

Яндекс

Несомненным лидером среди ИПС Рунета по величине индекса цитирования (числу обращений), исходя из статистических данных, является система Яндекс. В окне каталога Яндекс видны два уровня предложенной разработчиками данной ИПС классификации ресурсов Интернет по типу содержащейся в них информации (Справки, Товары и услуги, Публикации и пр.). Запрос также можно уточнить по региону, которому принадлежит искомый ресурс. На первом уровне тематического дерева каталога Яндекса десять тем, а число уровней в глубину не превышает четырех. Помимо тем, в каталоге имеется ряд дополнительных признаков (фасет), позволяющих уточнить характер ресурсов, которые пользователь хочет увидеть в тематических категориях. Эти нетематические признаки характеризуют ресурсы по региону, сектору экономики, степени достоверности (источнику) информации, ее потенциальной аудитории (адресату информации), жанру (художественная литература, научно-техническая литература, и т. д.), цели (предложение товаров и услуг, Интернет- представительство) и т. д. Разработчиками Яндекса сформированы группировки ресурсов такие, как справочно-информационные сайты, сайты с предложениями товаров и услуг, Интернет–представительства, сетевые публикации, сайты для общения.. Таким образом, в каждой предметной теме (Дом и семья, Наука и образование, Бизнес и экономика и т. п.) пользователь может выделить и просмотреть группу ресурсов. Сайты в рубриках расположены по убыванию их взвешенного индекса цитируемости. Каталог Яндекса позволяет найти нужный сайт, сужая область поиска в дополнение к основной рубрикации по темам (Бизнес и экономика, Дом и семья, Развлечения и отдых и пр.).

Рамблер

Второй по популярности среди ИПС Рунета, является Рамблер. Одноуровневый каталог представлен 56 разделами, разбитыми по категориям или расположенными в алфавитном порядке (на выбор пользователя). Результатом поиска по дереву каталога является список ссылок на сайты по выбранной категории. Если поиск осуществляется через строку запроса, то результатом его будет список ссылок на ресурсы Инернет, отсортированных по сайтам, страницам и по дате. Роботы Рамблера при сканировании игнорируют поля HTML -кода, такие <meta... > , в которых обычно содержатся ключевые слова и описание ресурса, кроме поля <meta name="robots". . . > , в котором прописаны инструкции по индексированию ресурса. Поэтому краткое описание выдаваемых при поиске документов сформировано по содержимому тегов <title> (заголовок страницы), <hl>... <h4> (заголовки внутри текста), <strong> (особо важные фрагменты, выделенные полужирным шрифтом), <и> (подчеркнутый текст).

Апорт

Структура каталога ИПС Апорт несколько похожа на каталог Яндекса. На стартовой странице расположены четырнадцать тематических рубрик с основными разделами (рис. 4). Число уровней вглубь каталога в некоторых случаях доходит до пяти. При перемещении вглубь каталога можно уточнять запрос, указывая географическое расположение требуемых ресурсов (регион, страна, город и т. п.). Апорт, как полнотекстовая поисковая система, индексирует все слова, которые присутствуют на конкретной странице сервера. В результате любое слово из текста документов сервера может служить критерием поиска. Для документов HTML, кроме основного текста документа, индексируются также: заголовок документа (TITLE), ключевые слова (МЕТА KEYWORDS), описания страниц (МЕТА DESCRIPTION), подписи к картинкам (ALT) и ссылки, как на документы внутри сайта, так и ссылки на внешние ресурсы. Выдача результатов поиска и сортировка документов производится, исходя из целого перечня критериев:

  • количество искомых слов в тексте документа (в процентах), расстояние между поисковыми словами в тексте документа;

  • место в тексте, где встречаются поисковые слова (заголовок, описание, мета-тэг и т. п.);

  • внешний вид шрифта, которым набраны в тексте искомые слова (размер, жирность, цвет);

  • количество ссылок из Интернета на данный документ;

  • использование искомого слова в тексте ссылок из Интернета на данный документ.

Хотя, благодаря эффективной работе ИПС Интернета, пользователи сети не оказываются в "информационной яме", четкой информационной структуры весь объем информации сети, к сожалению не имеет. В разных ИПС один и тот же запрос может принадлежать различным по названию и по содержанию тематическим рубрикам, следовательно, пользователь не сможет сделать однозначного вывода, к какому разделу системы классификации знаний принадлежит на самом деле полученный по его запросу документ.

Выходом из этой ситуации может явится попытка создания ИПС, в которой будут учтены все особенности поиска информации в необъятном пространстве Глобальной сети и базовые принципы организации поиска в системах автоматизации библиотек, диктуемые лингвистическим обеспечением АБИС.

7. Российская информационная образовательная среда

7.1. Структура информационных ресурсов России

Органы управления всех уровней, любые хозяйственные субъекты, учреждения, общественные объединения, отдельные граждане формируют для обеспечения своей деятельности (производственной, управленческой, научной, просветительской, организации быта и отдыха, и т.д.) информационные ресурсы, различающиеся между собой по объему (от подборки из нескольких справочников до огромных библиотечных фондов и систем баз данных) и по способам организации и представления информации.

Общественный интерес и основной объект государственной информационной политики представляют собой, прежде всего, информационные ресурсы, предназначенные для обслуживания "внешних" пользователей (т.е. субъектов, не связанных непосредственно с их формированием), а также информационные ресурсы, используемые для решения задач государственного управления. Такие информационные ресурсы формируются и эксплуатируются разного рода информационными организациями и подразделениями, государственными, муниципальными и частными. Государственные информационные организации имеются в подчинении всех ведомств и всех региональных администраций. Однотипные по формам информационной деятельности организации в ряде случаев объединяются наличием единого методического руководства, общих нормативных документов, налаженной (в разной степени) системой информационных потоков и составляют четыре основные государственные информационные системы России, имеющие межведомственный универсальный характер. Это библиотечная сеть России, Архивный фонд Российской Федерации, Государственная система статистики и Государственная система научно-технической информации (ГСНТИ). В настоящее время начала складываться и система правовой информации, призванная объединить неэффективно функционирующие ведомственные и региональные системы информирования о нормативно-правовых актах.

Универсальный характер имеют также справочные информационные ресурсы массового использования, т.е. информационные массивы, содержащие адресные данные, сведения о работе предприятий бытового обслуживания, органов власти, транспорта, связи, об организации отдыха, обучения и т.д. Однако сколько-нибудь организованной системы информационно-справочных служб для населения России в настоящее время нет, что следует рассматривать как проявление структурной неполноты российских информационных ресурсов. Необходимо создать условия, обеспечивающие получение и актуализацию сведений о работе предприятий, организаций, органов власти и управления с целью дальнейшего информационного обслуживания населения.

Для многих комплексных задач государственного и хозяйственного управления, особенно на муниципальном и территориальном уровнях, необходимо объединение разнообразных, собираемых организациями разных ведомств сведений, относящихся к определенным участкам местности, объектам или субъектам, то есть построение кадастров и регистров. Построение единой системы государственных кадастров и регистров Российской Федерации, ведущихся на единой географической информационной основе в соответствии с едиными правовыми, технологическими и экономическими нормами, могло бы создать весьма важный особый вид государственных информационных ресурсов межотраслевого характера. Однако в большинстве случаев проводимые ведомствами работы по созданию государственных кадастров не согласованы между собой в организационных, методологических, информационных и функциональных аспектах.

При существующем подходе к формированию государственных кадастров и регистров уже на этапе сбора возникает дублирование информации, которое на последующих этапах технологического цикла приводит к многократному вводу одних и тех же данных в базы данных различных ведомств и организаций и дублированию при хранении. В то же время такая технология не гарантирует полноту необходимых данных для каждого конкретного ведомства. Несогласованность форматов, хранимых в разных системах данных, сроков и технологий их обновления, использование различных лингвистических средств приводят к неоднозначности и противоречивости содержащейся в информационных системах разных ведомств информации и невозможности ее совместного использования.

В большинстве случаев практически отсутствует федеральный уровень кадастровых систем, что нарушает согласованность развития систем региональных информационных ресурсов, не позволяет оперативно использовать сопоставимую (по семантическим и технологическим параметрам) информацию из разных регионов. Это препятствует созданию единого информационного пространства страны и создает информационную основу для центробежных тенденций в экономике и политике.

Источник: https://studfile.net/preview/16562828/