Размещение информационных ресурсов.

Средства поиска информационных ресурсов.

В настоящее время рост информационных ресурсов Интернета происходит высокими темпами. Всемирная сеть напоминает читальный зал библиотеки, где хранятся гигантские объемы текстовых, графических, мультимедийных, архивных и прочих файлов. Этот зал невозможно обойти полностью. Здесь все ежечасно меняется, тело разнообразных документов возрастает каждую секунду. Найти необходимую информацию становится все труднее. Различные печатные справочники устаревают еще до их выхода в свет. Единственным надежным способом поиска информации является использование специальных поисковых систем, которые постоянно отслеживают изменения информации в сети.

Используемые в сети Интернет ресурсы чаще всего размещаются на страницах WWW-серверов (или Web-серверов), в файловых архивах (FTP-архивах) и в информационно-справочной системе Gopher.

WWW (World Wide Web - Всемирная Паутина) - это глобальная гипертекстовая система, использующая для транспортировки информации в сети Интернет протокол HTTP (HyperText Transfer protocol - протокол передачи гипертекста). Гипертекст - это способ представления всех типов информации в виде последовательности узлов, связанных друг с другом ассоциативной (а не последовательной) связью и реализованной в виде гиперссылок. Гиперссылка - выделенная в гипертексте последовательность символов, реагирующая на щелчок мыши и отсылающая пользователя на другой фрагмент гипертекста. Большинство документов, хранящихся на Web-сервере, создано на языке HTML (HyperText Markup Language - язык гипертекстовой разметки документов).

Gopher-сервер - это сервер, содержащий программы, позволяющие найти файлы, программы или другие ресурсы на заданную пользователем тему. URL-адрес такого сервера выглядит следующим образом (если сервер, например, принадлежит фирме «Microsoft»): gopher://gopher.microsoft.com.

Выделяют две группы поисковых инструментов: 1) поисковые системы и 2) поисковые службы.

ИПС (информационно-поисковая система) – это система, обеспечивающая поиск и отбор необходимых данных в специальной базе с описаниями источников информации (индексе ) на основе информационно-поискового языка и соответствующих правил поиска.

В Internet можно выделить следующие поисковые инструменты для WWW: поисковые системы, метапоисковые системы (поисковые службы) и программы ускоренного поиска (поисковые агенты).


Рис.13. Средства поиска в WWW

В зависимости от того, кто создает базы данных, в которых осуществляется поиск необходимой пользователю информации, различают поисковые системы первого и второго рода. В поисковых системах первого рода базы данных создаются людьми, в поисковых системах второго рода этот процесс осуществляет компьютер.


Поисковые системы первого рода, как правило, называют каталогами (предметными или тематическими - subject catalogs). Обычно такие каталоги создаются людьми в виде иерархических деревьев, на верхнем уровне которых стоят наиболее общие понятия: бизнес, политика, образование, спорт, культура и т.д. Элементами нижнего уровня таких деревьев являются ссылки на конкретные Web-страницы и серверы. Обычно поиск в предметных каталогах осуществляется по ключевым словам. В этом случае он проводится не в содержимом Web-серверов, а в их кратких описаниях, хранящихся в каталоге. Запрос на поиск формируется либо ввиде списка ключевых слов («information technology», «computer linguisics» и т.п.) или же путем указания URL-адресов документов, в которых следует проводить поиск. Результаты поиска представляются в виде гипертекста, содержащего вкачестве гипертекстовых ссылок названия или URL-адреса найденных документов.

По ключевым словам можно осуществлять поиск следующей информации:

1) некоторого текста или его части;

2) фактических данных (например, массу солнца или имя президента страны);

3) картин, рисунков, кинофильмов и т.д. по их названиям;

4) технической информации (например, сведения о скорости некоторого автомобиля);

5) биографий людей (писателей, художников и т.п.).

Примерами тематических каталогов являются Yahoo, Galaxy, WWW Virtual Library, WebCrawler, HotBot и др. Подобная русскоязычная система носит название «Следопыт».

Поисковые системы второго рода иногда называют автоматическими индексами, «пауками» или «червями» spiders, crawlers). Они постоянно сканируют Интернет, находят в сети новые документы и из каждого документа извлекают все содержащиеся в нем гиперссылки, которыми пополняют свои базы данных (базы URL-адресов). Чтобы можно было выполнять эти функции, автоматический индекс включает в себя следующие три части: программу-робота, которая постоянно просматривает Интернет; базу данных (множество URL-адресов), которая собирается роботом, и интерфейс пользователя для поиска необходимой информации в этой базе данных. Существует большое число автоматических индексов. Наиболее популярными являются:

Зарубежные поисковые машины:

- Altavista (http://www.altavista.com);

- Go (Infoseek) (http://www.go.com);

- Google (http://www.google.com);

- Excite (http://www.excite.com);

- HotBot (http://www.hotbot.com);

- Nothern Light (http://www.northernlight.com).

Российские поисковые машины:

- Яndex(http://www.yandex.ru);

- Рамблер (http://www.rambler.ru);

- Апорт (http://www.aport.ru).
Популярные белорусские поисковые системы:

- Система ALL.BY (http://all.by);

- Система *.BY (http://search.promedia.minsk.by);

- Регистр белорусских WWW-ресурсов Зубр (http://www.zubr.com);

- Белорусский интернет-каталог Акавiта (http://akavita.kryvia.net);

- Белорусские ресурсы каталог (http://www.belresource.com.by),

Большинство поисковых систем являются одним из компонентов многофункциональных Web-сайтов Internet – так называемых порталов.

Портал – многофункциональный Web-узел Internet, предлагающий разнообразные услуги: поиск информации, бесплатная электронная почта и т.д.

Последнее время во всемирной паутине стали появляться системы, автоматически осуществляющие поиск сразу в двух индексах (индексе каталога и индексе поисковой машины). Подобные системы позволяют использовать преимущества поисковых серверов обоих типов и называются каталогами-машинами.

Поиск информации с помощью различных поисковых инструментов может осуществляться путем формирования простых и сложных запросов. Простой запрос представляет собой слово или словосочетание, которое иногда берется в кавычки. Сложный запрос формируется из слов или словосочетаний, соединяемых операторами типа AND, OR, NOT, NEAR или математическими символами, например "*", "+", "-", "~". Иногда для тех же целей используются специальные термины domain, host, link tide и др.

Классификация поисковых инструментов (их типы и виды) Поисковые инструменты можно разделить на: - каталоги или директории - directories - поисковые системы - search engines. В основу этой классификации положен принцип отбора и обработки информации для базы данных поискового инструмента, а именно: насколько этот процесс автоматизирован, кто создает базу данных поискового инструмента: люди или компьютеры.


Классификация поисковых инструментов (их типы и виды) В последнее время разница между поисковыми системами и директориями «стирается», поскольку их создатели стараются не акцентировать внимание пользователей на принципах отбора информации, а представляют как можно больше схожих сервисных возможностей, работая как универсальные порталы. Но разница в отборе и обработке информации все-таки остается существенно важной и определяющей: – поисковые машины используют машины-роботы для поиска, индексации информации – т.е. Процесс полностью автоматизирован; - директории построены на том, что сайт «дожидается» быть принятым, обработанным и описанным неким специалистом- каталогизатором.


Классификация поисковых инструментов (их типы и виды) Такие отличные друг от друга принципы работы поисковых систем и директорий значительно влияют на их объем и содержание, а соответственно – и на стратегию поиска: Поисковые системы индексируют содержимое того или иного сайта полностью и поиск ведется по всем его полным текстам. Директории представляют тот или иной сайт в общих чертах – каталогизатор аннотирует и систематизирует сайт в соответствии с его общим содержанием и полные тексты не индексируются. Поисковые системы индексируют большое количество сайтов, поскольку роботы, «просматривающие» содержимое Сети действуют по принципу «снежного кома», путешествуя от ссылки к ссылке. Директории же отличаются осмысленностью и упорядоченностью подбора сайтов в свои базы данных (обычно это информационно насыщенные и/или сайты крупных физических объектов).


Классификация поисковых инструментов (их типы и виды) Итак, некоторые поисковые системы: Altavista (Яndex (Google (Rambler (FastSearch (


Классификация поисковых инструментов (их типы и виды) И директории (или каталоги): Yahoo (Librarians Index to the Internet (lii.org) List.ru (


Классификация поисковых инструментов (их типы и виды) Среди перечисленных, как вы заметили, есть как универсальные глобальные поисковые инструменты, так и универсальные региональные (в данном случае - российские). Приведем и некоторые другие: EuroFerret (Voila (Altavista France (fr.altavista.com) UKPlus (ukplus.co.uk)


Классификация поисковых инструментов (их типы и виды) Деление поисковых инструментов на глобальные и региональные – не что иное, как классификация по географическому принципу отбора ресурсов для индексации. Другие поисковые инструменты также содержательно органичивают свои базы данных, но по – тематике: FindLaw (Whowhere (MusicSearch (HumorSearch (FindBook (


Классификация поисковых инструментов (их типы и виды) Заметьте, что такие специализированные или тематические поисковые инструменты могут использовать: либо свои собственные базы данных для поиска по вашему запросу, либо производят поиск по всей Сети, используя другие поисковые системы.


Классификация поисковых инструментов (их типы и виды) Кроме того, существуют и метапоисковые системы, предлагающие искать в нескольких поисковых системах одновременно. Например: Mamma (Преимущество в том, что в таком случае выдается максимально большее количество результатов, недостаток же в том, что не все поисковые системы имеют одинаковый синтаксис языка запросов (например, кавычки поддерживаются не каждой поисковой системой).


Основные элементы языка запросов поисковых систем Перечислим общие элементы и особенности языка запросов поисковых систем: Большинство используют: + или - (включить или исключить термин из поискового предписания); «кавычки» (для обозначения фразы, устойчивого словосочетания). Некоторые вместо знаков + или – используют союзы AND, AND NOT.


Основные элементы языка запросов поисковых систем Большинство позволяют использовать символы усечения слова слева * (например: wish* - будут найдены: wish, wishes, wishful, wishbone, and wishy-washy) Некоторые поисковые системы чувствительны к заглавным и строчным буквам (например, если вы ищете материалы о людях с фамилией Stone с помощью Altavista, следует обязательно использовать заглавную букву, посколько в противном случае будут найдены все сайты где встречается слово stone - камень).


Основные элементы языка запросов поисковых систем (на примере Яndex) ЭлементЧто он означаетПример запроса пробел или & или + логическое И (в пределах предложения) семейное право &&логическое И (в пределах документа) рецепты && (плавленный сыр) |логическое ИЛИфото | фотография | снимок | фотоизображение


Основные элементы языка запросов поисковых систем (на примере Яndex) () группирование слов(технология | изготовление) (масла | творога) ~ или - союз И НЕ (в пределах предложения) дума ~ закон ~~ союз И НЕ (в пределах документа) путеводитель по парижу ~~ (агентство | тур) «» поиск фразы«антология поэзии»


Основные элементы языка запросов поисковых систем (на примере Яndex) ! перед словомточная форма слова!настоящий!момента - Настоящий закон вступает в силу спустя две недели с момента его опубликования. $title («»)Выражение присутствует в поле «Заголовок» (Title) HTML-документа. $title («флора и фауна») - страницы с названиями схожими с «Флора и фауна Сибири»


И, в заключение: 1) Для того, чтобы правильно построить стратегию поиска, нужно прежде всего решить для себя какого рода информацию вы хотите получить – некую общую, описывающую объект или явление в целом, или же какие-то детали, частности, которые могут встретиться в полном тексте какого-то документа. В первом случае – целесообразно использовать директорию, во втором – поисковую систему. 2) Если же, начиная поиск, вы еще не представляете точно, что и как много вы хотите получить в результатах запроса рекомендуется использовать разные поисковые инструменты в комплексе.

Лекция 4. Инструменты информационного поиска

Постоянное обновление информационного массива в сочетании с приростом объема данных крайне усложняет учет имеющихся документов и, соответственно, поиск, который условно можно разделить на:

  • фактографический поиск: в энциклопедиях, справочниках, словарях,
  • библиографический поиск: библиотеки, каталоги, программы.
  • документальный поиск: электронные документы, электронные библиотеки, электронные журналы.

Важность проблемы информационного поиска привела к образованию целой отрасли, задача которой заключается именно в оказании помощи пользователю по навигации в киберпространстве. Составляют эту отрасль специальные поисковые службы или сервисы . Их традиционно разделяют на:

  • справочники или каталоги
  • поисковые системы

Эти разновидности визуально очень похожи, поскольку «каждый справочник обладает собственной поисковой системой, а каждая поисковая система - собственным справочником» . Однако принципы их работы базируются на абсолютно разных подходах и технологиях. При этом каждая разновидность поисковых сервисов применяется в решении определенного типа задач. Информационный поиск подразумевает использование определенных стратегий, методов, механизмов и средств. Поведение пользователя, осуществляющего управление процессом поиска, определяется не только информационной потребностью, но и инструментальным разнообразием системы - технологиями и средствами, предоставляемыми системой. Выбором инструмента во многом определяется стратегия поисковой деятельности и поисковые технологии.

Поисковые технологии - унифицированные (оптимизированные в рамках конкретной информационно-поисковой системы) последовательности эффективного использования отдельных средств поиска в процессе взаимодействия пользователя с системой.

По используемым поисковым технологиям информационные системы можно разбить на 3 категории:

  • тематические каталоги и специализированные каталоги (онлайновые справочники);
  • поисковые машины (полнотекстовый поиск);
  • средства мета-поиска.

Тематические каталоги предусматривают обработку документов и отнесение их к одной из нескольких категорий, перечень которых заранее задан. Фактически это знакомое всем библиотекарям индексирование на основе классификации . Специализированные каталоги или справочники создаются по отдельным отраслям и темам. Поисковые машины (самое развитое средство поиска в Интернете) реализуют технологию полнотекстового поиска. Индексируются тексты, расположенные на запрашиваемых серверах. При использовании средств метапоиска запрос осуществляется одновременно несколькими поисковыми системами. Результат поиска объединяется в общий, упорядоченный по степени релевантности, список.

Средства поиска - взаимозависимый комплекс информационно-поисковых языков и языков определения/управления данными, обеспечивающий структурные и семантические преобразования объектов обработки (документов, словарей, совокупностей результатов поиска).

1. Справочники

Поисковые средства первой группы представляют собой электронные справочники, имеющие четкую иерархическую систематическую или логико-тематическую структуру, во многом напоминающую структуру систематического каталога библиотеки . Работа со справочниками позволяет ориентироваться в Интернет-ресурсах в пределах отдельных отраслей знания, углубляясь от общего к частному, меняя иерархические ветви, возвращаясь на несколько шагов назад и т.д.

Среди российских разработок в этой области значатся:

  • Апорт (адрес: www.aport.ru ),
  • List.ru (адрес: list.mail.ru ),
  • Weblist (адрес: www.weblist.ru ),
  • Иван Сусанин (адрес: www.susanin.net )
  • Улитка (адрес: www.ulitka.ru ).

Главной отличительной особенностью справочников является то, что они сделаны вручную. Редакционные коллегии каждого из справочников, которые по характеру труда напоминают отделы каталогизации и систематизации крупных библиотек , регулярно просматривают содержимое вновь появившихся серверов и отслеживают изменения на уже существующих. Выявленные данные анализируются и заносятся в разделы справочника в соответствии с принятой классификацией. Описание сервера в целом (или раздела, если он представляется вполне самостоятельным блоком) снабжается краткой аннотацией, содержащей общие сведения о характере имеющейся информации. В некоторых случаях заносятся добавочные сведения о языке документов, посещаемости ресурса, его физическом месторасположении и т.п.

Основными параметрами, характеризующими достоинства справочников, являются:

  • объем;
  • оперативность отражения новых или изменившихся ресурсов;
  • логичность и последовательность иерархической схемы классификации;
  • перекрестность структуры.

Объемом справочника определяется степень его надежности или « информационная прочность» . В некоторых системах существует специальный механизм, периодически проверяющий доступность сайта и исключающий его из перечня при долгом «отсутствии» в Сети. Логичностью (научностью) применяемой схемы классификации определяется степень простоты, с которой пользователи находят требуемые сведения. Система перекрестных ссылок позволяет выявить информацию, используя разные подходы (например, территориальный или отраслевой). В этом случае схема классификации должна автоматически выводить пользователя на искомый объект, какой бы путь поиска не был выбран.

Возможности составления запроса для этого вида поисковых средств особой роли не играют. Сложные разыскания, требующие детализации запроса, с помощью каталогов не проводятся.

Справочники предназначены для решения трех типов задач :

  • ориентация в незнакомой отрасли знания;
  • разыскание крупных объектов, каковыми являются, к примеру, серверы организаций или значительных проектов;
  • получение готового перечня ресурсов, имеющих размытый поисковый образ (библиотек определенного типа, транспортных расписаний или сайтов политических партий и т.д.)

Другим примером является сравнение справочника ресурсов с систематическим каталогом библиотеки, в котором от книги (в данном случае, целого сайта) остается лишь описание и аннотация.

2. Поисковые системы

В основу работы поисковых систем (поисковых машин) заложены совершенно иные технологические принципы. Задача поисковых машин - обеспечить детальное разыскание информации, что может быть достигнуто только за счет учета (индексирования ) содержания максимально возможного числа веб-страниц. В отличие от справочников, поисковые машины функционируют в автоматизированном режиме и имеют единообразный принцип действия.

Поисковые системы состоят из двух базовых компонентов. Первый компонент представляет собой программу-робот , задача которого передвигаться с сервера на сервер и находить там новые (или изменившиеся) документы, скачивая их на главный компьютер системы. Робот просматривает содержимое документа, находит новые ссылки, - как на другие документы сервера, так и внешние сайты. Далее программа самостоятельно направляется по указанным ссылкам, находит новые документы, после чего процесс повторяется вновь, напоминая хорошо известный в библиографии «метод снежного кома» . Выявленные документы обрабатываются (индексируются) вторым компонентом поисковой системы. При этом, как правило, учитывается все содержание страницы, включая текст, иллюстрации, аудио- и видеофайлы. Индексации подвергаются все слова в документе, что дает возможность использовать поисковые системы для детального поиска по самой узкой тематике. Образуемые индексные файлы , хранящие информацию о том, какое ключевое слово, сколько раз, в каком документе и на каком сервере употребляется, составляют ту базу данных, к которой обращается библиотекарь, вводящий в строку запроса сочетания ключевых слов.

Вывод результатов осуществляется с помощью специального модуля, который производит интеллектуальное ранжирование результатов . При этом в расчет берется:

  • местоположение термина в документе (название, заголовок, основной текст), частота его повторения,
  • процентное соотношение искомого термина к тексту страницы,
  • число и авторитетность внешних ссылок на данную страницу с других сайтов.

К основным параметрам поисковых систем относятся:

  • число проиндексированных серверов и отдельных документов (объем индексных файлов);
  • степень оперативности обновления базы данных за счет включения сведений о новых материалах и удаления устаревших;
  • возможности для составления запроса;
  • интеллектуальность системы ранжирования результатов поиска;
  • наличие дополнительных сервисных функций, облегчающих работу пользователя.

Возможности поискового механизма выражать запрос максимально точно в значительной степени предопределяют качество полученных результатов. Каждая машина имеет свою собственную лексику, которая по-разному позволяет детализировать поисковое предписание .

Все поисковые машины обладают модулем ранжирования результатов поиска . Это второй базовый компонент всех систем. Перечень факторов, принимаемых во внимание при определении места документа в перечне ссылок, необычайно широк: от местоположения слова на странице до рейтинга (авторитета) страниц, имеющих ссылки на найденный документ.

  • Google (адрес: www.google.com ),
  • AlltheWeb (адрес: www.alltheweb.com ),
  • Alta Vista (адрес: www.altavista.com ).

Подобные поисковые средства существуют и в России. Все они предназначены для работы с русскоязычными документами и обладают мощным http://www.metabot.ru ).

Выводы по теме лекционного блока

Поисковая система делает выборку страниц из базы данных в соответствии с запросом, затем страницы упорядочиваются по степени убывания совпадений (примеч. А.А.)

В данном случае наблюдается прямая аналогия с принципами работы распределенных сводных каталогов библиотеки. Ключевой возможностью мета-поиска является способность рассылать запросы пользователя одновременно по различным поисковых системам - с последующим суммированием результатов. (примеч. А.А.)

Обращаясь к справочникам, библиотекарь может рассчитывать на получение лишь очень общих сведений по тематике, и никогда - детальных данных: от сервера крупной корпорации, содержащего тысячи страниц, в справочнике будет представлено лишь наименование и несколько строк аннотации.

Поисковые инструменты

Поисковые инструменты - это особое программное обеспечение, основная цель которого – обеспечить наиболее оптимальный и качественный поиск информации для пользователей Интернета. Поисковые инструменты размещаются на специальных веб-серверах, каждый из которых выполняет определенную функцию:

1. Анализ веб-страниц и занесение результатов анализа на тот или иной уровень базы данных поискового сервера.

2. Поиск информации по запросу пользователя.

3. Обеспечение удобного интерфейса для поиска информации и просмотра результата поиска пользователем.

Приемы работы, используемые при работе с теми или другими поисковыми инструментами, практически одинаковы. Перед тем как перейти к их обсуждению, рассмотрим следующие понятия:

1. Интерфейс поискового инструмента представлен в виде страницы с гиперссылками, строкой подачи запроса (строкой поиска) и инструментами активизации запроса.

2. Индекс поисковой системы – это информационная база, содержащая результат анализа веб-страниц, составленная по определенным правилам.

3. Запрос – это ключевое слово или фраза, которую вводит пользователь в строку поиска. Для формирования различных запросов используются специальные символы ("", ~), математические символы (*, +, ?).

Схема поиска информации проста. Пользователь набирает ключевую фразу и активизирует поиск, тем самым получает подборку документов по сформулированному (заданному) запросу. Этот список документов ранжируется по определенным критериям так, чтобы вверху списка оказались те документы, которые наиболее соответствуют запросу пользователя. Каждый из поисковых инструментов использует различные критерии ранжирования документов, как при анализе результатов поиска, так и при формировании индекса (наполнении индексной базы данных web-страниц).

Таким образом, если указать в строке поиска для каждого поискового инструмента одинаковой конструкции запрос, можно получить различные результаты поиска. Для пользователя имеет большое значение, какие документы окажутся в первых двух-трех десятках документов по результатам поиска и на сколько эти документы соответствуют ожиданиям пользователя.

Большинство поисковых инструментов предлагают два способа поиска – simple search (простой поиск) и advanced search (расширенный поиск) с использованием специальной формы запроса и без нее. Рассмотрим оба вида поиска на примере англоязычной поисковой машины.

Например, AltaVista удобно использовать для произвольных запросов, «Something about online degrees in information technology», тогда как поисковый инструмент Yahoo позволяет получать мировые новости, информацию о курсе валют или прогнозе погоды.

Освоение критериев уточнения запроса и приемов расширенного поиска, позволяет увеличивать эффективность поиска и достаточно быстро найти необходимую информацию. Прежде всего, увеличить эффективность поиска Вы можете за счет использования в запросах логических операторов (операций) Or, And, Near, Not, математических и специальных символов. С помощью операторов и/или символов пользователь связывает ключевые слова в нужной последовательности, чтобы получить наиболее адекватный запросу результат поиска. Формы запросов приведены в таблице 1.

Таблица 1

Простой запрос дает некоторое количество ссылок на документы, т.к. в список попадают документы, содержащие одно из слов, введенных при запросе, или простое словосочетание (см. таблицу 1). Оператор and позволяет указать на то, что в содержании документа должны быть включены все ключевые слова. Тем не менее, количество документов может быть все еще велико, и их просмотр займет достаточно времени. Поэтому в ряде случаев гораздо удобнее применить контекстный оператор near, указывающий, что слова должны располагаться в документе в достаточной близости. Использование near значительно уменьшает количество найденных документов. Наличие символа "*" в строке запроса означает, что будет осуществляться поиск слова по его маске. Например, получим список документов, содержащих слова, начинающиеся на "gov", если в строке запроса запишем "gov*". Это могут быть слова government, governor и т.д.

Наиболее развитый сервис поиска русскоязычной информации предоставляет поисковый сервер Яndex. В Яndex можно просто написать по-русски фразу, описывающую то, что Вы хотите найти, и система проанализирует и обработает Ваш запрос, а затем постарается найти все, что относится к заданной теме. Вы можете, используя специальные операторы, составить строку, поясняющую поисковой системе, каким Вашим требованиям должна отвечать интересующая Вас информация.

Не менее популярная поисковая система Rambler ведет статистику посещаемости ссылок из собственной базы данных, поддерживаются те же логические операторы И, ИЛИ, НЕ, метасимвол * (аналогично расширяющему диапазон запроса символу * в AltaVista), коэффициентные символы + и -, для увеличения или уменьшения значимости вводимых в запрос слов.

Давайте рассмотрим наиболее популярные технологии поиска информации в Интернет.

ИПС (информационно-поисковая система) – это система, обеспечивающая поиск и отбор необходимых данных в специальной базе с описаниями источников информации (индексе) на основе информационно-поискового языка и соответствующих правил поиска.

Релевантность – это соответствие результатов поиска сформулированному запросу.

Пертинентность (в информационном поиске) - соответствие полученной информации информационной потребности пользователя.

Пертинентность измеряется степенью соответствие между ожиданиями пользователя и результатами поиска (сравните с релевантностью), которая определяется как отношение объема полезной для пользователя информации к общему объему полученной информации, найденнойпоисковой системой.

Достижение высокой степени пертинентности - основное поле конкурентной борьбы современных поисковых систем. Именно для максимального удовлетворения информационных потребностей пользователей в настоящее время в ИП-системах широко применяются теории и методы семантических сетей, контент-анализа и глубинного анализа текстов (Text mining,интеллектуальный анализ текстов ).

Для поиска нужной информации в сети используется адрес ресурса (англ . Uniform Resource Locator (URL ) адрес), содержащий имя протокола, по которому нужно обращаться к требуемой информации, адрес сервера и имя файла на этом сервере (рис. 2).

Рис. 2. Пример адреса ресурса

Поиско́вая систе́ма - программно-аппаратный комплекс свеб-интерфейсом, предоставляющий возможность поискаинформациивИнтернете. Под поисковой системой обычно подразумеваетсясайт, на котором размещён интерфейс системы. Программной частью поисковой системы являетсяпоисковая машина(поисковый движок) -комплекс программ, обеспечивающий функциональность поисковой системы и обычно являющийся коммерческой тайной компании-разработчика поисковой системы

Поиск информации в Интернете осуществляется с помощью специальных программ, обрабатывающих запросы - информационно-поисковых систем (ИПС) . Существует несколько моделей, на которых основана работа поисковых систем, но исторически две модели приобрели наибольшую популярность - это поисковые каталоги и поисковые указатели .

Поисковые каталоги устроены по тому же принципу, что и тематические каталоги крупных библиотек. Они обычно представляют собой иерархические гипертекстовые меню с пунктами и подпунктами, определяющими тематику сайтов, адреса которых содержатся в данном каталоге, с постепенным, от уровня к уровню, уточнением темы. Поисковые каталоги создаются вручную . Высококвалифицированные редакторы лично просматривают информационное пространство WWW, отбирают то, что по их мнению представляет общественный интерес, и заносят в каталог.

Основной проблемой поисковых каталогов является чрезвычайно низкий коэффициент охвата ресурсов WWW. Чтобы многократно увеличить коэффициент охвата ресурсов Web, из процесса наполнения базы данных поисковой системы необходимо исключить человеческий фактор - работа должна быть автоматизирована.

Автоматическую каталогизацию Web-ресурсов и удовлетворение запросов клиентов выполняют поисковые указатели . Работу поискового указателя можно условно разделить на три этапа:

    сбор первичной базы данных. Для сканирования информационного пространства WWW используются специальные агентские программы - черви, задача которых состоит в поиске неизвестных ресурсов и регистрация их в базе данных;

    индексация базы данных - первичная обработка с целью оптимизации поиска. На этапе индексации создаются специализированные документы - собственно поисковые указатели;

    рафинирование результирующего списка. На этом этапе создается список ссылок, который будет передан пользователю в качестве результирующего. Рафинирование результирующего списка заключается в фильтрации и ранжировании результатов поиска.

Под фильтрацией понимается отсев ссылок, которые нецелесообразно выдавать пользователю (например, проверяется наличие дубликатов). Ранжирование заключается в создании специального порядка представления результирующего списка (по количеству ключевых слов, сопутствующих слов и др.).

Главной задачей любой ИПС является поиск информации релевантной информационным потребностям пользователя. Очень важно в результате проведенного поиска ничего не потерять, то есть найти все документы, относящиеся к запросу, и не найти ничего лишнего. Поэтому вводится качественная характеристика процедуры поиска – релевантность.

Релевантность – это соответствие результатов поиска сформулированному запросу.

1 Поисковые инструменты

Поисковые инструменты - это особое программное обеспечение, основная цель которого – обеспечить наиболее оптимальный и качественный поиск информации для пользователей Интернета. Поисковые инструменты размещаются на специальных веб-серверах, каждый из которых выполняет определенную функцию:

Машины веб-поиска - это сервера с огромной базой данных URL-адресов, которые автоматически обращаются к страницам WWW по всем этим адресам, изучают содержимое этих страниц, формируют и прописывают ключевые слова со страниц в свою базу данных (индексирует страницы).

Более того, роботы поисковых систем переходят по встречаемым на страницах ссылкам и переиндексируют их. Так как почти любая страница WWW имеет множество ссылок на другие страницы, то при подобной работе поисковая машина в конечном результате теоретически может обойти все сайты в Интернет.

Именно этот вид поисковых инструментов является наиболее известным и популярным среди всех пользователей сети Интернет. У каждого на слуху названия известных машин веб-поиска (поисковых систем) – Яndex, Rambler, Aport.

Работа машин веб-поиска сводится к следующему:

    Анализ веб-страниц и занесение результатов анализа на тот или иной уровень базы данных поискового сервера.

    Поиск информации по запросу пользователя.

    Обеспечение удобного интерфейса для поиска информации и просмотра результата поиска пользователем.

Приемы работы, используемые при работе с теми или другими поисковыми инструментами, практически одинаковы. При их описании используются следующие понятия:

    Интерфейс поискового инструмента представлен в виде страницы с гиперссылками, строкой подачи запроса (строкой поиска) и инструментами активизации запроса.

    Индекс поисковой системы – это информационная база, содержащая результат анализа веб-страниц, составленная по определенным правилам.

    Запрос – это ключевое слово или фраза, которую вводит пользователь в строку поиска. Для формирования различных запросов используются специальные символы ("", ~), математические символы (*, +, ?).

Схема поиска информации проста. Пользователь набирает ключевую фразу и активизирует поиск, тем самым получает подборку документов по сформулированному (заданному) запросу. Этот список документов ранжируется по определенным критериям так, чтобы вверху списка оказались те документы, которые наиболее соответствуют запросу пользователя. Каждый из поисковых инструментов использует различные критерии ранжирования документов, как при анализе результатов поиска, так и при формировании индекса (наполнении индексной базы данных web-страниц).

В России наиболее крупными и популярными поисковыми указателями являются:

    «Яndex» (www.yandex.ru)

    «Pамблер» (www.rambler.ru)

    «Google» (www.google.ru)

    «Апорт2000» (www.aport.ru)

2 Механизмы поиска

Обобщенная технология поиска состоит из следующих этапов:

    Пользователь формулирует запрос

    Система проводит поиск документов (или их поисковых образов)

    Пользователь получает результат (сведения о документах)

    Пользователь совершенствует или реформирует запрос

    Организация нового поиска...

Как правило, поисковые машины поддерживают два режима: режим простого поиска и режим расширенного поиска. Рассмотрим обобщенные возможности.

Формирования запроса в режиме простого поиска. Можно просто вводить через пробел одно или несколько слов; поиск слов со всевозможными окончаниями моделируется символом * в конце слова. Многие системы позволяют искать словосочетания или фразу, для этого необходимо ее заключить в кавычки. Возможно обязательное включение или исключение определенных слов.

Основная проблема поиска по примитивно составленному запросу (в виде перечисления ключевых слов) заключается в том, что поисковая машина найдет все страницы, на которых указанные слова встречаются в любой части документа. Как правило, количество найденных страниц будет слишком велико.

Для улучшения качества поиска в режиме простого поиска допустимо использование логических операторов и операторов, позволяющих ограничить область поиска, а также выбор определенной категории документов из представленного списка.

Многие поисковые системы включают в свой язык составления запросов специальные операторы, позволяющие проводить поиск в определенных зонах документа, например, в его заголовке, или искать документ по известной части его адреса.

Режим расширенного или детального запроса в разных системах реализован индивидуально, но чаще всего это бланк, в котором упомянутые операторы и ключевые элементы реализуются простой установкой соответствующих флажков или выбором параметров из списка.

Ниже в качестве примера приведены сведения из раздела помощь поисковой системы Yandex: окно расширенного поиска, язык запросов, искать в найденном.

Искать в найденном Если в результате запроса Яндекс нашел много документов, но по более широкой теме, чем вам хочется, вы можете сократить этот список, уточнив запрос. Еще один вариант - включить флажок в найденном в форме поиска, задать дополнительные ключевые слова, и следующий поиск будет вестись только по тем документам, которые были отобраны в предыдущем поиске.

Памятка по использованию языка запросов

Пример

Значение

"К нам на утренний рассол"

Слова идут подряд в точной форме

"Прибыл * посол"

Пропущено слово в цитате

полгорбушки & мосол

Слова в пределах одного предложения

снаряжайся && добудь

Слова в пределах одного документа

глухаря | куропатку | кого-нибудь

Поиск любого из слов

не смогешь << винить

Неранжирующее "и": выражение после оператора не влияет на позицию документа в выдаче

я должон /2 казнить

Расстояние в пределах двух слов в любую сторону (то есть между заданными словами может встречаться одно слово)

нешто я ~~ пойму

Исключение слова пойму из поиска

при моем /+2 уму

Расстояние в пределах двух слов в прямом порядке

чай ~ лаптем

Поиск предложения, где слово чай встречается без слова лаптем

щи /(-1 +2) хлебаю

Расстояние от одного слова в обратном порядке до двух слов в прямом

Соображаю!что!чему

Слова в точной форме с заданным регистром

получается && (+на | !мне)

Скобки формируют группы в сложных запросах

Политика

Словарная форма слова

title:(в стране)

Поиск по заголовкам документов

url:ptici.narod.ru/ptici/kuropatka.htm

Поиск по URL

беспременно inurl:vojne

Поиск с учетом фрагмента URL

Поиск по хосту

Поиск по хосту в обратной записи

site:http://www.lib.ru/PXESY/FILATOW

Поиск по всем поддоменам и страницам заданного сайта

Поиск по одному типу файлов

Поиск с ограничением по языку

Поиск с ограничением по домену

Поиск с ограничением по дате

государственное дело && /3 улавливаешь нить

Расстояние в 3 предложения в любую сторону

нешто я ~~ пойму

Исключение слова пойму из поиска

Интересной возможностью является поиск документов в сети, ссылающиеся на страницу с указанным вами адресом (URL). Таким образом, можно найти в сети страницы, на которых есть ссылки на ваш Web-сайт. Некоторые системы позволят ограничить область поиска внутри указанного домена.

В качестве дополнительных специальных операторов можно выделить:

    Операторы поиска документов с определенным графическим файлом;

    Операторы ограничения по дате искомых страниц;

    Операторы близости между словами;

    Операторы учета словоформы;

    Операторы сортировки результатов (по релевантности, свежести, старости).

Следует заметить, что, к великому сожалению, на сегодняшний день не существует стандарта на количество и синтаксис поддерживаемых операторов для различных поисковых систем. Попытки разработать стандарт на синтаксис поддерживаемых операторов предпринимаются, поэтому есть надежда на то, что разработчики поисковых систем позаботятся об удобстве пользователей. На данном этапе развития средств поиска, пользователь, обращаясь к определенной поисковой системе, непременно должен в первую очередь ознакомиться с ее правилами составления запросов. Как правило, на домашней странице будет обязательно присутствовать ссылка Помощь (Help), по которой вы перейдете к справочной информации.

Различные поисковые системы описывают разное количество источников информации в Интернет. Поэтому нельзя ограничиваться поиском только в одной поисковой системе.

Рассмотрим способы представления результатов поиска в поисковых машинах.

Чаще всего количество найденных документов превышает несколько десятков, а в отдельных случаях может достигать сотен тысяч! Поэтому в качестве формы выдачи составляется список документов по 5-10-15 единиц на странице с возможностью перехода к следующей порции внизу страницы. Обязательно указывается заголовок и URL(адрес) найденного документа, иногда система указывает в процентах степень релевантности документа.

В описании документа чаще всего содержится несколько первых предложений или выдержки из текста документа с выделением ключевых слов. Как правило, указана дата обновления (проверки) документа, его размер в килобайтах, некоторые системы определяют язык документа и его кодировку (для русскоязычных документов).

Что можно делать с полученными результатами? Если название и описание документа соответствует вашим требованиям, можно немедленно перейти к его первоисточнику по ссылке. Это удобнее делать в новом окне, чтобы иметь возможность далее анализировать результаты выдачи. Многие поисковые системы позволяют проводить поиск в найденных документах, причем вы можете уточнить ваш запрос введением дополнительных терминов.

Если интеллектуальность системы высока, вам могут предложить услугу поиска похожих документов. Для этого вы выбираете особо понравившийся документ и указываете его системе в качестве образца для подражания.

Однако, автоматизация определение похожести – весьма нетривиальная задача, и зачастую эта функция работает неадекватно вашим надеждам. Некоторые поисковики позволяют провести пересортировку результатов. Для экономии вашего времени можно сохранить результаты поиска в виде файла на локальном диске для последующего изучения в автономном режиме.