Информационно-поисковые системы на примере Рамблера
Категория реферата: Рефераты по информатике, программированию
Теги реферата: первый снег сочинение, мировая экономика
Добавил(а) на сайт: Galiaskarov.
Предыдущая страница реферата | 1 2 3 4 5 6 7 8 | Следующая страница реферата
Узбекистан: .uz
Грузия: .ge и игнорируют сайты из других доменов.
Если данный сайт находится вне названных доменов (например, в зонах
.com, .org, .net), но существенная часть сайта содержит русскоязычные
материалы или он может представлять интерес для русскоязычной аудитории
Рамблера, можно отослать письмо на адрес search.support@rambler-co.ru с
просьбой включить сайт в число сканируемых, либо заполнить форму обратной
связи. Сотрудники Рамблера рассмотрят эту просьбу и примут решение о
целесообразности такого включения.
3. Рекомендуется зарегистрировать сайт в рейтинге Top100 и расставить счетчик на всех страницах сайта. Анкета, заполняемая при регистрации в этом рейтинге, индексируется ежедневно, а специальный робот Рамблера дважды в день пополняет базу поисковой машины новыми страницами, на которых размещен счетчик. Таким образом, включение сайта в Тор100 - это самый быстрый способ попасть в результаты поиска!
4. При заполнении полей анкеты "Название сайта" и "Описание" не следует вводить в них длинные перечни ключевых слов. Эти поля все равно пока не используются для поиска. Название и описание должны быть предназначены для прочтения человеком, так как эти поля используются в наших внутренних базах данных и просматриваются редакторами.
5. Рамблер умеет извлекать гиперссылки из объектов Macromedia Flash. Если сайт имеет заставку или навигационные панели, выполненные c использованием этой технологии, Рамблер обработает их, найдет адреса всех страниц сайта и проиндексирует весь сайт. Однако, сами тексты flash-объектов не индексируются. Это решение принято потому, что большая часть таких объектов содержит элементы навигации, заставки, меню и другие фрагменты, очень важные в качестве источника гиперссылок, но малоинформативные как текст. Для сайтов, которые целиком состоят из flash-объектов, рекомендуется создать HTML-копию и зарегистрировать ее в поисковой машине.
6. Роботы Рамблера при сканировании игнорируют поля и все другие поля , кроме . Это связано с тем, что эта система старается индексировать документ таким, какой он есть (то есть таким, каким его видит пользователь). Не секрет, что зачастую создатели интернет- страниц злоупотребляют этими полями, пытаясь заставить поисковые машины находить документ по запросам, не имеющим к нему прямого отношения. Не следует также использовать невидимый текст (в котором цвет шрифта совпадает с цветом фона). Комментарии в документе роботы
Рамблера тоже не сканируют, поэтому использовать их лучше по прямому назначению. Помните, что каждый комментарий увеличивает размер документа, а значит, снижает вероятность того, что документ будет просмотрен пользователем до конца.
7. Обратите внимание на заголовки и выделения в документе. Базовые понятия и ключевые для данного сайта слова целесообразно включать в следующие HTML-теги (в порядке значимости):
...
, ,
Чем чаще слово встречается в этих полях, тем более вероятно, что поисковая система Rambler выдаст ссылку на Ваш документ ближе к началу списка результатов поиска. Конечно, использование этих тегов должно органично сочетаться с дизайном Вашего сайта.
8. С точки зрения поиска, использование фреймов в документе не приветствуется. Это не означает, что роботы не умеют сканировать фреймы. Роботы Rambler прекрасно справляются с конструкциями фреймов, однако наличие лишнего этажа ссылок (от головного навигационного фрейма к "содержательным") замедляет индексацию.
Оптимальным является включать в документы с фреймами HTML-тег с
текстом документа и ссылками. Разумеется, это увеличит размер документа, но
будет являться актом доброй воли по отношению к пользователям текстовых
браузеров (например, Lynx) и поисковым машинам.
9. Максимальный размер документа для роботов Рамблера составляет 200 килобайт. Документы большего размера усекаются до указанной величины.
Впрочем, размещать в Сети документы такого размера без особой на то необходимости - все равно дурной тон; в любом случае надо ограничивать объем документа разумными рамками.
10. Роботы Рамблера обрабатывают ссылки типа , однако наряду со ссылкой такого вида хорошо бы поместить в текст документа конструкцию . Это ускорит индексацию документов, указанных в imagemap, и облегчит доступ к документам для обычных браузеров.
11. При написании документов надо внимательно следить за соблюдением русского/латинского регистров. Часто, например вместо русской буквы
'р' используют латинскую 'p', вместо русского 'с' - латинское 'c'.
Некоторые подобные ошибки индексатор исправляет, но не все. Слова с подобными опечатками теряют информативность.
Старайтесь не использовать дефисы '-' в качестве символов переноса. При
этом слова разбиваются и теряют информативность; кроме того, такие переносы
имеют все шансы оказаться у пользователя в середине строки. Помните, что
браузер сам осуществляет представление документа согласно текущим
установкам каждого конкретного пользователя.
12. Часто изменяющиеся (динамические) документы рекомендуется исключить из списка индексируемых, т. к. актуальность этих документов быстро теряется. Осуществить это можно с помощью стандартного для HTTP механизма - посредством файла robots.txt в головной директории Вашего сайта или HTML-тега .
Части документа, не требующие, по Вашему мнению, индексации, можно отделять
в документе с помощью тегов ... . Из частей документа, размеченных этими тегами, также не будут выделены ссылки для дальнейшего
обхода.
13. При задании перекрестных ссылок в документе будьте предельно внимательны, проверьте работоспособность каждой ссылки, иначе роботы
(и пользователи!) не смогут добраться до некоторых документов.
Следует также иметь в виду, что с точки зрения HTML записи типа: и
("слэш" в конце href) являются разными ссылками. Обычно при запросе по первой ссылке робот получит редирект на вторую, а значит извлечет сам документ при обращении к серверу только на следующем проходе. Тем самым замедлится индексация сайта.
14. Необходимо относится к планированию и размещению сайта серьезно, чтобы впоследствии не пришлось забрасывать администраторов поисковых систем письмами с просьбой переиндексировать сайт в связи с его переносом или полным изменением структуры. Поисковые машины - вещь достаточно инерционная, и переиндексация не будет мгновенной.
Как управлять индексированием сайта
Использование файлов robots.txt
Роботы и файл robots.txt
Рамблер, как и другие поисковые машины, для поиска и индексации
интернет-ресурсов использует программу-робот. Робот скачивает документы, выставленные в Интернет, находит в них ссылки на другие документы, скачивает вновь найденные документы и находят в них ссылки, и так далее, пока не обойдет весь интересующий его участок Сети. Называется этот робот
StackRambler.
Когда робот-индексатор поисковой машины приходит на web-сайт (к примеру, на
http://www.rambler.ru/), он прежде всего проверяет, нет ли в корневом
каталоге сайта служебного файла robots.txt (в нашем примере -
http://www.rambler.ru/robots.txt).
Если робот обнаруживает этот документ, все дальнейшие действия по
индексированию сайта осуществляются в соответствии с указаниями robots.txt.
Можно запретить доступ к определенным каталогам и/или файлам своего сайта
любым роботам-индексаторам или же роботам конкретной поисковой системы.
Правда, инструкциям файла robots.txt (как и meta-тегов Robots, см. ниже) следуют только так называемые "вежливые" роботы - к числу которых робот-индексатор Рамблера, разумеется, относится.
Рекомендуем скачать другие рефераты по теме: скачать реферат по истории, скачать шпаргалки по праву.
Предыдущая страница реферата | 1 2 3 4 5 6 7 8 | Следующая страница реферата