Для небольшого сайта обычно достаточно аккуратно настроить два файла: robots.txt и sitemap.xml. Первый подсказывает поисковым роботам, что можно или не стоит обходить, второй помогает быстрее найти нужные URL. Главная задача здесь не в том, чтобы «написать побольше правил», а в том, чтобы не закрыть от обхода и индексации важные страницы по ошибке.
Если упростить, то robots.txt отвечает за правила обхода, а sitemap.xml — за список важных страниц, которые вы хотите показать поисковым системам. Эти файлы дополняют друг друга, но не заменяют нормальную структуру сайта, внутренние ссылки, корректные ответы сервера и понятные canonical-настройки.
Важно
Шаблон robots.txt нельзя копировать без проверки структуры конкретного сайта. Даже одна строка Disallow: / или слишком широкий запрет каталога с CSS, JS, изображениями или карточками страниц может заметно ухудшить обход и видимость сайта.
Что делают эти файлы и где они обычно лежат
- robots.txt обычно размещают строго в корне сайта:
https://example.com/robots.txt. - sitemap.xml чаще всего лежит по адресу
https://example.com/sitemap.xmlилиhttps://example.com/sitemap_index.xml, но технически карта сайта может находиться и по другому URL, если он доступен поисковым системам. - Для каждого поддомена действует свой файл
robots.txt. Если у вас есть отдельный блог, магазин или CDN на другом хосте, правила нужно проверять отдельно. - Если сайт доступен и по
http, и поhttps, а также сwwwи без него, ориентироваться нужно на основной канонический адрес сайта, который реально используется в индексации.
На практике для большинства небольших проектов хватает одного корректного robots.txt в корне и одной рабочей XML-карты сайта, которую можно открыть в браузере без ошибок.
Какие директивы реально нужны небольшому сайту
Для базовой и безопасной настройки, понятной и Google, и Яндексу, обычно достаточно опираться на четыре вещи: User-agent, Disallow, Allow и строку Sitemap.
- User-agent — указывает, для какого робота действует группа правил.
- Disallow — запрещает обход указанного пути.
- Allow — разрешает обход более узкого пути внутри ранее ограниченного раздела. Нужен не всегда, а только когда действительно есть конфликт правил.
- Sitemap — подсказывает поисковикам, где лежит XML-карта сайта.
Старые «универсальные» шаблоны из интернета часто содержат спорные или лишние строки. Для Google не стоит рассчитывать на нестандартные правила в robots.txt как на обязательный рабочий инструмент. В частности, строка noindex в robots.txt не является надежным способом убрать страницу из поиска.
У Яндекса есть собственные нюансы и дополнительные возможности, но для небольшого сайта они чаще всего не обязательны. Если вы хотите использовать не базовый набор правил, сначала проверьте актуальную справку конкретного поисковика и задачу, которую реально решает эта директива, а не просто добавляйте ее «на всякий случай».
Базовый пример robots.txt
User-agent: *
Disallow: /admin/
Disallow: /tmp/
Sitemap: https://example.com/sitemap.xml
Это именно шаблон, а не готовый файл для любого проекта. Каталоги, которые нужно ограничить, зависят от структуры CMS, самописного сайта, служебных разделов и того, какие страницы вы хотите видеть в поиске.
Как не закрыть важные разделы от индексации
- Не запрещайте корень сайта строкой
Disallow: /, если проект уже должен индексироваться. - Не закрывайте каталоги со страницами статей, товаров, услуг, категорий и тегов, если именно они должны приводить поисковый трафик.
- Не блокируйте изображения, CSS и JS без явной причины. Если поисковик не может нормально загрузить ресурсы страницы, это может мешать корректной оценке документа.
- Не путайте запрет обхода и удаление из индекса.
robots.txtуправляет обходом, но не заменяет метатегnoindex, заголовокX-Robots-Tag, удаление страницы, код ответа404или410. - Не добавляйте в карту сайта URL, которые сами же закрыли от обхода или пометили как
noindex. Это типичный внутренний конфликт настроек. - После установки SEO-плагина на CMS проверьте, не включен ли тестовый запрет индексации и не создались ли слишком широкие правила автоматически.
Частая ошибка
После переноса сайта с тестового домена или локального сервера на боевой хостинг остаются строки Disallow: /, закрытая карта сайта или включенная опция запрета индексации в CMS. Внешне сайт работает нормально, но поисковики перестают обходить важные страницы.
Какой должна быть sitemap.xml
XML-карта сайта нужна не для красоты и не для «ускорения SEO сама по себе», а как понятный список URL, которые стоит обходить и индексировать. Особенно это полезно, когда на сайте неидеальная перелинковка, есть много вложенных разделов или контент появляется регулярно.
- Добавляйте в карту сайта только те URL, которые реально должны индексироваться.
- Желательно, чтобы эти страницы отдавали код
200, не вели на редирект и не были помечены какnoindex. - Если CMS генерирует несколько карт сайта, это нормально: часто используется индекс карт сайта, который ссылается на отдельные файлы по типам контента.
- Путь к карте зависит от конкретной CMS, темы, модуля или SEO-плагина: [УТОЧНИТЬ: какой именно генератор sitemap используется на сайте].
- Если вы меняли домен, протокол или главное зеркало, проверьте, что в карте сайта уже указаны только актуальные URL.
Простой пример sitemap.xml
<?xml version='1.0' encoding='UTF-8'?>
<urlset xmlns='http://www.sitemaps.org/schemas/sitemap/0.9'>
<url>
<loc>https://example.com/</loc>
</url>
<url>
<loc>https://example.com/blog/</loc>
</url>
</urlset>
Если сайт небольшой, одной карты сайта часто достаточно. Если разделов много, CMS может автоматически делать индекс карт сайта и разбивать URL по типам материалов.
Когда нужна отдельная карта сайта для изображений или новостей
- Карта сайта для изображений нужна не каждому проекту. Она полезна, когда изображения важны для трафика, их много, они подгружаются нестандартно или вы хотите явно помочь поисковикам обнаружить медиаконтент.
- Карта сайта для новостей обычно нужна новостным сайтам, которые регулярно публикуют свежие материалы и ориентируются на новостные вертикали поисковых систем. Для обычного корпоративного сайта, лендинга, портфолио или небольшого блога она чаще всего не обязательна.
Если у вас стандартный небольшой сайт на CMS, обычной XML-карты сайта без отдельных расширений нередко достаточно. Отдельные карты имеет смысл добавлять под конкретную задачу, а не потому, что так «делают все».
Как проверить robots.txt и sitemap.xml после настройки
Быстрая ручная проверка
- Откройте в браузере
/robots.txtи URL карты сайта. Файлы должны загружаться без ошибок и без неожиданных редиректов на старый домен. - Проверьте, что в
robots.txtнет случайных глобальных запретов и что строкаSitemapведет на актуальный файл. - Проверьте несколько важных URL вручную: статьи, категории, карточки, изображения. Убедитесь, что они не закрыты правилом каталога выше по структуре.
- Если в карте сайта есть URL старого домена, тестового поддомена,
httpвместоhttpsили варианты сwww, файл нужно исправить.
Проверка в инструментах вебмастеров
- Добавьте сайт в Google Search Console и Яндекс Вебмастер, если этого еще не сделано.
- Отправьте URL карты сайта через соответствующий раздел и проверьте, принят ли файл без ошибок чтения и синтаксиса.
- Проверьте несколько ключевых страниц через инструменты проверки URL и убедитесь, что они не помечаются как заблокированные
robots.txt. - После правок дождитесь повторного обхода и снова проверьте статусы: принята ли карта сайта, нет ли предупреждений по редиректам, закрытым URL, дублям и неиндексируемым страницам.
Типовые ошибки после SEO-плагинов, переноса сайта или смены домена
- В
robots.txtостается тестовый запрет на весь сайт или на важный раздел. - SEO-плагин меняет путь к карте сайта, а в
robots.txtи в вебмастерах остается старый URL. - В
sitemap.xmlпопадают URL с редиректами, 404-страницы, страницы сnoindexили служебные разделы. - После смены домена карта сайта продолжает отдавать старые адреса, смешивая старый и новый хост.
- На CMS включена системная опция запрета индексации, хотя сайт уже открыт для пользователей.
- Шаблон
robots.txtвзят у другого проекта и не учитывает реальную структуру каталогов, статических файлов и административных разделов.
Короткий чек-лист перед публикацией
- Файл
robots.txtоткрыт по адресу/robots.txt. - В нем нет случайного запрета на весь сайт.
- Строка
Sitemapуказывает на актуальную карту сайта. - Карта сайта открывается и содержит только нужные URL.
- Важные страницы не закрыты
robots.txtи не конфликтуют сnoindex. - После переноса, смены плагина или домена повторно проверены и
robots.txt, иsitemap.xml, и статусы в инструментах вебмастеров. - Шаблон адаптирован под конкретную структуру сайта, а не скопирован без проверки.
Если нужен минимальный безопасный подход, начните с простого robots.txt без лишних директив, создайте актуальную XML-карту сайта и проверьте оба файла в инструментах вебмастеров. Для небольшого сайта этого обычно достаточно, чтобы не потерять индексацию из-за технической мелочи.
Комментарии
Обсуждение доступно после входа
Авторизуйтесь через VK ID, чтобы читать комментарии, отвечать, ставить лайки и сохранять статьи.