robots.txt и sitemap.xml для небольшого сайта: настройка без ошибок индексации

Как настроить robots.txt и sitemap.xml на небольшом сайте. Безопасные правила для Яндекса и Google, проверка файлов и частые ошибки после переноса или установки плагинов.

Ноутбук с открытым кодом файлов robots.txt и sitemap.xml на экране, схема структуры сайта на сером фоне

Для небольшого сайта обычно достаточно аккуратно настроить два файла: robots.txt и sitemap.xml. Первый подсказывает поисковым роботам, что можно или не стоит обходить, второй помогает быстрее найти нужные URL. Главная задача здесь не в том, чтобы «написать побольше правил», а в том, чтобы не закрыть от обхода и индексации важные страницы по ошибке.

Если упростить, то robots.txt отвечает за правила обхода, а sitemap.xml — за список важных страниц, которые вы хотите показать поисковым системам. Эти файлы дополняют друг друга, но не заменяют нормальную структуру сайта, внутренние ссылки, корректные ответы сервера и понятные canonical-настройки.

Важно

Шаблон robots.txt нельзя копировать без проверки структуры конкретного сайта. Даже одна строка Disallow: / или слишком широкий запрет каталога с CSS, JS, изображениями или карточками страниц может заметно ухудшить обход и видимость сайта.

Что делают эти файлы и где они обычно лежат

  • robots.txt обычно размещают строго в корне сайта: https://example.com/robots.txt.
  • sitemap.xml чаще всего лежит по адресу https://example.com/sitemap.xml или https://example.com/sitemap_index.xml, но технически карта сайта может находиться и по другому URL, если он доступен поисковым системам.
  • Для каждого поддомена действует свой файл robots.txt. Если у вас есть отдельный блог, магазин или CDN на другом хосте, правила нужно проверять отдельно.
  • Если сайт доступен и по http, и по https, а также с www и без него, ориентироваться нужно на основной канонический адрес сайта, который реально используется в индексации.

На практике для большинства небольших проектов хватает одного корректного robots.txt в корне и одной рабочей XML-карты сайта, которую можно открыть в браузере без ошибок.

Какие директивы реально нужны небольшому сайту

Для базовой и безопасной настройки, понятной и Google, и Яндексу, обычно достаточно опираться на четыре вещи: User-agent, Disallow, Allow и строку Sitemap.

  • User-agent — указывает, для какого робота действует группа правил.
  • Disallow — запрещает обход указанного пути.
  • Allow — разрешает обход более узкого пути внутри ранее ограниченного раздела. Нужен не всегда, а только когда действительно есть конфликт правил.
  • Sitemap — подсказывает поисковикам, где лежит XML-карта сайта.

Старые «универсальные» шаблоны из интернета часто содержат спорные или лишние строки. Для Google не стоит рассчитывать на нестандартные правила в robots.txt как на обязательный рабочий инструмент. В частности, строка noindex в robots.txt не является надежным способом убрать страницу из поиска.

У Яндекса есть собственные нюансы и дополнительные возможности, но для небольшого сайта они чаще всего не обязательны. Если вы хотите использовать не базовый набор правил, сначала проверьте актуальную справку конкретного поисковика и задачу, которую реально решает эта директива, а не просто добавляйте ее «на всякий случай».

Базовый пример robots.txt

User-agent: *
Disallow: /admin/
Disallow: /tmp/
Sitemap: https://example.com/sitemap.xml

Это именно шаблон, а не готовый файл для любого проекта. Каталоги, которые нужно ограничить, зависят от структуры CMS, самописного сайта, служебных разделов и того, какие страницы вы хотите видеть в поиске.

Как не закрыть важные разделы от индексации

  1. Не запрещайте корень сайта строкой Disallow: /, если проект уже должен индексироваться.
  2. Не закрывайте каталоги со страницами статей, товаров, услуг, категорий и тегов, если именно они должны приводить поисковый трафик.
  3. Не блокируйте изображения, CSS и JS без явной причины. Если поисковик не может нормально загрузить ресурсы страницы, это может мешать корректной оценке документа.
  4. Не путайте запрет обхода и удаление из индекса. robots.txt управляет обходом, но не заменяет метатег noindex, заголовок X-Robots-Tag, удаление страницы, код ответа 404 или 410.
  5. Не добавляйте в карту сайта URL, которые сами же закрыли от обхода или пометили как noindex. Это типичный внутренний конфликт настроек.
  6. После установки SEO-плагина на CMS проверьте, не включен ли тестовый запрет индексации и не создались ли слишком широкие правила автоматически.

Частая ошибка

После переноса сайта с тестового домена или локального сервера на боевой хостинг остаются строки Disallow: /, закрытая карта сайта или включенная опция запрета индексации в CMS. Внешне сайт работает нормально, но поисковики перестают обходить важные страницы.

Какой должна быть sitemap.xml

XML-карта сайта нужна не для красоты и не для «ускорения SEO сама по себе», а как понятный список URL, которые стоит обходить и индексировать. Особенно это полезно, когда на сайте неидеальная перелинковка, есть много вложенных разделов или контент появляется регулярно.

  • Добавляйте в карту сайта только те URL, которые реально должны индексироваться.
  • Желательно, чтобы эти страницы отдавали код 200, не вели на редирект и не были помечены как noindex.
  • Если CMS генерирует несколько карт сайта, это нормально: часто используется индекс карт сайта, который ссылается на отдельные файлы по типам контента.
  • Путь к карте зависит от конкретной CMS, темы, модуля или SEO-плагина: [УТОЧНИТЬ: какой именно генератор sitemap используется на сайте].
  • Если вы меняли домен, протокол или главное зеркало, проверьте, что в карте сайта уже указаны только актуальные URL.

Простой пример sitemap.xml

<?xml version='1.0' encoding='UTF-8'?>
<urlset xmlns='http://www.sitemaps.org/schemas/sitemap/0.9'>
  <url>
    <loc>https://example.com/</loc>
  </url>
  <url>
    <loc>https://example.com/blog/</loc>
  </url>
</urlset>

Если сайт небольшой, одной карты сайта часто достаточно. Если разделов много, CMS может автоматически делать индекс карт сайта и разбивать URL по типам материалов.

Когда нужна отдельная карта сайта для изображений или новостей

  • Карта сайта для изображений нужна не каждому проекту. Она полезна, когда изображения важны для трафика, их много, они подгружаются нестандартно или вы хотите явно помочь поисковикам обнаружить медиаконтент.
  • Карта сайта для новостей обычно нужна новостным сайтам, которые регулярно публикуют свежие материалы и ориентируются на новостные вертикали поисковых систем. Для обычного корпоративного сайта, лендинга, портфолио или небольшого блога она чаще всего не обязательна.

Если у вас стандартный небольшой сайт на CMS, обычной XML-карты сайта без отдельных расширений нередко достаточно. Отдельные карты имеет смысл добавлять под конкретную задачу, а не потому, что так «делают все».

Как проверить robots.txt и sitemap.xml после настройки

Быстрая ручная проверка

  1. Откройте в браузере /robots.txt и URL карты сайта. Файлы должны загружаться без ошибок и без неожиданных редиректов на старый домен.
  2. Проверьте, что в robots.txt нет случайных глобальных запретов и что строка Sitemap ведет на актуальный файл.
  3. Проверьте несколько важных URL вручную: статьи, категории, карточки, изображения. Убедитесь, что они не закрыты правилом каталога выше по структуре.
  4. Если в карте сайта есть URL старого домена, тестового поддомена, http вместо https или варианты с www, файл нужно исправить.

Проверка в инструментах вебмастеров

  1. Добавьте сайт в Google Search Console и Яндекс Вебмастер, если этого еще не сделано.
  2. Отправьте URL карты сайта через соответствующий раздел и проверьте, принят ли файл без ошибок чтения и синтаксиса.
  3. Проверьте несколько ключевых страниц через инструменты проверки URL и убедитесь, что они не помечаются как заблокированные robots.txt.
  4. После правок дождитесь повторного обхода и снова проверьте статусы: принята ли карта сайта, нет ли предупреждений по редиректам, закрытым URL, дублям и неиндексируемым страницам.

Типовые ошибки после SEO-плагинов, переноса сайта или смены домена

  • В robots.txt остается тестовый запрет на весь сайт или на важный раздел.
  • SEO-плагин меняет путь к карте сайта, а в robots.txt и в вебмастерах остается старый URL.
  • В sitemap.xml попадают URL с редиректами, 404-страницы, страницы с noindex или служебные разделы.
  • После смены домена карта сайта продолжает отдавать старые адреса, смешивая старый и новый хост.
  • На CMS включена системная опция запрета индексации, хотя сайт уже открыт для пользователей.
  • Шаблон robots.txt взят у другого проекта и не учитывает реальную структуру каталогов, статических файлов и административных разделов.

Короткий чек-лист перед публикацией

  1. Файл robots.txt открыт по адресу /robots.txt.
  2. В нем нет случайного запрета на весь сайт.
  3. Строка Sitemap указывает на актуальную карту сайта.
  4. Карта сайта открывается и содержит только нужные URL.
  5. Важные страницы не закрыты robots.txt и не конфликтуют с noindex.
  6. После переноса, смены плагина или домена повторно проверены и robots.txt, и sitemap.xml, и статусы в инструментах вебмастеров.
  7. Шаблон адаптирован под конкретную структуру сайта, а не скопирован без проверки.

Если нужен минимальный безопасный подход, начните с простого robots.txt без лишних директив, создайте актуальную XML-карту сайта и проверьте оба файла в инструментах вебмастеров. Для небольшого сайта этого обычно достаточно, чтобы не потерять индексацию из-за технической мелочи.

Войдите, чтобы ставить лайки и сохранять статьи Перейти в VK ↗
Обсуждение

Комментарии

Только для участников

Обсуждение доступно после входа

Авторизуйтесь через VK ID, чтобы читать комментарии, отвечать, ставить лайки и сохранять статьи.

Войти через VK ID