Индексация: robots, sitemap и обход

Обновлено в августе 2026.
Раздел практики: Индексация.
- 1robots.txtДоступ роботаГде смотреть: /robots.txt · Цель: закрыто только нужное
- 2SitemapКарта URLГде смотреть: кабинеты · Цель: файл без ошибок
- 3КабинетыПокрытие и ошибкиГде смотреть: ЯВ и GC · Цель: ошибок 0
Сделайте сегодня: Проверьте /robots.txt и отправьте sitemap в оба кабинета вебмастера.
Индексация — попадание URL в базу поиска. Без индекса нет органики. В 2026 схема простая: открыть нужные страницы, закрыть служебные, отдать карту сайта и проверить кабинеты.
Связка: robots.txt · sitemap · кабинеты · поиск 2026.
Что должно быть в индексе
В индекс нужны страницы с ответом на запрос: главная, разделы, гайды, карточки услуг. Не нужны: корзина, личный кабинет, дубли с параметрами, черновики, технические фильтры без текста. На bigfozzy.com я требую четыре условия: один канонический URL на документ, ответ 200 и нормальная скорость, внутренние ссылки с хабов, понятный title и H1.
robots.txt по-простому
Файл в корне подсказывает краулеру, куда не ходить. Это не замена noindex. Минимальный пример:
User-agent: * Allow: / Disallow: /wp-admin/Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap.xml
Не закрывайте CSS/JS для отрисовки. Не ставьте Disallow на весь сайт «на всякий случай». Подробности: гайд по robots.txt.
Sitemap
XML-карта — список важных канонических URL. Удалите 404 и редиректы из карты. Отправьте файл в Яндекс.Вебмастер и Google Search Console (консоль поиска). Гайд: sitemap.
Обход и «бюджет»
Малому сайту редко не хватает обхода. Мешают тысячи тонких дублей, бессмысленная пагинация и цепочки редиректов. Лучше 50 сильных URL, чем 500 пустых. На bigfozzy.com я убираю дубли с параметрами (?utm, print, sort), ставлю 301 на каноникал и связываю хабы с гайдами — помогает перелинковка.
Проверка в кабинетах
Раз в неделю: ошибки сканирования, исключённые страницы, покрытие. Если важный URL не индексируется — проверьте noindex, качество и ссылки. Чеклист кабинетов.
Диагностика «страница не в индексе»
Когда страница не в индексе, я действую по порядку. Открываю URL без авторизации — код 200, не 302-петля. Смотрю исходник: нет ли meta robots noindex и X-Robots-Tag. Проверяю, что страница есть в sitemap и доступна из меню или хаба. Сравниваю текст с 2–3 «почти копиями» на сайте — объединяю дубли. Запрашиваю переобход и жду несколько дней, не сутки. Если кабинеты молчат, а URL тонкий — пара абзацев без фактов — сначала усиливаю страницу, потом снова прошу индекс.
Частые ошибки
Пять ошибок, которые я видел чаще всего. Весь сайт в Disallow — «на всякий случай» закрыли всё. Sitemap со старыми 404 — карта давно не обновлялась. noindex на нужных разделах после миграции — забыли снять. HTTP/HTTPS и www без единого 301 — два зеркала живут отдельно. Разные URL одного текста без canonical — поиск не знает, какой главный.
План на один день
За один вечер на bigfozzy.com я открываю robots.txt и sitemap в браузере, проверяю 10 важных URL — код ответа и сниппет. Исправляю 2–3 дубля или 404 с трафиком, затем запрашиваю переобход.
Связь с курсом
Индексация — база курса. Дальше контент и перелинковка. Базовый курс SEO · структура.
Связка с миграцией и HTTPS
После смены домена, CMS или включения HTTPS проверьте цепочку: старый URL — один 301 — каноникал. Двойные редиректы и смешанный контент тормозят переобход. Обновите sitemap на новые адреса и переотправьте карту в кабинетах. Пока идёт переезд, не закрывайте старые URL в robots — иначе поиск потеряет путь к 301. Пошаговый переезд домена: смена домена сайта.
Отдельно проверьте главное зеркало (www / без www). В кабинете должно быть одно предпочтительное зеркало, на сайте — единый 301. Иначе одна и та же статья живёт как два документа.