/* charset объявляет layout.php:12 — он открывает раньше, чем подключает этот файл (layout.php:21). Дублировать объявление здесь нельзя: страница получала три charset (layout + http-equiv + meta), что ловится валидаторами. */ К содержанию
SEO и вебмастерство
Меню сайта

Ограниченный индекс в Яндексе: не фильтр: как чистить URL


Ограниченный индекс Яндекса и чистка мусорных URL

Раздел практики: индексация.

Проверить сегодня
  • «Индексация» → «Качество индексации»: цифра и показатель
  • URL в sitemap против URL в индексе: во сколько раз расхождение
  • Случайные 20 страниц из индекса: контент или мусор с параметрами
  • robots.txt открывается и не закрывает нужное
  • «Проблемы»: есть принятые меры — это уже не ограниченный индекс

«Проиндексировано 4 000 страниц» — красивая цифра, пока не откроешь список: полезного контента триста, остальное — сортировки, пустые фильтры каталога и теги, по которым одна запись. За такое Яндекс пишет «ограниченный индекс». Это не бан: робот тратит обход впустую и сайт всерьез не воспринимает — новые страницы залетают в индекс с задержкой, позиции живого контента проседают. Про сами файлы — гайд по индексации, здесь — про кабинет и качество.

Чем отличается от фильтра

Фильтр — санкция: видна текстом в принятых мерах, снимается по запросу, бьет по позициям или выбрасывает сайт из выдачи. Ограничный индекс — оценка, не санкция: всё в поиске, но приоритет обхода низкий. «Запроса на снятие» у него нет — чинить надо не нарушение, а структуру URL.

Откуда берется мусор

Мусор почти всегда плодит сам сайт. Типовые источники:

  • Сортировки и пагинация с параметрами: ?sort=price, ?p=2 и комбинации — разный адрес, одно содержимое.
  • Фильтры каталога без результатов: товаров ноль, URL живой.
  • Теги и архивы по одной записи: 800 тегов, у половины — одна статья.
  • Старые URL после переездов без 301, версии для печати.
  • Служебные страницы из шапки: корзина, сравнение, поиск по сайту.

Признак запущенного случая: в индексе адреса с параметром, которого вы не используете, — робот сам собрал комбинации.

Как проверить

Смотрите с четырех сторон:

  • «Качество индексации»: число страниц против реального количества статей — расхождение в разы.
  • site:домен с фрагментами шаблонов (?sort=, /tag/, ?print) — сколько мусора видно из выдачи.
  • Выгрузка проиндексированных URL и группировка по шаблонам адресов.
  • Логи сервера: по каким URL робот ходит чаще всего — там же и генератор мусора.

Чистка: порядок

Сначала убираете источник мусора, потом вылавливаете последствия; наоборот — бесконечная ручная работа. Мертвым страницам — 410, переехавшим — 301 на ближайший живой адрес, не на главную. Дублям с параметрами — canonical плюс закрытие параметра в robots.txt. Пустые фильтры — просто перестать на них ссылаться из шаблона. Sitemap перегенерировать по полезным каноническим URL и подать заново; удаленные, но висящие в выдаче адреса — инструментом удаления из поиска, разово. Спутник работы — разбор 404 и редиректов.

Типичный случай

Магазин: 12 000 страниц в индексе при 1 400 товарах и 90 статьях. По шаблонам: 8 000 фильтров, 2 000 пагинации с перепутанными параметрами. Убрали ссылки на пустые выборки, пересобрали sitemap. Показатель вышел из красного через месяц, статьи снова индексируются в день публикации. Быстрым это не бывает: пересчет идет волнами.

Чего не делать

Три действия портят индекс сильнее мусора:

  • Закрыть мусор только robots.txt: запрет не удаляет из индекса. Нужна связка 404/410 или noindex плюс запрет новых порций.
  • Ставить noindex на страницы, закрытые от краулера, — адрес висит в выдаче годами.
  • Удалять разделы без выгрузки и группировки URL по шаблонам: одна ошибка в условии — и закроете живой каталог.

Что склеить, что оставить живым — часть контентного плана: обновление URL. Ограниченный индекс чинится в шаблоне и правилах перелинковки; кабинет только подтверждает результат.

Дальше: практика: индексация · чеклист кабинетов · базовый курс.