Ограниченный индекс в Яндексе: не фильтр: как чистить URL

Раздел практики: индексация.
- «Индексация» → «Качество индексации»: цифра и показатель
- URL в sitemap против URL в индексе: во сколько раз расхождение
- Случайные 20 страниц из индекса: контент или мусор с параметрами
- robots.txt открывается и не закрывает нужное
- «Проблемы»: есть принятые меры — это уже не ограниченный индекс
«Проиндексировано 4 000 страниц» — красивая цифра, пока не откроешь список: полезного контента триста, остальное — сортировки, пустые фильтры каталога и теги, по которым одна запись. За такое Яндекс пишет «ограниченный индекс». Это не бан: робот тратит обход впустую и сайт всерьез не воспринимает — новые страницы залетают в индекс с задержкой, позиции живого контента проседают. Про сами файлы — гайд по индексации, здесь — про кабинет и качество.
Чем отличается от фильтра
Фильтр — санкция: видна текстом в принятых мерах, снимается по запросу, бьет по позициям или выбрасывает сайт из выдачи. Ограничный индекс — оценка, не санкция: всё в поиске, но приоритет обхода низкий. «Запроса на снятие» у него нет — чинить надо не нарушение, а структуру URL.
Откуда берется мусор
Мусор почти всегда плодит сам сайт. Типовые источники:
- Сортировки и пагинация с параметрами: ?sort=price, ?p=2 и комбинации — разный адрес, одно содержимое.
- Фильтры каталога без результатов: товаров ноль, URL живой.
- Теги и архивы по одной записи: 800 тегов, у половины — одна статья.
- Старые URL после переездов без 301, версии для печати.
- Служебные страницы из шапки: корзина, сравнение, поиск по сайту.
Признак запущенного случая: в индексе адреса с параметром, которого вы не используете, — робот сам собрал комбинации.
Как проверить
Смотрите с четырех сторон:
- «Качество индексации»: число страниц против реального количества статей — расхождение в разы.
- site:домен с фрагментами шаблонов (?sort=, /tag/, ?print) — сколько мусора видно из выдачи.
- Выгрузка проиндексированных URL и группировка по шаблонам адресов.
- Логи сервера: по каким URL робот ходит чаще всего — там же и генератор мусора.
Чистка: порядок
Сначала убираете источник мусора, потом вылавливаете последствия; наоборот — бесконечная ручная работа. Мертвым страницам — 410, переехавшим — 301 на ближайший живой адрес, не на главную. Дублям с параметрами — canonical плюс закрытие параметра в robots.txt. Пустые фильтры — просто перестать на них ссылаться из шаблона. Sitemap перегенерировать по полезным каноническим URL и подать заново; удаленные, но висящие в выдаче адреса — инструментом удаления из поиска, разово. Спутник работы — разбор 404 и редиректов.
Типичный случай
Магазин: 12 000 страниц в индексе при 1 400 товарах и 90 статьях. По шаблонам: 8 000 фильтров, 2 000 пагинации с перепутанными параметрами. Убрали ссылки на пустые выборки, пересобрали sitemap. Показатель вышел из красного через месяц, статьи снова индексируются в день публикации. Быстрым это не бывает: пересчет идет волнами.
Чего не делать
Три действия портят индекс сильнее мусора:
- Закрыть мусор только robots.txt: запрет не удаляет из индекса. Нужна связка 404/410 или noindex плюс запрет новых порций.
- Ставить noindex на страницы, закрытые от краулера, — адрес висит в выдаче годами.
- Удалять разделы без выгрузки и группировки URL по шаблонам: одна ошибка в условии — и закроете живой каталог.
Что склеить, что оставить живым — часть контентного плана: обновление URL. Ограниченный индекс чинится в шаблоне и правилах перелинковки; кабинет только подтверждает результат.
Дальше: практика: индексация · чеклист кабинетов · базовый курс.