Удаление дублей страниц через robots.txt
Использование robots.txt для борьбы с дублями на WordPress — это опасный инструмент, который при ошибке в одну строку может срезать до 30-50% органического трафика за неделю. В отличие от тега canonical, этот метод не передает вес ссылок, а просто запрещает обход, что часто приводит к «зависанию» мусорных страниц в индексе.
Почему robots.txt не удаляет страницы из индекса
Главное заблуждение новичков: директива Disallow удаляет страницу из поиска. На практике, если на закрытую страницу ведет внешняя ссылка или внутренняя перелинковка, Google проиндексирует её с пометкой «Страница исключена, так как она заблокирована в robots.txt». В итоге дубль остается в выдаче, но поисковик не видит его контент, что обнуляет шансы на ранжирование по целевым ключам.
Кейс: при закрытии технических страниц /wp-json/ и /wp-includes/ без предварительной очистки индекса, количество «мусорных» URL в Search Console за месяц выросло на 12%, так как робот перестал видеть теги noindex на этих страницах. Экспертный вывод: robots.txt — это инструмент управления краулинговым бюджетом, а не инструмент очистки индекса.
Критические дубли WordPress для блокировки
Существуют системные URL, которые должны быть закрыты по умолчанию, чтобы не распылять вес страницы. Сюда входят: страницы авторизации (/wp-login.php), админка (/wp-admin/) и результаты внутреннего поиска (?s=). Если оставить поиск открытым, при активном спам-атаке в индекс могут попасть тысячи страниц с запросами типа «cheap viagra», что приведет к пессимизации всего домена в течение 14-30 дней.
Для интернет-магазинов критична настройка пагинации для поисковых систем. Блокировка страниц пагинации через robots.txt (например, /page/*) часто приводит к тому, что товары на 2-й и 3-й страницах вылетают из индекса, снижая охват ассортимента на 20-40%. Экспертный вывод: закрывайте только чисто технические пути, которые не несут ценности для пользователя.
Сравнение robots.txt, Canonical и Noindex
Выбор метода зависит от цели. Robots.txt экономит ресурсы сервера (снижает нагрузку на CPU на 5-10% при огромных каталогах), но не передает вес. Тег Noindex полностью удаляет страницу из выдачи, но требует обхода роботом. Canonical объединяет вес нескольких дублей в один основной URL.
- Robots.txt: Экономия краулингового бюджета, риск оставить дубль в индексе.
- Noindex: Гарантированное удаление из поиска, трата бюджета на обход.
- Canonical: Идеален для вариаций товаров, передает 90-100% веса основной странице.
Пример: для вариаций одного товара (цвет, размер) лучше использовать настройка канонических ссылок для вариаций, чем закрывать их в robots.txt, так как вы теряете возможность ранжироваться по низкочастотным запросам («красное платье в горошек»). Экспертный вывод: используйте robots.txt только для того, что робот вообще не должен видеть.
Типичные ошибки при настройке Disallow
Самая фатальная ошибка — закрытие CSS и JS файлов. В 2024 году Google оценивает рендеринг страницы: если стили закрыты, он видит «голый» HTML, что приводит к падению позиций в мобильной выдаче из-за ошибки «Страница не удобна для мобильных». В результате LCP может вырасти с 2.5с до 5с+ из-за некорректного просчета отрисовки.
Еще одна ошибка — использование масок, которые перекрывают важные разделы. Например, Disallow: /category/ может случайно закрыть и полезные подкатегории. Ошибка в одном символе в файле robots.txt может привести к полной деиндексации сайта за 24-48 часов. Экспертный вывод: всегда проверяйте файл в Google Search Console или через валидатор перед деплоем на основной сервер.
Вывод
Использовать robots.txt для удаления дублей контента — стратегическая ошибка. Для очистки индекса используйте связку Noindex + Google Search Console (инструмент удаления), а для склейки дублей — тег Canonical. В robots.txt оставляйте только системные папки WordPress и страницы поиска. Начинайте с аудита текущих страниц в индексе, затем внедряйте каноникалы, и только в конце оптимизируйте краулинговый бюджет через robots.txt, чтобы не обрушить трафик из-за случайной ошибки в синтаксисе.