wpgenerate.ru wordpress wpgenerate.ru

Как настроить robots.txt в WordPress для закрытия технических страниц

В WordPress robots.txt часто используют не по назначению: пытаются им «починить SEO», закрыть дубли или спрятать всё подряд. На практике этот файл нужен для более узкой задачи — подсказать поисковым роботам, какие технические URL не стоит обходить. Это не замена noindex и не инструмент для удаления уже проиндексированных страниц из выдачи.

Если на сайте появились лишние служебные адреса, мусорные параметры, результаты поиска по сайту, служебные фиды или системные пути плагинов, robots.txt помогает сократить лишний crawl budget и убрать шум в логах. Но работает он только тогда, когда вы понимаете, что именно закрываете и зачем.

Какие страницы в WordPress обычно закрывают через robots.txt

Не все технические URL одинаково полезно закрывать. Часть из них действительно не нужна роботам, а часть лучше оставить доступной для обхода, иначе вы сами себе создадите проблемы с индексацией.

Что обычно имеет смысл закрыть

  • /wp-admin/ — административная часть сайта;
  • /wp-login.php — страница входа;
  • /wp-json/ — только если у вас есть конкретная причина ограничить обход REST API, и вы понимаете последствия;
  • служебные каталоги плагинов, если они отдают публичные файлы, не нужные в поиске;
  • внутренний поиск по сайту, если он генерирует много мусорных URL;
  • параметры сортировки и фильтрации, если они создают бесконечные комбинации страниц.

Что лучше не закрывать без проверки

  • /wp-content/uploads/ — там лежат изображения и файлы, которые часто должны индексироваться;
  • CSS и JS-файлы темы и плагинов — поисковикам они обычно не мешают;
  • страницы, которые уже должны быть закрыты через noindex, а не через robots.txt;
  • URL, которые нужны для корректной работы превью, oEmbed или API-интеграций.

Диагностика: что именно мешает сейчас

Перед правкой robots.txt стоит понять, какая у вас проблема: лишний обход, дубли, мусорные параметры или конфликт с SEO-плагином. Иначе легко закрыть не то, что нужно.

Проверьте три вещи:

  1. Откройте /robots.txt в браузере и посмотрите, кто его формирует — тема, плагин SEO или сервер.
  2. Посмотрите, нет ли там уже правил, которые добавляет SEO-плагин. Ручное редактирование в админке и правка файла на сервере часто конфликтуют.
  3. Сравните robots.txt с реальными URL из логов или отчёта обхода в Google Search Console: если робот тратит время на поиск, архивы автора, параметры и внутренний поиск, это уже повод для настройки.

Если сайт на WordPress и используется SEO-плагин, robots.txt часто генерируется динамически. В таком случае редактировать физический файл на сервере может быть бессмысленно: плагин просто отдаст свой вариант.

Пошаговая настройка robots.txt в WordPress

Самый безопасный путь — сначала собрать минимальный набор правил, потом проверить, не сломали ли вы доступ к нужным ресурсам. Ниже рабочий вариант для типового сайта.

1. Начните с базового файла

Если robots.txt ещё не настроен, используйте короткий и понятный набор правил. Не добавляйте десятки директив «на всякий случай».

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /wp-login.php
Disallow: /?s=
Disallow: /search/
Disallow: /feed/

Этот вариант не универсален. Например, если у вас поиск на сайте реализован через красивый URL, а не через ?s=, правило нужно менять. Если фиды используются для подписок или интеграций, закрывать их не стоит.

2. Добавьте правила только для реально мусорных URL

Если на сайте есть параметры сортировки, фильтров или UTM-подобные хвосты, robots.txt может помочь уменьшить обход. Но не пытайтесь закрыть все параметры подряд: поисковики не всегда интерпретируют такие правила одинаково, а часть URL всё равно может попасть в индекс по внешним ссылкам.

User-agent: *
Disallow: /*?orderby=
Disallow: /*?filter_
Disallow: /*?replytocom=

Такой подход полезен только тогда, когда вы точно знаете структуру URL. Если параметры генерирует плагин фильтров, сначала проверьте, есть ли у него собственные настройки индексации и canonical.

3. Если robots.txt генерирует SEO-плагин, правьте его там

У многих SEO-плагинов есть встроенный редактор robots.txt. Это удобнее, чем править файл вручную, потому что вы не потеряете изменения после обновления или деплоя. Если же плагин не даёт нужной гибкости, можно использовать фильтр robots_txt.

add_filter( 'robots_txt', function( $output, $public ) {
	$output .= "\nUser-agent: *\n";
	$output .= "Disallow: /wp-login.php\n";
	$output .= "Disallow: /search/\n";
	$output .= "Allow: /wp-admin/admin-ajax.php\n";

	return $output;
}, 10, 2 );

Этот код можно добавить в дочернюю тему или в небольшой mu-plugin. Второй вариант надёжнее, если тема часто меняется.

Сравнение подходов: плагин, код или ручной файл

ПодходКогда подходитМинусы
Редактор в SEO-плагинеЕсли robots.txt уже управляется плагином и нужен быстрый контрольЗависимость от настроек плагина, не всегда удобно для сложных правил
Фильтр robots_txtЕсли нужен кодовый контроль и версионированиеТребует доступа к коду и аккуратного тестирования
Физический файл на сервереЕсли сайт не использует динамическую генерацию robots.txtМожет быть перекрыт плагином или серверной логикой

Проверка результата после внедрения

После изменения robots.txt важно не ограничиться открытием файла в браузере. Нужно проверить, что правила реально отдаются поисковикам и не мешают нужным страницам.

  • Откройте https://ваш-домен.ru/robots.txt и убедитесь, что там именно тот текст, который вы ожидаете.
  • Проверьте, не закрыт ли доступ к CSS, JS и изображениям, если они нужны для рендеринга страниц.
  • В Google Search Console используйте проверку URL и посмотрите, не стал ли нужный адрес недоступен для обхода.
  • Если у вас есть серверные логи, сравните количество обращений к закрытым служебным URL до и после правки.

Хороший признак — робот перестал тратить время на служебные адреса, но страницы каталога, записей и медиа остались доступны для обхода.

Частые ошибки и как их исправить

Закрывают через robots.txt то, что нужно скрывать через noindex

Если страница уже попала в индекс, robots.txt не гарантирует её удаление. В таком случае сначала убирают индексацию через noindex или canonical, а потом уже ограничивают обход, если это уместно.

Случайно закрывают медиафайлы

Одна из типичных ошибок — правило вроде Disallow: /wp-content/. После этого поисковик может хуже видеть изображения, а часть страниц потеряет корректный рендеринг. Если нужно закрыть только конкретный каталог, указывайте его точнее.

Дублируют правила в плагине и в файле

Когда robots.txt правят одновременно в SEO-плагине, в теме и на сервере, итоговый файл становится непредсказуемым. Оставьте один источник правды: либо плагин, либо код, либо физический файл.

Используют robots.txt как средство защиты

Закрытие URL от обхода не защищает их от прямого доступа. Если нужен реальный контроль, используйте авторизацию, ограничения на уровне сервера или корректные права доступа.

Чек-лист перед публикацией изменений

  • Проверен текущий источник robots.txt: плагин, код или файл.
  • Не закрыты CSS, JS и изображения, нужные для отображения сайта.
  • Служебные URL закрыты точечно, без широких масок по всему каталогу.
  • Поиск по сайту и параметры фильтров проверены на реальных URL.
  • Файл доступен по /robots.txt и отдается без ошибок.
  • После изменения проверены Google Search Console и серверные логи.

Практические советы по безопасности и производительности

Если сайт часто генерирует мусорные URL, robots.txt стоит рассматривать как часть общей технической чистки, а не как отдельную меру. Иногда полезнее убрать источник проблемы: отключить лишние архивы, ограничить параметры фильтрации, настроить canonical, закрыть служебные страницы от индексации на уровне SEO-плагина.

Для больших сайтов лучше хранить правила в коде или в управляемом конфиге, а не редактировать их вручную в админке. Так проще отслеживать изменения и откатывать их после обновлений. Если у вас несколько окружений, убедитесь, что robots.txt одинаково ведёт себя на staging и production.

Если нужен более широкий технический аудит сайта, часто полезно сначала убрать дубли и служебные страницы с помощью инструментов вроде Clearfy Pro, а уже потом точечно допиливать robots.txt под конкретную структуру URL.

×

AI-плагин от WPShop.ru

анализирует конкурентов

пишет статьи

готовит SEO

генерирует изображения

и еще кое-что...
WPGPT
Плагин, который наполняет ваш сайт WordPress
Узнать больше