Робот Яндекса не видит ваш сайт так, как его видит человек. Он не листает страницы и не оценивает дизайн — он скачивает HTML, разбирает ссылки, ставит новые адреса в очередь и решает, что и когда индексировать. Если этот процесс налажен плохо, свежие страницы попадают в поиск через недели, а часть вообще остаётся за бортом индекса. В SEO с 2005 года я регулярно вижу одну и ту же картину: контент готов, а трафика нет, потому что робот до страниц просто не дошёл или счёл их лишними. Ниже — как реально работает краулинг и индексация Яндекса и что делать, чтобы обход шёл быстро и по нужным адресам.
Как робот обходит сайт: краулинг и индексация
Важно разделять два разных процесса, которые часто путают.
Краулинг (обход) — робот скачивает страницу по URL, читает её код и извлекает ссылки. У Яндекса есть два типа роботов: основной индексирующий робот и быстрый робот (его иногда называют быстроботом), который оперативно подхватывает свежий и часто обновляемый контент — новости, объявления, посты блога.
Индексация — обработка скачанного: разбор содержимого, оценка качества и полезности, принятие решения о включении страницы в поисковый индекс. Обойти страницу и проиндексировать её — не одно и то же. Робот может регулярно заходить на URL и при этом не добавлять его в индекс, если считает страницу малополезной, дублем или технически недоступной.
Упрощённо цикл выглядит так: робот берёт URL из очереди → скачивает → извлекает ссылки и добавляет новые адреса в очередь → передаёт содержимое на индексацию → ранжирование в выдаче. Ваша задача на техническом уровне — сделать так, чтобы нужные страницы попадали в очередь быстро, а ненужные её не засоряли.
robots.txt: что можно и нельзя закрывать
Файл robots.txt лежит в корне сайта (https://site.ru/robots.txt) и задаёт роботам правила обхода. Ключевой момент, который упускают: запрет в robots.txt закрывает обход, но не гарантирует отсутствия страницы в индексе — если на URL ведут ссылки, он может попасть в поиск без сниппета. Для надёжного исключения страницы из индекса используют мета-тег noindex на самой странице (а её при этом нельзя закрывать в robots.txt, иначе робот не увидит тег).
| Директива | Что делает |
|---|---|
User-agent |
Указывает, к какому роботу относятся правила. Yandex — роботы Яндекса, * — все роботы. |
Disallow |
Запрещает обход указанного пути или раздела. |
Allow |
Разрешает обход внутри запрещённого раздела (исключение из Disallow). |
Sitemap |
Указывает полный адрес карты сайта. Директива глобальная, действует для всех роботов. |
Clean-param |
Сообщает Яндексу о незначащих GET-параметрах (метки, сортировки), чтобы не плодить дубли URL. |
Crawl-delay |
Устарела и не учитывается. Скорость обхода настраивается в Яндекс.Вебмастере. |
Минимальный корректный пример для сайта:
User-agent: *
Disallow: /wp-admin/
Disallow: /*?s=
Allow: /wp-admin/admin-ajax.php
Clean-param: utm_source&utm_medium&utm_campaign
Sitemap: https://site.ru/sitemap.xml
Частые ошибки, которые я нахожу при аудитах: закрыт весь сайт строкой Disallow: / (осталась с этапа разработки), закрыты CSS и JS (тогда робот не видит страницу так, как пользователь), закрыты нужные разделы через слишком широкую маску. После правки всегда проверяйте файл через инструмент «Анализ robots.txt» в Яндекс.Вебмастере — он покажет, какие URL разрешены, а какие заблокированы.
sitemap.xml: карта для робота
Файл sitemap.xml — это список URL, которые вы хотите видеть в индексе, с указанием даты последнего изменения. Карта не заставляет робота индексировать страницы, но помогает ему быстрее находить новые и обновлённые адреса, особенно на больших сайтах со слабой перелинковкой.
Практические правила:
- В карту включают только индексируемые страницы, отдающие код 200: без редиректов, 404, дублей и закрытых в robots.txt адресов.
- Тег
<lastmod>должен отражать реальную дату изменения — по нему робот понимает, что страницу стоит переобойти. - В одном файле не более 50 000 URL. Для крупных сайтов делают несколько карт и объединяют их в индексный sitemap.
- Адрес карты указывают в robots.txt и добавляют в Вебмастере в разделе «Индексирование → Файлы Sitemap».
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://site.ru/stranica/</loc>
<lastmod>2026-08-11</lastmod>
</url>
</urlset>
Краулинговый бюджет: почему он важен
Краулинговый бюджет — это количество страниц, которое робот готов обойти на вашем сайте за определённый период. Для небольшого сайта на несколько сотен страниц бюджет обычно не проблема: робот успевает обойти всё. Вопрос становится острым на крупных проектах — интернет-магазинах с фильтрами, каталогах, сайтах с тысячами страниц. Там робот тратит ресурс на мусорные URL и не доходит до важных.
Куда чаще всего утекает бюджет:
- Дубли из-за GET-параметров — сортировки, фильтры, UTM-метки создают десятки версий одной страницы. Решается через
Clean-paramи канонические ссылки. - Бесконечная пагинация и календари — робот ходит по страницам, которые не несут ценности.
- Цепочки редиректов и битые ссылки — каждый лишний хоп тратит запрос робота.
- Медленный ответ сервера — чем дольше отдаётся страница, тем меньше их робот успевает скачать. Ускорение сервера напрямую увеличивает глубину обхода.
Оптимизация бюджета сводится к простому: убрать из зоны обхода всё лишнее (мусорные параметры, дубли, технические разделы) и облегчить доступ к важному (быстрый сервер, логичная перелинковка, актуальный sitemap). Приоритетные страницы должны быть в 2-3 кликах от главной.
Почему страница не попадает в индекс
Статус страницы всегда можно посмотреть в Яндекс.Вебмастере: «Индексирование → Страницы в поиске» и инструмент «Проверить статус URL». Он показывает, обошёл ли робот адрес и почему исключил его. Ниже — типовые причины и что с ними делать.
| Причина | Решение |
|---|---|
| Закрыта в robots.txt | Убрать запрещающее правило, проверить через «Анализ robots.txt». |
Мета-тег или заголовок noindex |
Убрать <meta name="robots" content="noindex"> и HTTP-заголовок X-Robots-Tag. |
| «Недостаточно качественная» | Дополнить контент, убрать шаблонность, закрыть реальную потребность пользователя. |
| Дубль другой страницы | Настроить rel="canonical" на основной URL, убрать дубли параметров. |
| Нет входящих ссылок (страница-сирота) | Добавить ссылки из меню, разделов и других статей, включить в sitemap. |
| Ошибка ответа сервера (404, 5xx, редирект) | Обеспечить корректный код 200 для нужного URL. |
| Страница новая, робот не дошёл | Отправить на переобход, использовать IndexNow, проверить sitemap. |
Статус «Недостаточно качественная» — самый частый и самый неприятный: технически страница доступна, но алгоритм решил, что она не заслуживает места в индексе. Лечится не техникой, а содержанием: страница должна давать пользователю больше, чем аналоги в выдаче. Если типовых страниц много и качество проседает системно, помогает доработка сайта — от структуры до наполнения.
Как ускорить обход и индексацию
Когда страница готова и технически чистая, обход можно ускорить несколькими инструментами.
Переобход в Яндекс.Вебмастере
Раздел «Индексирование → Переобход страниц»: вставляете список URL (лимит на количество в сутки ограничен) и отправляете. Робот приходит на эти адреса в приоритетном порядке — обычно в течение нескольких дней. Это ручной инструмент для точечной задачи: опубликовали важную страницу или обновили существующую — отправили на переобход.
IndexNow
IndexNow — протокол, который позволяет мгновенно уведомлять поисковые системы (Яндекс, Bing и другие, поддерживающие протокол) об изменении URL, не дожидаясь, пока робот сам придёт. Работает так: генерируете ключ, кладёте текстовый файл с ключом в корень сайта и при публикации или изменении страницы отправляете пинг.
GET https://yandex.com/indexnow?url=https://site.ru/novaya-stranica/&key=ВАШ_КЛЮЧ
На WordPress и других CMS это делается плагином или встроенной интеграцией — пинг уходит автоматически при каждой публикации. Для сайтов с частым обновлением контента IndexNow заметно сокращает срок попадания в индекс.
Внутренние ссылки и обновление контента
Робот находит новые страницы по ссылкам. Чем лучше перелинковка, тем быстрее обход: новая статья, на которую ссылаются из свежих материалов и разделов, будет обойдена раньше страницы-сироты. Регулярное обновление существующих страниц с корректным lastmod в sitemap тоже провоцирует переобход.
Чеклист технической готовности к индексации
| Пункт | Как проверить |
|---|---|
| Страница отдаёт код 200 | Инструмент проверки ответа сервера, «Проверить статус URL». |
| URL не закрыт в robots.txt | «Анализ robots.txt» в Вебмастере. |
| Нет мета-тега noindex | Просмотр исходного кода страницы. |
| Задан корректный canonical | Проверка <link rel="canonical"> в коде. |
| Страница есть в sitemap.xml | Открыть карту, найти URL. |
| На страницу ведут внутренние ссылки | Меню, разделы, связанные статьи. |
| Отправлен переобход / IndexNow | Раздел «Переобход страниц», логи пинга. |
| Контент уникален и полезен | Оценка полноты ответа на запрос пользователя. |
Частые вопросы
Сколько времени занимает индексация новой страницы?
Однозначного срока нет. При настроенном sitemap и отправке на переобход или через IndexNow страница нередко попадает в индекс за несколько дней. Без этих действий, на слабо перелинкованном сайте, обход может занять недели. Точную дату обхода никто не гарантирует — робот распределяет ресурс сам.
Почему страница обойдена, но не в индексе?
Обход и индексация — разные процессы. Робот скачал страницу, но алгоритм решил не добавлять её: чаще всего из-за низкого качества, дублирования или технических статусов. Смотрите точную причину в «Проверить статус URL» и работайте с ней.
Нужно ли закрывать в robots.txt страницы фильтров и сортировок?
Как правило, да — они плодят дубли и тратят краулинговый бюджет. Но осторожно: если по фильтрам есть реальный спрос и они приносят трафик, их не закрывают, а оставляют индексируемыми с уникальными заголовками. Решение зависит от структуры конкретного сайта.
Помогает ли частая отправка на переобход?
Переобход ускоряет визит робота, но не влияет на решение об индексации и не улучшает позиции сам по себе. Если страница не индексируется из-за качества, повторные отправки не помогут — нужно устранять причину.
Влияет ли скорость сайта на обход?
Да. Чем быстрее сервер отдаёт страницы, тем больше их робот успевает обойти за сессию. На крупных сайтах ускорение ответа напрямую увеличивает глубину и частоту обхода.
Итог
Управление роботами Яндекса — это не магия, а последовательная техническая работа: корректный robots.txt, актуальный sitemap, чистая структура без дублей, быстрый сервер и осмысленная перелинковка. Плюс инструменты ускорения — переобход в Вебмастере и IndexNow. Когда техническая база в порядке, робот доходит до нужных страниц быстро, а решение об индексации остаётся вопросом качества контента, а не случая.
Если страницы вашего сайта плохо индексируются, обход идёт медленно или вы не понимаете, почему нужные разделы не попадают в поиск — разберём это на SEO-консультации либо в рамках технической доработки сайта. Опишите задачу через форму обратной связи — посмотрю ваш случай и подскажу, с чего начать.
Если нужно раскрутка сайта в Яндексе — помогу вывести сайт в топ Яндекса и удержать позиции.
Увеличьте позиции и продажи вашего сайта
Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:
Остались вопросы по продвижению?
Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.
Связаться со мной →