Диагностика индексации сайта за 20 минут: семь проверок, которые находят причину

Анатолий Кузнецов
Анатолий Кузнецов
SEO-оптимизатор с 20-летним стажем. Автор блога hozyindachi.ru о продвижении и доработке сайтов.

Мне пишут примерно так: «Анатолий, сайт не индексируется, помогите». Дальше почти всегда следует список того, что человек уже сделал: переотправил карту сайта, пять раз нажал «Переобход страниц», написал в поддержку Яндекса, дописал текста на страницы, купил ссылок «для ускорения». Иногда на всё это уходит два-три месяца. А причина находится за четыре минуты — просто её никто не искал по порядку.

За двадцать лет практики я разобрал не одну сотню таких историй и в какой-то момент перестал импровизировать. Собрал протокол: семь проверок, жёстко в одной последовательности, от самого грубого к самому тонкому. Смысл именно в порядке. Если сайт целиком закрыт в robots.txt, бессмысленно рассуждать о качестве контента. Если сервер отдаёт 503, не важно, что написано в canonical. Каждая следующая проверка имеет смысл только тогда, когда предыдущая прошла чисто.

Уложиться реально в 20 минут. Ниже — сам протокол, с тем, что именно смотреть, что считать нормой и какие выводы делать. Пишу так, как объясняю клиенту на созвоне.

Главная ошибка при диагностике индексации — начинать с догадки, а не с наблюдения. «Наверное, мало контента» — это догадка. «Сервер отдаёт 200, robots разрешает, но в ответе есть X-Robots-Tag: noindex» — это факт. Факты ищутся за 20 минут, догадки проверяются месяцами.

Содержание статьи

Диагностика индексации сайта за 20 минут: семь проверок, которые находят причину

Что мы вообще диагностируем: три разных «не индексируется»

Прежде чем открывать инструменты, надо понять, что именно сломалось. Владельцы сайтов складывают в одну фразу три принципиально разные ситуации, и лечатся они по-разному.

  • Робот не приходит. Страница физически не посещалась краулером или посещалась однажды полгода назад. Проблема на уровне обхода: ссылок нет, вложенность огромная, карта не отдаётся, сервер тормозит.
  • Робот приходит, но не берёт. Обход есть, а страницы в индексе нет. Значит, что-то запрещает: директива, заголовок, canonical на другой URL, редирект, ошибка ответа.
  • Робот берёт, но выкидывает. Страница попала в индекс и потом ушла в «Исключённые» со статусом вроде «Недостаточно качественная». Это уже не техника, это оценка алгоритма.

Три разные болезни с одним симптомом. Протокол ниже как раз и нужен, чтобы за двадцать минут понять, какая из трёх у вас, а дальше уже лечить прицельно.

Проверка 1. Три цифры, которые надо свести (2 минуты)

Открываем Яндекс.Вебмастер, раздел «Индексирование» → «Страницы в поиске». Записываем три числа:

  • сколько страниц загружено роботом;
  • сколько находится в поиске;
  • сколько исключено.

Рядом кладём четвёртое число — сколько URL реально должно быть в индексе. Не «примерно», а по факту: количество строк в sitemap.xml минус то, что вы намеренно закрыли. Дальше смотрим на разрыв.

Что видим Что это значит Куда идти дальше
Загружено ≈ 0, в поиске 0 Робот не заходит вообще Проверки 3 и 4 — robots и ответ сервера
Загружено много, в поиске мало, исключено много Робот ходит, но страницы отбраковываются Проверки 2, 5, 7
Загружено сильно больше, чем URL в карте Робот тратит бюджет на мусор: фильтры, сортировки, UTM Проверка 6 — дубли и краулинговый бюджет
Всё сходится, но трафика нет Индексация в порядке, проблема в ранжировании Это уже не про индексацию — см. раздел про ИКС и трафик

Эта проверка ничего не чинит, но задаёт направление. Кстати, здесь же полезно вспомнить, что рост ИКС в Вебмастере никак не гарантирует индексацию и трафик — я разбирал эту иллюзию подробно в материале «ИКС вырос, а трафик упал». Люди регулярно смотрят на красивую цифру и делают вывод, что «с сайтом всё хорошо», хотя половина каталога не в индексе.

Проверка 2. Статус конкретного URL, а не сайта целиком (3 минуты)

Дальше — самый недооценённый инструмент Вебмастера: «Инструменты» → «Проверка статуса URL». Берём не главную (главная почти всегда в порядке), а именно ту страницу, из-за которой началась паника. Вставляем полный URL и читаем ответ буквально.

Яндекс здесь честно пишет, что произошло. Варианты, которые встречаются чаще всего:

  • «Страница обходится роботом, но отсутствует в поиске» — значит, обход есть, отбраковка на стороне алгоритма или запрета. Идём в проверки 3, 5, 7.
  • «Неканоническая» — страница указывает canonical на другой URL. Мгновенно переходим к проверке 5, это самая частая техническая причина в моей практике.
  • «Запрещена к индексированию» — есть прямой запрет. Проверка 3.
  • «Обход запланирован» или робот последний раз был давно — проблема с обходом. Проверка 6.
  • «Недостаточно качественная» — техника ни при чём. Проверка 7.

Половина клиентов, которым я показываю этот экран на созвоне, реагируют одинаково: «А я и не знал, что тут это прямо написано». Написано. Просто все привыкли жать «Переобход» и уходить.

Проверка 3. robots.txt и все места, где живёт noindex (3 минуты)

Открываем вашсайт.ру/robots.txt и читаем глазами, целиком. Не через валидатор — глазами. Ищем три вещи:

  • Disallow: / в секции User-agent: * или User-agent: Yandex — классика после переезда с тестового домена;
  • директивы, закрывающие раздел, о котором вы забыли: /catalog/, /uslugi/, /blog/;
  • отсутствие или неверный адрес в директиве Sitemap:.

Самый дорогой случай в моей практике: интернет-магазин мебели, разработчики выкатили редизайн в пятницу вечером и залили robots.txt с тестового контура. Заметили через 26 дней, когда трафик из Яндекса упал с 1 400 до 90 визитов в сутки. На восстановление ушло семь недель. Одна строка.

Дальше — второй слой, где noindex прячется чаще всего. Смотрим исходный код страницы (Ctrl+U) и ищем в <head>:

<meta name="robots" content="noindex, nofollow">

А затем — третий слой, до которого почти никто не доходит: HTTP-заголовок ответа. Именно там прячется X-Robots-Tag, невидимый в исходном коде страницы. Проверяется одной командой:

curl -I -A "Mozilla/5.0 (compatible; YandexBot/3.0)" https://вашсайт.ру/stranica/

Если в ответе есть строка X-Robots-Tag: noindex — вы нашли причину. Такое обычно ставит плагин, разработчик на уровне nginx или CDN. В коде страницы этого нет, в robots.txt этого нет, в Вебмастере написано «запрещена к индексированию», и человек полгода не понимает почему.

Отдельная ловушка: в WordPress галочка «Попросить поисковые системы не индексировать сайт» в «Настройки → Чтение». Ставится на этапе разработки, снимается — никогда. Я до сих пор нахожу её примерно на каждом седьмом сайте, который приходит на SEO-аудит.

Проверка 4. Что на самом деле отдаёт сервер роботу (3 минуты)

В браузере страница открывается — значит, всё хорошо? Нет. Браузер и робот получают разные ответы чаще, чем вам кажется. Проверяем тем же curl и смотрим на первую строку.

Код ответа Что происходит Норма?
200 OK Страница отдаётся Да, для рабочей страницы
301 Постоянный редирект Только если так задумано и цепочка в один шаг
302 Временный редирект Почти всегда ошибка, вес не передаётся
404 / 410 Страницы нет Только для реально удалённого
500 / 502 / 503 Сервер лёг Никогда. Массовые 5xx = вылет из индекса
200, но пустая страница Soft 404 Худший вариант: робот тратит бюджет впустую

Три вещи, на которые смотрю всегда:

  • Цепочки редиректов. http://site.ruhttps://site.ruhttps://www.site.ruhttps://www.site.ru/. Четыре хопа там, где нужен один. Каждый лишний — потеря части веса и лишний расход бюджета обхода.
  • Разное поведение для бота и человека. Иногда защита от DDoS или Cloudflare-подобный слой отдаёт роботу капчу или 403. В браузере всё чудесно, у робота — глухая стена.
  • Скорость ответа. Если сервер отвечает по 3–4 секунды, робот снижает интенсивность обхода. Для сайта на 20 страниц это неважно, для каталога на 10 000 — фатально.

Кейс из практики: производственный сайт, хостинг на дешёвом шаред-тарифе, в часы пик отдавал 503. Владелец не замечал — он заходил вечером. В логах Вебмастера было видно: робот ловил ошибку в 40% визитов. Переезд на нормальный сервер, ноль изменений в контенте — за шесть недель индекс вырос со 180 до 890 страниц. Из таких историй, кстати, и складывается половина работ по технической доработке сайта: сначала чинится фундамент, потом обсуждается контент.

Проверка 5. Canonical — указывает ли страница на саму себя (2 минуты)

Это моя личная любимица, потому что причина №1 по частоте среди «мистических» выпадений. Смотрим в код страницы:

<link rel="canonical" href="https://вашсайт.ру/etot-zhe-url/">

Правило простое: для страницы, которую вы хотите видеть в поиске, canonical должен указывать на неё саму, символ в символ. Не на версию без слеша, не на http, не на www, не на главную, не на страницу-родителя. Любое расхождение — и Яндекс считает страницу неканонической, то есть добровольно отказавшейся от участия в выдаче.

Типичные поломки, которые я вижу:

  • шаблон движка прописывает canonical на главную для всех страниц раздела;
  • пагинация: /catalog/page/2/ отдаёт canonical на /catalog/ — и все товары со второй страницы фактически невидимы;
  • протокол или слеш не совпадают на один символ;
  • два плагина ставят по своему canonical, в коде их два, робот выбирает не тот.

Разбор реального случая с карточкой перфоратора, вылетевшей из топ-5 из-за одного лишнего символа, я выложил отдельно: «Одна лишняя буква в canonical — и страница исчезает из выдачи». Там по шагам показано, как это ловится и чем лечится.

Проверка 6. Доступность и бюджет обхода (4 минуты)

Если запретов нет, сервер отвечает 200, canonical на себя — а робот всё равно не приходит, значит, до страницы просто не дотягивается обход. Смотрим три вещи.

Есть ли на страницу внутренние ссылки

Страница-сирота, на которую не ведёт ни одна ссылка с сайта, для робота почти не существует, даже если она лежит в карте сайта. Sitemap — это подсказка, а не приказ. Реальный вес и сигнал важности передаются перелинковкой.

На каком уровне вложенности она лежит

Считаем клики от главной. Три клика — хорошо. Четыре — терпимо. Пять и больше — робот будет заходить туда раз в квартал, если вообще будет. Я подробно расписывал эту механику в статье «Страница на пятом уровне вложенности для Яндекса почти не существует» — там же способы схлопнуть структуру без переделки сайта.

На что робот тратит бюджет

Открываем в Вебмастере «Индексирование» → «Статистика обхода» и смотрим, какие URL робот качает. Если 70% визитов уходят на ?filter=, ?sort=, ?utm_source=, страницы поиска по сайту и календарь архива за 2019 год — вот и ответ. Бюджет съеден мусором, до ваших коммерческих страниц робот доходит по остаточному принципу.

Это лечится закрытием параметров через Clean-param, чисткой мусорных разделов и иногда — радикально. Про радикальный вариант я писал здесь: «Иногда лучший способ поднять сайт — удалить половину страниц». Магазин запчастей на 11 000 страниц, после чистки осталось 4 300 — трафик вырос на 34% за три месяца. Ничего не добавляли, только убрали.

Бонус: рендеринг

Если сайт на React, Vue или Angular без серверного рендеринга — отдельная засада. Выключаем JavaScript в браузере и открываем страницу. Видим текст, заголовки, ссылки? Отлично. Видим белый экран или «Loading…»? Значит, робот в первом проходе видит примерно то же самое. Яндекс умеет рендерить JS, но делает это с задержкой и не для всех страниц. Быстрая проверка — то же curl без параметров: что вернулось в HTML, то робот и получил сразу.

Проверка 7. Читаем причины исключения буквально (3 минуты)

Последний шаг — Вебмастер, «Страницы в поиске» → вкладка «Исключённые». Здесь Яндекс прямым текстом пишет статус по каждому URL. Расшифровка:

Статус Реальный смысл Что делать
Недостаточно качественная (НКС) Алгоритм решил, что страница не даёт пользователю ценности Переписывать, а не «дописывать объём»
Дубль Есть страница с идентичным содержимым Canonical, склейка, уникализация
Неканоническая Страница сама отказалась от индекса Проверка 5
Ошибка HTTP Сервер отдал 4xx/5xx роботу Проверка 4
Запрещена в robots.txt Прямой запрет Проверка 3

Про НКС скажу отдельно, потому что это самый непонятый статус. Он почти никогда не значит «мало букв». Он значит «такое уже есть в интернете, и лучше». Классика — карточки товара с описанием, скопированным из прайса поставщика: у вас и ещё у двухсот магазинов ровно тот же текст. Механику разбирал тут: почему каталог с описаниями от поставщика не растёт в поиске, а полный чек-лист по карточке — в материале «Карточка товара, которую Яндекс любит».

Ещё одна частая находка на этом шаге — страницы удалённых товаров. Что с ними делать (404, 410, редирект или оставить), зависит от ситуации, и универсального ответа нет: разбор всех четырёх сценариев — в статье «Товар закончился: удалять страницу, скрывать или оставить».

Сводная таблица: симптом → причина → шаг протокола

Симптом Вероятная причина Проверка
Новый сайт вообще не в индексе Disallow: / или галочка в CMS 3
Резкое падение после релиза robots с тестового контура, X-Robots-Tag 3
Одна страница выпала, соседние в индексе Canonical на чужой URL 5
Страницы пагинации не в индексе Canonical на первую страницу 5
Робот заходит раз в квартал Вложенность, нет входящих ссылок 6
Загружено в 5 раз больше URL, чем в карте Мусорные параметры съели бюджет 6
Тысячи страниц в статусе НКС Шаблонный или заимствованный контент 7
Индексируется рывками, то есть, то нет 5xx под нагрузкой, медленный хостинг 4
В сохранённой копии пусто Рендеринг на JS без SSR 6

Три ошибки, которые превращают 20 минут в три месяца

Первая — жать «Переобход» вместо диагностики. Переобход не снимает запрет. Если страница закрыта, вы просто заставите робота ещё раз убедиться, что она закрыта. Я видел клиента, который отправил один URL на переобход 40 раз за месяц. Там был noindex в meta-теге.

Вторая — «дописать текста». Стандартная реакция на статус НКС: заказать ещё 3 000 знаков. Если страница закрыта технически, текст не поможет вообще. Если она в НКС из-за неуникальности — объём тоже не поможет, потому что проблема не в количестве. Отдельно замечу, что перегруженная заголовками структура делает только хуже: про это есть разбор про один H1 и четыре лишних.

Третья — покупать ссылки «для ускорения индексации». Ссылки помогают роботу найти страницу. Они физически не могут отменить noindex, исправить canonical или поднять упавший сервер. Деньги в никуда.

Что делать после того, как причина найдена

Двадцать минут дают вам диагноз, а не лечение. Дальше сценарии расходятся:

  • Нашли запрет — убираем, отправляем на переобход, ждём. Обычно возврат в индекс занимает от 3 дней до 3 недель, зависит от того, как долго страница была закрыта.
  • Нашли проблему с обходом — перестраиваем перелинковку и структуру. Эффект накопительный, первые сдвиги через 2–4 недели.
  • Нашли НКС — самый долгий путь. Контент переделывается, потом ждём переоценки. Месяц-полтора минимум.
  • Нашли серверные ошибки — чиним инфраструктуру. Тут быстрее всего: часто индекс восстанавливается сам за 2–3 недели.

И отдельно про 2026 год. Индексация перестала быть вопросом одного только Яндекса. Если ваш HTML не отдаётся сразу и без JS, вас не увидят и языковые модели, которые всё чаще отвечают пользователю вместо поисковика. Та же техническая гигиена работает на оба фронта — механику я разбирал в материале «Оптимизация под AI-поиск: нюансы, которых ещё нет в учебниках», там же — про GEO-продвижение как отдельное направление. Другие материалы по технической части собраны в разделе «Техническое SEO».

Если протокол пройден, а трафика всё равно нет

Бывает и так: все семь проверок чистые, страницы в индексе, а заявок нет. Значит, проблема не в индексации, а в ранжировании и коммерческих факторах — и это уже совсем другая работа: семантика, структура, конкурентный анализ, доверие.

Здесь я предложу то, что делаю каждый день. Двадцать минут диагностики вы можете пройти сами по этой статье — инструкция полная, ничего не утаил. Но если после неё вы понимаете, что причин несколько, они переплетены, а трафик нужен был вчера — давайте я посмотрю сам.

Что я предлагаю конкретно:

  • Бесплатный аудит сайта за 24 часа — я лично прохожу по вашему сайту весь протокол плюс ещё 120 параметров и присылаю приоритизированный список: что чинить первым, что вторым, что вообще не трогать. Без воды, без «у вас низкий ИКС».
  • SEO-продвижение в Яндексе — беру один проект на нишу, работаю напрямую, без менеджеров. Только белые методы: за 20 лет и 300+ проектов в топе — ноль фильтров. Средний рост заявок у клиентов — в 3–4 раза за первые полгода. Отчёт каждую неделю: позиции, трафик, заявки, что сделано, что дальше.
  • GEO-продвижение (оптимизация под AI-поиск) — направление, где сейчас почти нет конкуренции. Пока ваши конкуренты спорят про ключевики, можно занять место в ответах нейросетей: структурированные данные, цитируемые факты, авторство, чистый HTML. Через год туда будет очередь. Сейчас — свободно.

Начать проще всего с бесплатного: отправьте сайт на диагностику — я скажу честно, есть ли потенциал роста, за какой срок и какими силами. Если потенциала нет, так и напишу: я берусь только за проекты, где уверен в результате на 98%. Посмотреть, что получилось у других, можно в портфолио кейсов, а если хотите обсудить голосом — оставьте заявку на консультацию.

Двадцать минут диагностики стоят дешевле трёх месяцев догадок. Проверьте свой сайт сегодня — по порядку, от первой проверки к седьмой. В восьми случаях из десяти причина находится до пятого шага.

Анатолий Кузнецов, SEO-специалист с 2005 года. 300+ сайтов в ТОП-3 Яндекса, 0 фильтров за 20 лет практики. Об авторе · Все статьи блога

Увеличьте позиции и продажи вашего сайта

Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:

Анатолий Кузнецов — SEO-оптимизатор

Остались вопросы по продвижению?

Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.

Связаться со мной →

Оставьте комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

 Нажимая «оставить комментарий» вы принимаетеправила конфиденциальности 

Прокрутить вверх