Wiki
Web / стек

robots.txt — что это простыми словами

robots.txt — текстовый файл в корне сайта, указывающий поисковым ботам, какие пути можно/нельзя индексировать. НЕ защита — просто указание.

robots.txt — файл на `https://site.com/robots.txt`, читаемый поисковыми ботами (Googlebot, YandexBot, Bingbot) перед обходом сайта. Формат простой: `User-agent:` + `Disallow:` / `Allow:` + опционально `Sitemap:`.

Пример базовый: `User-agent: *` `Disallow: /admin/` `Disallow: /api/` `Allow: /` `Sitemap: https://site.com/sitemap.xml`. Значит: любой бот, не лезь в /admin и /api, остальное — можно, вот карта сайта.

Не путать с безопасностью. robots.txt — только рекомендация для добросовестных ботов. Ваш /admin по-прежнему доступен через прямой URL, парсеры-агрегаторы могут игнорировать. Для защиты — HTTP-auth, IP-allowlist, WAF, а НЕ robots.txt.

Частые ошибки: (1) `Disallow: /` в staging → сайт вылетел из индекса при прод-релизе (забыли убрать), (2) блокировка `/static/` → Google не видит CSS/JS и решает "сайт сломан" → плохой Core Web Vitals, (3) конфликт с `<meta noindex>` — robots.txt блокирует crawl, но не indexation-по-ссылкам, (4) забыли добавить `Sitemap:` — бот дольше находит новые страницы.

Частые вопросы

Как проверить корректность?
Google Search Console → Настройки → robots.txt tester. Yandex.Webmaster → Инструменты → Анализ robots.txt.
Часто менять?
Правило: чем реже, тем лучше. Каждое изменение может выкинуть страницы из индекса на недели.

Смотрите также