foundation

Robots.txt

Используйте robots.txt и robots meta для направления краулеров, не полагаясь на них для авторизации или защиты чувствительных данных.

`robots.txt` в корне сайта даёт **рекомендации по crawl** добросовестным ботам через `User-agent`, `Disallow`, `Allow` и `Sitemap`. Это **не** контроль доступа — приватные URL остаются обнаруживаемыми, если на них ссылаются.

					User-agent: *
Disallow: /admin/
Allow: /admin/public/
Sitemap: https://example.com/sitemap.xml
				

| Директива | Эффект | |-----------|--------| | Disallow | Просьба не краулить matching paths | | Allow | Исключения внутри Disallow | | Sitemap | Указатель на XML sitemap |

Для index/noindex на уровне страницы — `meta name="robots"` или `X-Robots-Tag`; robots.txt не noindex страницу, на которую всё ещё ведут ссылки.

На интервью: robots.txt vs authentication; блокировка staging; случайный block `/static/`; Googlebot smartphone vs desktop.

Типовые ошибки: блок CSS/JS для рендеринга; Disallow для секретов; конфликт robots meta и txt; забытый robots.txt на subdomain.

Компромисс — ограничение шума краулера против случайного сокрытия ресурсов для рендеринга.

Чеклист:

  • Не полагаться на robots.txt для security.
  • Не блокировать render-critical assets.
  • Документировать правила staging vs production.
  • Проверка через Search Console URL inspection.