foundation
Robots.txt
Используйте robots.txt и robots meta для направления краулеров, не полагаясь на них для авторизации или защиты чувствительных данных.
`robots.txt` в корне сайта даёт **рекомендации по crawl** добросовестным ботам через `User-agent`, `Disallow`, `Allow` и `Sitemap`. Это **не** контроль доступа — приватные URL остаются обнаруживаемыми, если на них ссылаются.
User-agent: *
Disallow: /admin/
Allow: /admin/public/
Sitemap: https://example.com/sitemap.xml
| Директива | Эффект | |-----------|--------| | Disallow | Просьба не краулить matching paths | | Allow | Исключения внутри Disallow | | Sitemap | Указатель на XML sitemap |
Для index/noindex на уровне страницы — `meta name="robots"` или `X-Robots-Tag`; robots.txt не noindex страницу, на которую всё ещё ведут ссылки.
На интервью: robots.txt vs authentication; блокировка staging; случайный block `/static/`; Googlebot smartphone vs desktop.
Типовые ошибки: блок CSS/JS для рендеринга; Disallow для секретов; конфликт robots meta и txt; забытый robots.txt на subdomain.
Компромисс — ограничение шума краулера против случайного сокрытия ресурсов для рендеринга.
Чеклист:
- Не полагаться на robots.txt для security.
- Не блокировать render-critical assets.
- Документировать правила staging vs production.
- Проверка через Search Console URL inspection.