Robots.txt

Robots.txt

/Редакція UAMASTER/4 хвилини

Змiст

Robots.txt — це текстовий файл у корені хоста, який визначає правила сканування URL для пошукових та інших роботів. Типова адреса файлу — https://example.com/robots.txt. У ньому групують правила за user-agent і задають дозволені або заборонені шляхи.

Robots.txt керує краулінгом, а не гарантує вилучення з індексу. Якщо на закриту сторінку ведуть зовнішні або внутрішні посилання, пошукова система може знати її адресу й іноді показувати URL без зчитаного контенту. Для заборони індексації використовують noindex, авторизацію або видалення ресурсу залежно від завдання.

Базова структура файлу

User-agent: *
Disallow: /internal-search/
Allow: /internal-search/help/

Sitemap: https://example.com/sitemap.xml

User-agent визначає робота або групу роботів. Disallow задає шлях, який не слід сканувати, а Allow може відкрити виняток усередині ширшої заборони. Рядок Sitemap повідомляє адресу XML-карти сайту.

Порожній Disallow: не забороняє нічого. Запис Disallow: / закриває весь хост для відповідної групи роботів і є однією з найнебезпечніших випадкових помилок під час запуску сайту.

Digital Marketing

Будь першим серед трендів

Дізнавайся про новини та цікаві поради digital маркетингу першим — підпишись на наш Telegram-канал зараз.

Підписатися на Telegram

Область дії robots.txt

Файл діє лише для конкретної комбінації протоколу, хоста й порту. Правила з https://example.com/robots.txt не керують автоматично піддоменом shop.example.com. Для піддомену потрібен власний файл.

Назви шляхів чутливі до регістру, якщо сервер розрізняє такі URL. Правило для /Catalog/ не обов’язково охоплює /catalog/. Перед публікацією потрібно перевіряти фактичні адреси, а не лише назви розділів у CMS.

Для чого використовують robots.txt

  • обмежити сканування нескінченних комбінацій параметрів і технічних фільтрів;
  • не витрачати ресурси робота на внутрішній пошук або службові URL;
  • закрити непотрібне сканування окремих медіафайлів;
  • керувати навантаженням на великі сайти;
  • вказати місце XML sitemap;
  • задати окремі правила для різних роботів, якщо це справді потрібно.

Невеликому сайту часто достатньо простого файлу. Складні правила «про всяк випадок» збільшують ризик заблокувати CSS, JavaScript, зображення або важливі посадкові сторінки.

Robots.txt і індексація

Заборона сканування означає, що робот не повинен завантажувати вміст URL. Вона не видаляє вже відому адресу з пошуку. Більше того, якщо на сторінці стоїть noindex, але її закрито через robots.txt, робот може не побачити директиву noindex.

Для конфіденційного розділу потрібна автентифікація. Robots.txt є публічним файлом, тому перелічені в ньому шляхи бачить будь-хто. Запис секретної директорії фактично привертає до неї увагу, а не захищає.

Практичний приклад

Маркетплейс будівельних матеріалів створює URL для сортування за ціною, виробником, кольором, наявністю та способом доставки. Частина комбінацій корисна як посадкові сторінки, а мільйони інших не мають попиту й повторюють ті самі товари. Команда спочатку визначає, які фільтри мають пошукову цінність, налаштовує для них стабільні URL, а технічні комбінації контролює через параметри, canonical, внутрішні посилання та за потреби robots.txt.

Просто закрити весь каталог від сканування було б швидко, але руйнівно. Robots.txt застосовують після моделювання структури, а не замість нього.

Взаємодія з іншими SEO-правилами

  • Noindex. Керує індексацією й має бути доступним для зчитування роботом.
  • Canonical. Допомагає групувати дублікати, але робот повинен просканувати сторінку, щоб побачити тег.
  • Redirect. Серверне перенаправлення, яке спрацьовує під час звернення до URL.
  • Sitemap. Повідомляє про бажані для сканування канонічні URL; не слід одночасно додавати сторінку в sitemap і закривати її без чіткої причини.

Типові помилки

  • залишити Disallow: / після запуску production-сайту;
  • вважати robots.txt способом захисту приватних даних;
  • намагатися додати директиву noindex у robots.txt;
  • заблокувати ресурси, потрібні для правильного рендерингу сторінки;
  • закрити URL із canonical і чекати, що робот прочитає цей canonical;
  • копіювати правила між піддоменами без перевірки їхньої структури;
  • змінювати файл без резервної копії та тестування важливих шаблонів;
  • додавати до sitemap URL, які системно заборонені для сканування.

Як провести аудит

  1. Відкрити файл за адресою /robots.txt і перевірити HTTP-статус.
  2. Розібрати правила окремо для кожного user-agent.
  3. Зіставити заборонені шляхи з органічними посадковими сторінками та sitemap.
  4. Перевірити критичні URL інструментом перевірки robots.txt або URL Inspection.
  5. Переконатися, що важливі CSS, JavaScript і зображення доступні для рендерингу.
  6. Після зміни відстежити серверні логи, сканування та індексацію.

Пов’язані поняття

Краулінг · Googlebot · Noindex · Canonical URL · XML sitemap · Crawl budget · X-Robots-Tag

Висновок

Robots.txt — це диспетчер сканування, а не замок і не кнопка видалення з пошуку. Він особливо корисний на великих і технічно складних сайтах, де потрібно спрямувати ресурси роботів на важливі URL. Безпечне налаштування починається з розуміння структури сайту й перевірки взаємодії з noindex, canonical, sitemap та редиректами.

Джерело

Google Search Central: Introduction to robots.txt

Автор

Редакція UAMASTER

Редакція UAMASTER готує матеріали про digital-маркетинг, рекламу, аналітику, SEO, штучний інтелект і маркетингові технології. У фокусі редакції — практичні зміни в інструментах, ринкові тренди та їхній вплив на бізнес, маркетинг-команди й управлінські рішення. Матеріали створюються на основі досвіду агенції UAMASTER, відкритих даних, галузевих джерел і редакційної перевірки фактів.

Хочеш знати більше про digital?

Школа цифрової реклами SoDA

  • Корпоративне навчання
  • Cвіжі публікації
    Оновлення платформи ChatGPT Ads

    Оновлення платформи ChatGPT Ads

    Налаштування вебаналітики: як побудувати систему даних, яким можна довіряти

    Налаштування вебаналітики: як побудувати систему даних, яким можна довіряти

    Як Yapper Ads та допитливість знижують CAC і підвищують ROI

    Як Yapper Ads та допитливість знижують CAC і підвищують ROI

    performance_marketing_engineers/

    performance_marketing_engineers/

    performance_marketing_engineers/

    performance_marketing_engineers/

    performance_marketing_engineers/

    performance_marketing_engineers/

    performance_marketing_engineers/

    performance_marketing_engineers/