Вплив англомовної версії сайту на видимість у ChatGPT, Google AI та Copilot

Вплив англомовної версії сайту на видимість у ChatGPT, Google AI та Copilot

/Ірина Фурман/16 хвилин

Змiст

За останніми дослідженнями, ChatGPT віддає чітку перевагу англомовним сторінкам, на відміну від Google AI та Copilot. Нижче наведено аналіз того, що це означає для вашого вебресурсу.

Якщо спостерігається тенденція, за якої англомовні сторінки цитуються в AI-відповідях частіше за аналогічні сторінки локальними мовами, ця оцінка є об’єктивною.

Було проведено дослідження даних із Copilot, Google AI та ChatGPT для десятків багатомовних сайтів з метою оцінки рівня упередженості систем та визначення доцільності інтеграції англомовної версії (із розділом /en/).

Власники та оператори вебресурсів поза межами англомовного сегмента регулярно фіксують подібну специфіку: при формуванні запиту штучному інтелекту нідерландською, французькою чи іспанською мовами використані джерела переважно подаються англійською.

Digital Marketing

Будь першим серед трендів

Дізнавайся про новини та цікаві поради digital маркетингу першим — підпишись на наш Telegram-канал зараз.

Підписатися на Telegram

У разі наявності англомовної версії багатомовного сайту саме її сторінки частіше цитуються алгоритмами штучного інтелекту, навіть якщо реальний користувацький трафік на них залишається низьким. SEO-фахівці виділяють ключову причину цього явища: перед безпосереднім пошуком та вилученням інформації неангломовний промпт розбивається системою на додаткові англомовні запити (так звані fan-out queries).

Стівен Бернс у дослідженні The AI Visibility Audit (Common Crawl) зазначає: «Якісна англомовна версія ключових сторінок сайту є одним із небагатьох дійсно ефективних контентних кроків для розширення цифрової присутності бренду».

З огляду на актуальність цього питання для клієнтів нашої агенції, було проведено практичне тестування, сформоване довкола двох основних питань:

  1. Наскільки суттєвим є надмірне залучення англомовних сторінок алгоритмами штучного інтелекту для вебресурсів, які вже мають версію англійською мовою?
  2. Чи втрачають потенційну видимість в AI-системах ті вебресурси, де розділ із мовною версією /en/ відсутній?

Джерела виникнення схильності ChatGPT до англомовної контенту

Найбільш виразні підтвердження цієї схильності зафіксовано в поведінці ботів розробки OpenAI на основі аналізу серверних логів. Компанія OpenAI використовує три типи краулерів, і сприйняття їх як єдиного механізму викривляє розуміння реальних процесів:

  • GPTBot здійснює збір даних для подальшого навчання моделей.
  • OAI-SearchBot, згідно з регламентом OpenAI, застосовується для відображення вебресурсів у результатах пошукових функцій ChatGPT.
  • ChatGPT-User виконує оперативний пошук і вилучення даних безпосередньо під час формування відповіді на запит користувача.

Кінцевий перелік цитованих URL-адрес визначається функціонуванням ботів OAI-SearchBot та ChatGPT-User.

Розподіл журналів подій (логів) за конкретними ботами демонструє, що пріоритетизація англійської мови не є статичною. Вона стрімко зростає у міру наближення системи до моменту генерування цитати.

Схильність ботів OpenAI до англомовного контенту у порівнянні з Googlebot

Порівняльний аналіз динаміки виявляє наступні закономірності. Навчальний краулер GPTBot практично не надає переваги англомовним версіям на багатомовних сайтах. Він сканує контент усіма наявними мовами, причому частка охопленого ним англомовного матеріалу нижча за рівень реального органічного попиту на цю мову.

З точки зору архітектури навчання це є логічним кроком: оскільки базову модель першочергово тренували на англомовних даних, система потребує систематичного залучення джерел іншими мовами. Показники OAI-SearchBot знаходяться на середньому рівні.

Завершальною ланкою виступає ChatGPT-User — бот, фіксація дій якого відбувається безпосередньо перед цитуванням джерела. Саме він вилучає англомовні версії сторінок частіше за всі інші краулери. Його медіанна частка залучення англійської мови орієнтовно втричі перевищує аналогічний показник Googlebot на тих самих ресурсах.

Таким образом, твердження «ChatGPT надає перевагу англійській мові» потребує уточнення. Перевагу надає безпосередньо бот вилучення даних (retrieval bot), тоді як навчальний бот цього не робить. Саме цей розрив є ключовим індикатором: викривлення виникає на етапі генерування відповіді, а не глибинно у процесі тренування моделі.

Попри те, що більшість клієнтів нашої агенції розташовані в Європі (Бельгія, Нідерланди, Франція тощо), аналогічні тенденції фіксуються на вебресурсах Канади та Індії.

Читайте також:  Покупки в ChatGPT: тепер можна купувати прямо в чаті

Переіндексація (надмірне цитування) коливається у межах від 1,9 до 6,5 раза, із медіанним значенням близько 2,6. Бот ChatGPT завантажує англомовні сторінки у 65–79% випадків.

Ці дані свідчать про системну закономірність: перед формуванням остаточної відповіді AI-асистент визначає, яку саме мовну версію бренду аналізувати.

Відсутність однорідності у схильності різних AI-моделей до англомовного контенту

Результати обробки промптів суттєво відрізняються залежно від конкретної AI-моделі. При проведенні аналогічного тестування рівня переіндексації англійської мови для Copilot (із використанням вкладки AI Performance у Bing Webmaster Tools), а також для Google AI Mode та AI Overviews (на основі нових звітів у Google Search Console) зазначена схильність практично нівелюється.

Домінування англійської мови чітко простежується в даних ChatGPT, на відміну від Copilot, AI Mode та AI Overviews

Для кількісного вимірювання цього явища було розраховано єдиний індекс: відношення частки англомовних цитувань у AI до частки показів англомовного контенту у класичному пошуку. Показник 1,0 відповідає нейтральному значенню, тобто AI цитує англомовний контент із тією ж частотою, з якою сайт отримує покази за англомовними пошуковими запитами. Значення понад 1,0 вказує на наявність диспропорції на користь англійської мови.

  • Copilot демонструє показник 1,07 (на вибірці з 272 ресурсів у Bing), що відповідає нейтральному рівню.
  • Google AI у панелі GSC фіксує значення 0,79, тобто залучає трохи менше англомовного вмісту, ніж передбачає рівень пошукового попиту, орієнтуючись на локальну мову.
  • ChatGPT для порівняння досягає позначки орієнтовно 2,6.

Причина подібного розходження полягає в архітектурних відмінностях систем. Copilot та Google AI спираються на пошукові індекси, адаптовані до багатомовності протягом багатьох років. Вони успадковують усталені механізми релевантної видачі контенту конкретному користувачу (включно з обробкою тегів hreflang), а шар генерації відповідей переважно зберігає цю логіку.

Натомість ChatGPT здійснює оперативний пошук і вилучення даних безпосередньо в межах моделі, базовий якорний масив якої є англомовним, без використання розширеного багатомовного фундаменту. Таким чином, виявлена схильність притаманна безпосередньо шляху вилучення даних великими мовними моделями (LLM retrieval path), а не пошуковій індексації загалом.

Для фахівців галузі це формує чітке розуміння проблематики: описане явище є специфікою функціонування безпосередньо ChatGPT (і, ймовірно, інших LLM зі схожою архітектурою вилучення контенту, яку застосовує OpenAI).

Чому концепція «English-first» може стати новим етапом за аналогією з «mobile-first»

Свого часу компанія Google впровадила підхід mobile-first indexing, за якого мобільна версія сайту стала визначальною для індексації.

Для великих мовних моделей (LLM), зокрема ChatGPT, аналогічний статус сьогодні отримують розділи з англомовним контентом. У разі публікації англомовної версії слід враховувати, що окремі AI-системи сприйматимуть її як основне першоджерело інформації про ресурс. Це правило діє незалежно від того, наскільки суттєву роль відіграє англомовна версія для реальної цільової аудиторії сайту.

Стратегія English-first створює потенційні ризики для вебресурсів, де англомовний розділ створювався як другорядний. Зокрема, у досліджуваному масиві даних зафіксовано випадок, коли банківська установа залишила на сайті застарілий англомовний PDF-документ із тарифами, хоча нідерландомовна та франкомовна сторінки були вчасно оновлені.

Алгоритм AI-асистента вилучив і процитував саме цей неактуальний файл. Неактуальний англомовний документ не просто залишається на сервері — він перетворюється на підсумкову відповідь для користувачів, які початково не запитували інформацію англійською мовою.

Доцільність інтеграції англомовного розділу (/en/)

Оскільки великі мовні моделі пріоритетно звертаються до англомовних джерел, логічним кроком є забезпечення їх відповідним контентом. Ефективність цього рішення було перевірено шляхом зіставлення показників видимості у штучному інтелекті з показниками у класичному пошуку.

При прийнятті базового співвідношення 1:1 між класичною видимістю (покази в Google та Bing) та видимістю в AI-системах, порівняльний аналіз ресурсів із наявним розділом /en/ та без нього виявляє виразну закономірність.

Читайте також:  Стратегічне значення GEO для бізнесу

Відносне зростання показників для сайтів із розділом /en/ у відповідях LLM

  • У системі Copilot сайти з англомовним розділом отримали 892 цитування на 10 000 показів, тоді як сайти без нього — 585 цитувань. Сукупна різниця становить 52%.
  • Для верифікації цієї закономірності аналогічний аналіз було проведено для системи Google. За даними панелі GSC Gen AI, сайти з англомовною версією продемонстрували сукупне зростання AI-показів на 28%. Після виключення статистичних аномалій (аутлайєрів) медіанний прирост у розрахунку на один сайт склав 9%, що додатково підтверджує відмінності у функціонуванні різних платформ.
  • Дані ботів OpenAI підтверджують, що найбільший рівень схильності до англомовного контенту спостерігається в ChatGPT. Для сайтів із наявним розділом /en/ зростання показників сягнуло 122%.

Висновки для багатомовних вебресурсів

У підсумку отримані дані підтверджують тезу Стівена Бернса. Для більшості досліджених багатомовних сайтів наявність якісної та актуальної англомовної версії ключових (наріжних) сторінок сприяла розширенню видимості в AI-системах. Найбільш вираженим цей ефект виявився в ChatGPT, помітним — у Copilot, а також мав аналогічну спрямованість на пошукових AI-поверхнях Google.

Втім, є два ключові чинники, які стримують від однозначної рекомендації інтегрувати розділ /en/ абсолютно всім ресурсам:

  1. Підтримка англомовної версії — це безперервний процес, а не одноразова task-задача. З моменту публікації розділу слід очікувати, що великі мовні моделі сприйматимуть його як канонічний. Застаріла англомовна сторінка завдає більше шкоди, ніж її повна відсутність (що демонструє наведений приклад із неактуальним PDF-файлом банківської установи). Впроваджувати англомовну версію доцільно лише за умови здатності забезпечити її регулярне оновлення нарівні з контентом основною мовою.
  2. Перевага англомовного вмісту є менш відчутною у більш зрілих AI-моделях, а компанія OpenAI систематично нарощує обсяги навчання на даних іншими мовами. Це вказує на ймовірне поступове зниження ефективності від наявності суто англомовного контенту з часом.

Створення англомовного розділу є виправданим кроком виключно за наявності ресурсів для його повноцінного та систематичного обслуговування.

Методологія та обмеження дослідження

Джерела даних

Дослідження спирається на три незалежні масиви даних:

  • Copilot: Дані про цитування в AI з Bing Webmaster Tools порівнювалися з показниками пошукових вражень на 272 ресурсах, включаючи 31 сайт із повним посторінковим розподілом /en/ для розрахунку індексу репрезентативності.
  • Google AI: Дані про покази в AI та класичному пошуку з Google Search Console по панелі багатомовних бельгійських та європейських сайтів.
  • ChatGPT: Необроблені логи серверів щодо звернень ботів GPTBot, OAI-SearchBot та ChatGPT-User на 26 багатомовних ресурсах. Базовим орієнтиром органічного попиту слугував Googlebot Smartphone. Для субаналізу 5 сайтів використовувалося стандартизоване 30-денне вікно спостереження.

Визначення термінів

  • Під «англійською мовою» маються на увазі локальні шляхи URL, що відповідають форматам /en, /en-xx, /xx-en або корінному домену, орієнтованому виключно на англомовний контент.
  • Індекс репрезентативності розраховується як відношення частки англомовних цитувань в AI до частки показів у класичному пошуку (де значення 1,0 є нейтральним).
  • Частки англомовних звернень для кожного бота розраховувалися за медіанними значеннями сайтів, які мали щонайменше 150–200 звернень кожного бота (що дозволило уникнути викривлення загальних показників через окремі великі домени). Коефіцієнти переіндексації порівнюють показники кожного бота з часткою англомовних звернень Googlebot на тому ж ресурсі.

Обмеження

Звітність щодо цитування в AI-системах знаходиться на етапі формування та характеризується наявністю статистичних шумів. Платформи Bing та GSC застосовують різні методології визначення AI-показів і цитувань, тому міжплатформенні показники демонструють загальну спрямованість тенденцій, а не прямо пропорційні абсолютні значення.

Читайте також:  Зростання частки кліків на текстові оголошення Google

Ідентифікація ботів на основі логів спирається на рядки User-Agent та зворотний DNS (Reverse DNS), що створює ймовірність пропуску фальсифікованого або проксіованого трафіку.

Окремі етапи аналізу, зокрема розподіл за ботами та частини панелі GSC, базуються на відносно невеликих вибірках ресурсів (від декількох одиниць до кількох десятків), тому ці результати слід розглядати як репрезентативно-індикативні. Назви брендів і доменів у дослідженні анонімізовано відповідно до їхніх галузевих сегментів.

Висновки для багатомовних вебресурсів

У підсумку отримані дані підтверджують тезу Стівена Бернса. Для більшості досліджених багатомовних сайтів наявність якісної та актуальної англомовної версії ключових (наріжних) сторінок сприяла розширенню видимості в AI-системах. Найбільш вираженим цей ефект виявився в ChatGPT, помітним — у Copilot, а також мав аналогічну спрямованість на пошукових AI-поверхнях Google.

Втім, є два ключові чинники, які стримують від однозначної рекомендації інтегрувати розділ /en/ абсолютно всім ресурсам:

  1. Підтримка англомовної версії — це безперервний процес, а не одноразова task-задача. З моменту публікації розділу слід очікувати, що великі мовні моделі сприйматимуть його як канонічний. Застаріла англомовна сторінка завдає більше шкоди, ніж її повна відсутність (що демонструє наведений приклад із неактуальним PDF-файлом банківської установи). Впроваджувати англомовну версію доцільно лише за умови здатності забезпечити її регулярне оновлення нарівні з контентом основною мовою.
  2. Перевага англомовного вмісту є менш відчутною у більш зрілих AI-моделях, а компанія OpenAI систематично нарощує обсяги навчання на даних іншими мовами. Це вказує на ймовірне поступове зниження ефективності від наявності суто англомовного контенту з часом.

Створення англомовного розділу є виправданим кроком виключно за наявності ресурсів для його повноцінного та систематичного обслуговування.

Методологія та обмеження дослідження

Джерела даних

Дослідження спирається на три незалежні масиви даних:

  • Copilot: Дані про цитування в AI з Bing Webmaster Tools порівнювалися з показниками пошукових вражень на 272 ресурсах, включаючи 31 сайт із повним посторінковим розподілом /en/ для розрахунку індексу репрезентативності.
  • Google AI: Дані про покази в AI та класичному пошуку з Google Search Console по панелі багатомовних бельгійських та європейських сайтів.
  • ChatGPT: Необроблені логи серверів щодо звернень ботів GPTBot, OAI-SearchBot та ChatGPT-User на 26 багатомовних ресурсах. Базовим орієнтиром органічного попиту слугував Googlebot Smartphone. Для субаналізу 5 сайтів використовувалося стандартизоване 30-денне вікно спостереження.

Визначення термінів

  • Під «англійською мовою» маються на увазі локальні шляхи URL, що відповідають форматам /en, /en-xx, /xx-en або корінному домену, орієнтованому виключно на англомовний контент.
  • Індекс репрезентативності розраховується як відношення частки англомовних цитувань в AI до частки показів у класичному пошуку (де значення 1,0 є нейтральним).
  • Частки англомовних звернень для кожного бота розраховувалися за медіанними значеннями сайтів, які мали щонайменше 150–200 звернень кожного бота (що дозволило уникнути викривлення загальних показників через окремі великі домени). Коефіцієнти переіндексації порівнюють показники кожного бота з часткою англомовних звернень Googlebot на тому ж ресурсі.

Обмеження

Звітність щодо цитування в AI-системах знаходиться на етапі формування та характеризується наявністю статистичних шумів. Платформи Bing та GSC застосовують різні методології визначення AI-показів і цитувань, тому міжплатформенні показники демонструють загальну спрямованість тенденцій, а не прямо пропорційні абсолютні значення.

Ідентифікація ботів на основі логів спирається на рядки User-Agent та зворотний DNS (Reverse DNS), що створює ймовірність пропуску фальсифікованого або проксіованого трафіку.

Окремі етапи аналізу, зокрема розподіл за ботами та частини панелі GSC, базуються на відносно невеликих вибірках ресурсів (від декількох одиниць до кількох десятків), тому ці результати слід розглядати як репрезентативно-індикативні. Назви брендів і доменів у дослідженні анонімізовано відповідно до їхніх галузевих сегментів.

Читайте статтю англійською мовою.

Автор

Ірина Фурман

Ірина Фурман авторка та редакторка блогу UAMASTER про цифровий маркетинг, SEO, PPC, аналітику, пошук на основі штучного інтелекту та маркетингові технології, зосереджуючись на чітких поясненнях для бізнес- та маркетингових команд.

Хочеш знати більше про digital?

Школа цифрової реклами SoDA

  • Корпоративне навчання
  • Cвіжі публікації
    Google Search Console для SMM: як аналізувати видимість Instagram, TikTok і YouTube у пошуку

    Google Search Console для SMM: як аналізувати видимість Instagram, TikTok і YouTube у пошуку

    Чому класичні статті більше не працюють в AI-пошуку та що таке Liquid Content

    Чому класичні статті більше не працюють в AI-пошуку та що таке Liquid Content

    5 методів нейтралізації небажаної інформації в мережі

    5 методів нейтралізації небажаної інформації в мережі

    Статті по цій темі
    Перспективи Meta AI як потенційного лідера на ринку ШІ для пошукових систем

    Перспективи Meta AI як потенційного лідера на ринку ШІ для пошукових систем

    ChatGPT не вбив пошук. Але з’явилася цифра, яку CMO мусить порахувати

    ChatGPT не вбив пошук. Але з’явилася цифра, яку CMO мусить порахувати

    Adobe презентувала новий інструмент для аналізу видимості брендів у GEO

    Adobe презентувала новий інструмент для аналізу видимості брендів у GEO

    performance_marketing_engineers/

    performance_marketing_engineers/

    performance_marketing_engineers/

    performance_marketing_engineers/

    performance_marketing_engineers/

    performance_marketing_engineers/

    performance_marketing_engineers/

    performance_marketing_engineers/