Google Search Console для SMM: як аналізувати видимість Instagram, TikTok і YouTube у пошуку
Чому класичні статті більше не працюють в AI-пошуку та що таке Liquid Content
5 методів нейтралізації небажаної інформації в мережі
За останніми дослідженнями, ChatGPT віддає чітку перевагу англомовним сторінкам, на відміну від Google AI та Copilot. Нижче наведено аналіз того, що це означає для вашого вебресурсу.
Якщо спостерігається тенденція, за якої англомовні сторінки цитуються в AI-відповідях частіше за аналогічні сторінки локальними мовами, ця оцінка є об’єктивною.
Було проведено дослідження даних із Copilot, Google AI та ChatGPT для десятків багатомовних сайтів з метою оцінки рівня упередженості систем та визначення доцільності інтеграції англомовної версії (із розділом /en/).
Власники та оператори вебресурсів поза межами англомовного сегмента регулярно фіксують подібну специфіку: при формуванні запиту штучному інтелекту нідерландською, французькою чи іспанською мовами використані джерела переважно подаються англійською.
Дізнавайся про новини та цікаві поради digital маркетингу першим — підпишись на наш Telegram-канал зараз.
Підписатися на TelegramУ разі наявності англомовної версії багатомовного сайту саме її сторінки частіше цитуються алгоритмами штучного інтелекту, навіть якщо реальний користувацький трафік на них залишається низьким. SEO-фахівці виділяють ключову причину цього явища: перед безпосереднім пошуком та вилученням інформації неангломовний промпт розбивається системою на додаткові англомовні запити (так звані fan-out queries).
Стівен Бернс у дослідженні The AI Visibility Audit (Common Crawl) зазначає: «Якісна англомовна версія ключових сторінок сайту є одним із небагатьох дійсно ефективних контентних кроків для розширення цифрової присутності бренду».
З огляду на актуальність цього питання для клієнтів нашої агенції, було проведено практичне тестування, сформоване довкола двох основних питань:
/en/ відсутній?Найбільш виразні підтвердження цієї схильності зафіксовано в поведінці ботів розробки OpenAI на основі аналізу серверних логів. Компанія OpenAI використовує три типи краулерів, і сприйняття їх як єдиного механізму викривляє розуміння реальних процесів:
Кінцевий перелік цитованих URL-адрес визначається функціонуванням ботів OAI-SearchBot та ChatGPT-User.
Розподіл журналів подій (логів) за конкретними ботами демонструє, що пріоритетизація англійської мови не є статичною. Вона стрімко зростає у міру наближення системи до моменту генерування цитати.
Порівняльний аналіз динаміки виявляє наступні закономірності. Навчальний краулер GPTBot практично не надає переваги англомовним версіям на багатомовних сайтах. Він сканує контент усіма наявними мовами, причому частка охопленого ним англомовного матеріалу нижча за рівень реального органічного попиту на цю мову.
З точки зору архітектури навчання це є логічним кроком: оскільки базову модель першочергово тренували на англомовних даних, система потребує систематичного залучення джерел іншими мовами. Показники OAI-SearchBot знаходяться на середньому рівні.
Завершальною ланкою виступає ChatGPT-User — бот, фіксація дій якого відбувається безпосередньо перед цитуванням джерела. Саме він вилучає англомовні версії сторінок частіше за всі інші краулери. Його медіанна частка залучення англійської мови орієнтовно втричі перевищує аналогічний показник Googlebot на тих самих ресурсах.
Таким образом, твердження «ChatGPT надає перевагу англійській мові» потребує уточнення. Перевагу надає безпосередньо бот вилучення даних (retrieval bot), тоді як навчальний бот цього не робить. Саме цей розрив є ключовим індикатором: викривлення виникає на етапі генерування відповіді, а не глибинно у процесі тренування моделі.
Попри те, що більшість клієнтів нашої агенції розташовані в Європі (Бельгія, Нідерланди, Франція тощо), аналогічні тенденції фіксуються на вебресурсах Канади та Індії.
Переіндексація (надмірне цитування) коливається у межах від 1,9 до 6,5 раза, із медіанним значенням близько 2,6. Бот ChatGPT завантажує англомовні сторінки у 65–79% випадків.
Ці дані свідчать про системну закономірність: перед формуванням остаточної відповіді AI-асистент визначає, яку саме мовну версію бренду аналізувати.
Результати обробки промптів суттєво відрізняються залежно від конкретної AI-моделі. При проведенні аналогічного тестування рівня переіндексації англійської мови для Copilot (із використанням вкладки AI Performance у Bing Webmaster Tools), а також для Google AI Mode та AI Overviews (на основі нових звітів у Google Search Console) зазначена схильність практично нівелюється.
Домінування англійської мови чітко простежується в даних ChatGPT, на відміну від Copilot, AI Mode та AI Overviews
Для кількісного вимірювання цього явища було розраховано єдиний індекс: відношення частки англомовних цитувань у AI до частки показів англомовного контенту у класичному пошуку. Показник 1,0 відповідає нейтральному значенню, тобто AI цитує англомовний контент із тією ж частотою, з якою сайт отримує покази за англомовними пошуковими запитами. Значення понад 1,0 вказує на наявність диспропорції на користь англійської мови.
Причина подібного розходження полягає в архітектурних відмінностях систем. Copilot та Google AI спираються на пошукові індекси, адаптовані до багатомовності протягом багатьох років. Вони успадковують усталені механізми релевантної видачі контенту конкретному користувачу (включно з обробкою тегів hreflang), а шар генерації відповідей переважно зберігає цю логіку.
Натомість ChatGPT здійснює оперативний пошук і вилучення даних безпосередньо в межах моделі, базовий якорний масив якої є англомовним, без використання розширеного багатомовного фундаменту. Таким чином, виявлена схильність притаманна безпосередньо шляху вилучення даних великими мовними моделями (LLM retrieval path), а не пошуковій індексації загалом.
Для фахівців галузі це формує чітке розуміння проблематики: описане явище є специфікою функціонування безпосередньо ChatGPT (і, ймовірно, інших LLM зі схожою архітектурою вилучення контенту, яку застосовує OpenAI).
Свого часу компанія Google впровадила підхід mobile-first indexing, за якого мобільна версія сайту стала визначальною для індексації.
Для великих мовних моделей (LLM), зокрема ChatGPT, аналогічний статус сьогодні отримують розділи з англомовним контентом. У разі публікації англомовної версії слід враховувати, що окремі AI-системи сприйматимуть її як основне першоджерело інформації про ресурс. Це правило діє незалежно від того, наскільки суттєву роль відіграє англомовна версія для реальної цільової аудиторії сайту.
Стратегія English-first створює потенційні ризики для вебресурсів, де англомовний розділ створювався як другорядний. Зокрема, у досліджуваному масиві даних зафіксовано випадок, коли банківська установа залишила на сайті застарілий англомовний PDF-документ із тарифами, хоча нідерландомовна та франкомовна сторінки були вчасно оновлені.
Алгоритм AI-асистента вилучив і процитував саме цей неактуальний файл. Неактуальний англомовний документ не просто залишається на сервері — він перетворюється на підсумкову відповідь для користувачів, які початково не запитували інформацію англійською мовою.
/en/)Оскільки великі мовні моделі пріоритетно звертаються до англомовних джерел, логічним кроком є забезпечення їх відповідним контентом. Ефективність цього рішення було перевірено шляхом зіставлення показників видимості у штучному інтелекті з показниками у класичному пошуку.
При прийнятті базового співвідношення 1:1 між класичною видимістю (покази в Google та Bing) та видимістю в AI-системах, порівняльний аналіз ресурсів із наявним розділом /en/ та без нього виявляє виразну закономірність.
Відносне зростання показників для сайтів із розділом /en/ у відповідях LLM
/en/ зростання показників сягнуло 122%.У підсумку отримані дані підтверджують тезу Стівена Бернса. Для більшості досліджених багатомовних сайтів наявність якісної та актуальної англомовної версії ключових (наріжних) сторінок сприяла розширенню видимості в AI-системах. Найбільш вираженим цей ефект виявився в ChatGPT, помітним — у Copilot, а також мав аналогічну спрямованість на пошукових AI-поверхнях Google.
Втім, є два ключові чинники, які стримують від однозначної рекомендації інтегрувати розділ /en/ абсолютно всім ресурсам:
Створення англомовного розділу є виправданим кроком виключно за наявності ресурсів для його повноцінного та систематичного обслуговування.
Дослідження спирається на три незалежні масиви даних:
/en/ для розрахунку індексу репрезентативності.GPTBot, OAI-SearchBot та ChatGPT-User на 26 багатомовних ресурсах. Базовим орієнтиром органічного попиту слугував Googlebot Smartphone. Для субаналізу 5 сайтів використовувалося стандартизоване 30-денне вікно спостереження./en, /en-xx, /xx-en або корінному домену, орієнтованому виключно на англомовний контент.Googlebot на тому ж ресурсі.Звітність щодо цитування в AI-системах знаходиться на етапі формування та характеризується наявністю статистичних шумів. Платформи Bing та GSC застосовують різні методології визначення AI-показів і цитувань, тому міжплатформенні показники демонструють загальну спрямованість тенденцій, а не прямо пропорційні абсолютні значення.
Ідентифікація ботів на основі логів спирається на рядки User-Agent та зворотний DNS (Reverse DNS), що створює ймовірність пропуску фальсифікованого або проксіованого трафіку.
Окремі етапи аналізу, зокрема розподіл за ботами та частини панелі GSC, базуються на відносно невеликих вибірках ресурсів (від декількох одиниць до кількох десятків), тому ці результати слід розглядати як репрезентативно-індикативні. Назви брендів і доменів у дослідженні анонімізовано відповідно до їхніх галузевих сегментів.
У підсумку отримані дані підтверджують тезу Стівена Бернса. Для більшості досліджених багатомовних сайтів наявність якісної та актуальної англомовної версії ключових (наріжних) сторінок сприяла розширенню видимості в AI-системах. Найбільш вираженим цей ефект виявився в ChatGPT, помітним — у Copilot, а також мав аналогічну спрямованість на пошукових AI-поверхнях Google.
Втім, є два ключові чинники, які стримують від однозначної рекомендації інтегрувати розділ /en/ абсолютно всім ресурсам:
Створення англомовного розділу є виправданим кроком виключно за наявності ресурсів для його повноцінного та систематичного обслуговування.
Дослідження спирається на три незалежні масиви даних:
/en/ для розрахунку індексу репрезентативності.GPTBot, OAI-SearchBot та ChatGPT-User на 26 багатомовних ресурсах. Базовим орієнтиром органічного попиту слугував Googlebot Smartphone. Для субаналізу 5 сайтів використовувалося стандартизоване 30-денне вікно спостереження./en, /en-xx, /xx-en або корінному домену, орієнтованому виключно на англомовний контент.Googlebot на тому ж ресурсі.Звітність щодо цитування в AI-системах знаходиться на етапі формування та характеризується наявністю статистичних шумів. Платформи Bing та GSC застосовують різні методології визначення AI-показів і цитувань, тому міжплатформенні показники демонструють загальну спрямованість тенденцій, а не прямо пропорційні абсолютні значення.
Ідентифікація ботів на основі логів спирається на рядки User-Agent та зворотний DNS (Reverse DNS), що створює ймовірність пропуску фальсифікованого або проксіованого трафіку.
Окремі етапи аналізу, зокрема розподіл за ботами та частини панелі GSC, базуються на відносно невеликих вибірках ресурсів (від декількох одиниць до кількох десятків), тому ці результати слід розглядати як репрезентативно-індикативні. Назви брендів і доменів у дослідженні анонімізовано відповідно до їхніх галузевих сегментів.
Читайте статтю англійською мовою.
performance_marketing_engineers/
performance_marketing_engineers/
performance_marketing_engineers/
performance_marketing_engineers/
performance_marketing_engineers/
performance_marketing_engineers/
performance_marketing_engineers/
performance_marketing_engineers/
Комплексний диджитал маркетинг
Послуги digital маркетингу для середнього та великого бізнесу. Digital стратегія. Performance маркетинг. Веб-аналітика.
Корпоративне навчання по Digital маркетингу. Формуємо програму під ваші потреби.
Digital маркетинг для глобальної експанії. Рішення для компаній, які планують виходити на ринки ЄС та США
Професійне налаштування Google Analytics 4. Коректний збір даних в GA4. Зрозуміла та корисна звітність.