ChatGPT не гуглит. У него свой поисковый робот, и с вашего сайта он берёт ровно 200 символов

Мы полгода складываем в базу ответы нейросетей: одни и те же вопросы, разные модели, снова и снова. Для ChatGPT у нас два способа снять ответ. Первый - официальный API. Второй - забрать ответ так, как его видит обычный человек в браузере.
Однажды я сравнил два ответа на один и тот же вопрос, снятые в один день из двух разных каналов, и завис. Это были не «немного разные формулировки». Это были разные компании в рекомендациях и почти не пересекающиеся списки сайтов.
Я полез в сырой поток, который ChatGPT отдаёт браузеру, пока печатает ответ. Там едет намного больше, чем видит пользователь: карточки всех найденных страниц, их описания и служебная пометка о том, откуда каждая страница взялась.
В этой статье разбор почти 1,9 миллиона источников, которые ChatGPT собрал, отвечая на наши вопросы: 190 тысяч подробных карточек из браузера и 1,7 миллиона ссылок из API. В нашей базе больше миллиона ответов нейросетей, здесь я беру только срез по ChatGPT.
Главный вывод такой: у ChatGPT есть собственный поисковый робот со своим индексом, он даёт 97% всех источников, и про вашу страницу он хранит один замороженный кусок текста длиной двести символов. Какой именно кусок, вы сейчас увидите, и он вам не понравится.
Что происходит, когда ChatGPT отвечает со ссылками
Сначала механика, без неё дальше будет непонятно.
Вы задаёте вопрос. Модель решает, нужен ли поиск. Если нужен, она сама придумывает поисковый запрос (часто не тот, что вы написали) и отправляет его во внутренний поиск.
В ответ она получает не страницы, а карточки: адрес, заголовок и короткое описание примерно на 200 символов. Всё. Целиком страницу она в этот момент не читает.
Дальше она смотрит на эти карточки и пишет ответ, ссылаясь на некоторые из них. Какие-то попадают в текст, какие-то нет.
Между вашим сайтом и ответом ChatGPT стоит посредник: карточка из 200 символов. Именно по ней модель решает, годитесь вы для ответа или нет. Вся эта статья, по сути, про то, что в этой карточке лежит.
Как я считал
Никаких опросов и экспертных мнений, только сырые логи.
Канал А, официальный API. Обычный вызов с включённым веб-поиском. В ответе видно, какие поисковые запросы модель придумала и какие ссылки ей вернулись.
Канал Б, браузер. Ответ снимается тем же путём, каким его получает браузер обычного пользователя: поток служебных событий, из которого страница собирает текст на экране. Мы храним этот поток целиком, а не только итоговый текст.
Именно канал Б оказался интересным. Внутри потока лежат те самые карточки, а в тексте ответа модель расставляет служебные метки вида turn0search5, где 5 - номер карточки. Сопоставив метки с номерами, можно точно сказать: вот эти две карточки из двадцати трёх модель использовала в тексте, а остальные двадцать одну посмотрела и выбросила.
Канал Б (браузер) | Канал А (API) | |
|---|---|---|
Ответов разобрано | 15,8 тыс. | 169 тыс. |
Источников собрано | 190 тыс. | 1,7 млн |
Уникальных страниц | 128 тыс. | 205 тыс. |
Период | февраль - июль 2026 | сентябрь 2025 - февраль 2026 |
Итого 1,9 миллиона источников. Разница между каналами принципиальная: в API мы видим голые ссылки, а в браузере полные карточки с заголовком и описанием. Поэтому вся анатомия дальше построена на браузерном канале, а API идёт для сравнения.
1. В карточках нашлась пометка о том, кто их принёс
С середины мая в каждой карточке появилось служебное поле, которого нет ни в какой документации. Оно называет внутренний конвейер, который эту страницу добыл. Значений четыре: labrador, bright, oxylabs, serp.
Само по себе это просто слова. Интересно то, что за ними стоит. Я разметил этими пометками 32 тысячи карточек и посмотрел на каждый конвейер отдельно.
labrador | bright | oxylabs | serp | |
|---|---|---|---|---|
доля всех карточек | 97,0% | 2,6% | 0,3% | 0,1% |
длина описания | 202 знака | 159 | 155 | 144 |
описаний ровно на 195-205 знаков | 99,9% | 0,6% | 2,9% | 0% |
заголовков длиннее 75 знаков | 32,4% | 0,6% | 0% | 0% |
самый длинный заголовок | 1 124 знака | 105 | 72 | 69 |
знает дату публикации | 56% | 0,7% | 0% | - |
разных сайтов в выборке | 12 035 | 318 | 54 | - |
Оговорюсь сразу: на oxylabs пришлось 104 карточки, на serp всего 21, это капля, точные проценты по ним считать нельзя. Важно, что ведут они себя как bright.
Теперь по-человечески, что тут написано.
Три конвейера справа - это покупная выдача. Поясню термин, дальше он будет часто встречаться. Есть отдельный рынок сервисов, которые сами обходят поисковики, снимают их выдачу и продают другим компаниям по API: вы отправляете запрос, вам возвращают готовый список из десяти ссылок с заголовками и описаниями, как в поиске. Такие сервисы нужны всем, кто не хочет строить свой поисковый индекс. Судя по именам в логах, ChatGPT часть результатов берёт именно так.
Выглядит это узнаваемо: описание около 155 знаков, заголовок обрезан на 70, даты обычно нет. Классический результат из чужой поисковой выдачи, просто переданный по API.
А labrador ведёт себя как собственный поисковый робот. Официального объяснения, что это такое, нет, имя внутреннее и нигде не описано. Всё, что дальше, - выводы из поведения. А ведёт он себя так:
режет описание ровно по 200 знаков, с точностью до пары символов;
заголовок не трогает вообще: треть заголовков длиннее 75 знаков, а рекордсмен в нашей выборке весит 1124 знака вместе с хлебными крошками. Обычный поисковик такое никогда не отдаст, он режет заголовок на 60-70 знаках;
знает дату публикации у половины страниц, то есть хранит полноценную карточку, а не просто ссылку;
охватывает 12 тысяч разных сайтов против трёхсот у покупной выдачи, и среди них полно мелких региональных магазинов и отраслевых сайтов, которые в покупной выдаче не встречались ни разу.
Есть и прямое доказательство, что labrador ходит на сайт сам. Я посмотрел, с чего начинается описание:
у labrador 61% описаний начинаются с текста в ВЕРХНЕМ РЕГИСТРЕ, и все 100% обрываются многоточием на полуслове;
у bright капса почти нет, зато 23% начинаются с даты в формате «Dec 10, 2025», а 52% заканчиваются словами «Read more».
Верхний регистр в начале - это заголовок H1, снятый прямо со страницы вместе с оформлением. «Dec 10, 2025 … Read more» - готовый сниппет из чужой поисковой выдачи. Разница как между «я сам сходил и переписал начало страницы» и «мне прислали готовое описание».
Собственный робот обходит открытый интернет. Всё, что от него закрыто, докупается на стороне, и это три процента.
Кстати, про закрытое. В среднем покупная выдача - это 3% карточек. Но если посмотреть по отдельным площадкам, картина резко меняется:
площадка | доля карточек из покупной выдачи |
|---|---|
в среднем по всем сайтам | 3% |
instagram.com | 100% |
pinterest.com | 100% |
youtube.com | 88% |
linkedin.com | 74% |
reddit.com | 43% |
Ровно те площадки, которые жёстко блокируют чужих роботов. Похоже, туда собственный робот попасть не может, и данные приходится докупать.
Ночь, когда пометку убрали
Короткая история, которая объясняет, зачем такие вещи логировать самому.
Пометка впервые появилась на неделе 18-24 мая, в 374 ответах из 4326. Со следующей недели она уже почти в каждом ответе. Так продолжалось два месяца:
18 июля 1761 ответ 1756 с пометкой
19 июля 67 ответов 67 с пометкой
20 июля 209 ответов 208 с пометкой
21 июля 406 ответов 387 с пометкой
22 июля 740 ответов 0 с пометкой <---
23 июля 437 ответов 0 с пометкой
...
19 августа 44 ответа 0 с пометкой
За ночь с 21 на 22 июля поле исчезло разом во всех ответах. Ни одного случая за следующий месяц.
Хорошая новость в том, что сам механизм никуда не делся. Отличить собственного робота от покупной выдачи можно и без пометки, по описанию. Ровно 200 знаков и заголовок капсом - это он.
2. Погодите, а разве это не Bing?
Самое частое возражение, которое я слышу: у OpenAI нет никакого своего поиска, ChatGPT просто ходит в Bing, это давно известно.
Возражение резонное, и проверить его оказалось проще, чем кажется. Не нужно ничего сравнивать с внешней выдачей: контрольная группа уже лежит в тех же логах.
У нас два вида карточек. Про покупную выдачу мы точно знаем, что это результаты внешнего поисковика, перепроданные посредником, так работает сам сервис. Если бы собственный робот был такой же обёрткой над чужим поиском, эти два потока были бы похожи. Они не похожи ни в чём.
Они не смешиваются. Из 2500 ответов 2343 целиком построены на карточках собственного робота, 71 целиком на покупной выдаче, и ни одного ответа, где встретились бы оба источника сразу. Это не «нашли у себя, чего не хватило, добрали у поисковика». Это переключение канала целиком, на весь ответ.
Они дают разные сайты. У собственного робота 12 тысяч разных доменов в выборке, у покупной выдачи 318, общих всего 175. Причём собственный робот вытаскивает мелкие региональные сайты, которых в покупной выдаче нет вообще ни разу.
Докупают ровно то, куда робот не может зайти. Вот это, по-моему, решающий довод. Если бы ChatGPT просто ходил в Bing, зачем бы ему отдельно докупать youtube и reddit? Они в любом поисковом индексе есть. А в наших данных именно они и докупаются: instagram и pinterest на 100%, youtube на 88%, linkedin на 74%, reddit на 43%, при средней доле покупной выдачи в 3%. Это поведение не поисковика-посредника, а своего краулера, который упирается в блокировки и обходит их деньгами.
Плюс ещё три довода из формата самих карточек.
Первый - заголовки. Любой поисковик обрезает заголовок примерно на 65-70 знаках, потому что верстает выдачу для человека. У собственного робота треть заголовков длиннее 75 знаков, а максимум за 1100. Он не верстает выдачу, он складывает данные для машины, и ему всё равно, что заголовок не влезет в строку.
Второй - описание не зависит от запроса. В обычном поиске сниппет пересобирается под каждый запрос, там подсвечивается кусок, где встретились ваши слова. Здесь описание одно и то же в разных вопросах (детали ниже, в третьем разделе). Так поисковики не делают, а хранилище нарезанных страниц делает именно так.
Третий, и самый наглядный - содержимое описаний. Ни один поисковик не положит в сниппет alt-тексты картинок, подписи полей формы и код рекламного блока. А собственный робот кладёт, и это видно в каждом шестом описании. Похоже, он просто рендерит страницу и берёт первые 200 знаков видимого текста, ничего не разбирая.
Дальше как раз про это.
3. Что именно ChatGPT забирает с вашей страницы
Раз собственный робот даёт 97% карточек, вопрос «что он вырезал именно с вашей страницы» становится главным вопросом всей оптимизации.
Я взял 114 тысяч непустых описаний и посмотрел, из чего они состоят. Медиана - 201 знак. 86% обрываются на полуслове. А внутри:
каждое шестое описание (17,6%) содержит alt-тексты картинок, они видны как подписи «Image:»;
в 2603 описаниях лежит телефон из шапки сайта;
в 1969 лежит оглавление статьи, слова «Содержание», «Читайте также»;
в 1333 - куки-баннер, пункты меню или копирайт.
Теперь живые примеры. Разберём по одному, потому что с ходу они выглядят как абракадабра, и это как раз главная проблема.
Пример первый. Интернет-магазин мебели, страница категории. Вот что о ней знает ChatGPT:
СЕДАН ДО 600 000 РУБЛЕЙ Список всех седанов в продаже до 600 000 рублей. Стоимость указана за базовую комплектацию, чтобы увидеть цены на все комплектации - перейдите на страницу автомобиля. Полный…
Это ещё удачный случай. Робот взял заголовок H1 («СЕДАН ДО 600 000 РУБЛЕЙ», капсом, потому что так он отрендерен на сайте) и следующий за ним абзац. Описание осмысленное, по нему понятно, что это за страница.
Пример второй. Другой автомобильный сайт, такая же страница подбора. Вот его карточка:
* # Автомобили в кузове седан до 600 000 руб. Все фильтры 2 Марка [Input] BELGEE 0 авто [Input] CHANGAN 0 авто [Input] CHERY 0 авто [Input] DEEPAL 0 авто [Input] GEELY 3 авто [Input] HYUNDAI 0…
Расшифровываю. [Input] - это чекбокс в фильтре: на странице слева стоит панель «Марка», и рядом с каждой маркой галочка и количество машин. «BELGEE 0 авто» значит, что по этой марке в наличии ничего нет.
То есть робот дошёл до H1, а дальше по разметке у него оказался фильтр, а не текст. И он честно переписал первые 200 знаков фильтра. В итоге всё, что ChatGPT знает про этот магазин: у них нет BELGEE, нет CHANGAN, нет CHERY, есть три GEELY.
Ни цен, ни ассортимента, ни города, ни условий доставки. Просто список нулей.
Пример третий. Страница поддержки крупного производителя телефонов:
CAN I ACCESS MY DATA IF MY GALAXY PHONE SCREEN IS BROKEN? Last Update date : 2026-06-18 [Input] [Input] [Input] [Input] [Input] [Input] [Input] [Input] [Input] [Input] HOW TO ACCESS DATA ON A SAMS…
Здесь между заголовком статьи и её текстом стоит блок с десятью полями (похоже, выбор модели устройства и региона). Половину описания съели пустые квадратики. До самого ответа на вопрос «что делать, если разбит экран» робот так и не добрался.
Пример четвёртый. Статья в корпоративном блоге:
ВАЛЮТНЫЙ КОНТРОЛЬ ПО ВНЕШНЕТОРГОВЫМ КОНТРАКТАМ Тематики: Хозяйственная деятельность Image Послушать: [player id=‘57772’] Содержание скрыть 1. Зачем ставить внешнеторговый контракт на учет? 2. К…
Заголовок, рубрика, картинка, виджет «Послушать статью», который даже не отрендерился и остался в виде кода плагина, дальше оглавление. Текста статьи в описании нет вообще.
И мой любимый пример. Статья про матрасы:
ИЗ ЧЕГО СОСТОИТ МАТРАС ОРТОПЕДИЧЕСКИЙ Разное Содержание * Из чего состоит ортопедический матрас * (adsbygoogle = window.adsbygoogle || []).push({}); Пружинны…
В описание страницы для нейросети попал код рекламного блока Google.
Обратите внимание, чего в этих описаниях нет нигде: meta description. Ни в одном из 114 тысяч. То поле, которое вы аккуратно заполняете в SEO-плагине, в этот канал не попадает вообще.
Ваше описание в ChatGPT пишете не вы в админке. Его пишет вёрстка первого экрана.
Отдельная категория: у 40% карточек описания не было совсем, только заголовок и ссылка. По таким страницам модель решает, брать их в ответ или нет, вообще ничего не зная о содержании.
4. Это описание заморожено и не меняется от вопроса к вопросу
Логичное предположение: раз описание короткое, наверное, оно вырезается под конкретный вопрос. Спросили про цены - показали кусок про цены.
Проверил в лоб. Взял страницы, которые попадались в разных вопросах, и сравнил их описания.
Один и тот же адрес, один и тот же день, разные вопросы: описание совпало слово в слово в 73% случаев. Один и тот же адрес в разные дни: совпало в 72%.
Разницы между «в один день» и «в разные дни» почти нет. Значит, описание не пересобирается ни под вопрос, ни со временем. Робот нарезал его один раз, когда заходил на страницу, и оно лежит замороженным. Оставшиеся 27% - это, судя по всему, обычный повторный обход, когда страница успела поменяться.
Заголовки стабильны ещё сильнее: 94% совпадают.
Смысл здесь простой и жёсткий: вы не можете попасть в вопрос удачным абзацем в середине статьи. У вас одна попытка - первые 200 знаков, которые увидел робот. Их покажут модели во всех вопросах, где всплывёт ваша страница, о чём бы ни спросили.
5. Что происходит дальше: из 190 тысяч карточек до ответа доходят 20 тысяч
Теперь главная воронка.
этап | сколько |
|---|---|
ответов разобрано | 15 835 |
из них вообще без поиска | 5236 (33%) |
карточек получено | 190 тыс. |
карточек попало в текст ответа | 20,6 тыс. |
уникальных страниц показано модели | 128 тыс. |
страниц, ни разу не попавших в текст | 111 тыс. (87%) |
Каждый третий ответ обходится вообще без поиска: модель отвечает из головы. В остальных она получает в среднем 12 карточек, а использует одну-две.
Дальше позиция. Вот доля попадания в текст в зависимости от номера карточки:
номер карточки | попало в текст |
|---|---|
1 | 14,2% |
2 | 7,7% |
3 | 3,5% |
5 | 3,3% |
10 | 1,3% |
15 | 0,5% |
20 | 0,1% |
Всё, что дальше десятой строчки во внутренней выдаче, можно считать несуществующим.
И ещё одна контринтуитивная деталь, которую я сначала принял за ошибку разбора. Карточки без описания попадают в текст в 14,7% случаев, а карточки с нормальным двухсотзначным описанием - в 7,1%. То есть отсутствие описания не мешает, а помогает.
Объяснение по нашим данным простое: пустое описание обычно у страниц, которые модель подтягивает отдельно, уже в процессе рассуждения, а не получает пачкой из выдачи. Это осознанный выбор, а не веерный сбор.
6. API и браузер - это две разные машины
Теперь то, с чего всё началось.
В API мы отдаём модели инструмент веб-поиска и видим её работу изнутри: 100% ответов идут с поиском, в среднем 1,8 обращения к поиску, около 10 источников на обращение. Всего 1,7 миллиона источников за период.
Но там, где в браузере лежит полноценная карточка с заголовком и описанием, API отдаёт вот это:
{"url": "https://www.wereva.ru/en/news/details/gss-cosmetics-is-expanding...", "type": "url"}
Голая ссылка. Ни заголовка, ни описания, ни даты. Что модель прочитала на странице, из API не видно никак.
Дальше цифры отбора. В API из 205 тысяч увиденных страниц в ответы попали 106 тысяч, это 52%. В браузере в ответ попадает 13% увиденного. Разница вчетверо: в API модель получает узкий отобранный список и тащит в ответ почти всё, в браузере получает широкий веер и жёстко фильтрует.
Финальная проверка. Я нашёл 591 вопрос, который прогонялся через оба канала, и сравнил, какие сайты оказались в ответах:
среднее на вопрос | |
|---|---|
сайтов в ответе браузера | 5,9 |
сайтов в ответе API | 18,1 |
общих сайтов | 2,4 |
совпадение списков | 13% |
вопросов, где нет ни одного общего сайта | 33 |
Один и тот же вопрос, совпадение источников 13%. Если вы тестируете видимость своего бренда через API, вы измеряете не то, что видят люди в приложении.
И последняя мелочь, которая дороже всего обойдётся тем, кто считает трафик. Ссылки в ответах помечаются метками, и метки у каналов разные: ответ в браузере несёт utm_source=chatgpt.com, ответ через API - utm_source=openai.
Если у вас в аналитике стоит фильтр на chatgpt.com, вы не видите переходы из API-интеграций: встроенных ассистентов, ботов, поиска внутри чужих продуктов.
Что с этим делать
Выводы ровно из тех данных, что выше.
Откройте свою страницу и прочитайте первые 200 знаков после заголовка. Мысленно сотрите шапку и меню, начните с H1. То, что идёт следом, и есть ваше описание в ChatGPT. Если там «Все фильтры 2. Марка. BELGEE 0 авто», то это и увидит модель во всех вопросах про вас.
Уберите мусор между заголовком и первым абзацем. Фильтры, блоки полей, оглавление, виджет «послушать статью», куки-баннер - всё это съедает ваш лимит.
Meta description не работает. В 114 тысячах описаний его нет ни разу. Силы, вложенные в поле в SEO-плагине, на этот канал не влияют.
Alt картинок - часть описания. В каждом шестом описании есть alt. Осмысленный alt у первой картинки может занять треть лимита, бессмысленный тоже займёт.
Проверьте, пускаете ли вы робота. 97% источников приходит от собственного робота OpenAI. Если сайт закрыт от обхода или контент рисуется скриптами, вы остаётесь в трёхпроцентном подсобном канале.
Заголовок можно не резать под 60 знаков. Собственный робот берёт его целиком. Но покупная выдача обрежет, так что смысл всё равно должен помещаться в первые 60.
Боритесь за первую строчку, а не за первую десятку. Первая карточка попадает в ответ в 14,2% случаев, десятая - в 1,3%.
Считайте оба канала. utm_source=chatgpt.com и utm_source=openai - это разные потоки.
Ограничения
Честно про то, где эта картина может врать.
Это срез, а не вечная истина. Служебная пометка исчезла 22 июля, и завтра точно так же может измениться нарезка описаний. Всё, что выше, верно на период с февраля по август 2026 года.
Разбор по конвейерам сделан на 32 тысячах карточек, а не на всём массиве: размеченный период жил всего два месяца. Общие цифры по описаниям и цитированию посчитаны по всем 190 тысячам.
Наш набор вопросов не нейтрален. Это реальные коммерческие вопросы наших клиентов про свои рынки: техника, недвижимость, автомобили, услуги, софт для бизнеса. На академических или медицинских темах пропорции наверняка другие.
Мы не видим, что происходит внутри модели. Видно, что ей дали на вход и что она написала на выходе. Почему из двадцати карточек она выбрала третью, из логов не следует.
Сравнение двух каналов не идеально чистое. В API мы используем свою модель и свои настройки поиска, в браузере работает та, что стоит по умолчанию. Часть разницы в 13% - это разница моделей. Но нулевое пересечение на 33 вопросах разницей моделей не объясняется.
Вместо вывода
Мы привыкли думать, что нейросеть прочитала интернет и сделала выводы.
В логах это выглядит иначе. Робот один раз зашёл на вашу страницу, отрезал двести знаков вместе с alt картинки, галочками фильтра и кодом рекламы, положил в индекс и заморозил. Дальше на любой вопрос, где ваша страница всплывёт, модель увидит именно этот кусок. И с вероятностью 87% не возьмёт его в ответ.
Оптимизация под нейросети сейчас - это не про тексты и не про ключевые слова. Это про то, что физически стоит в первых двухстах знаках после заголовка. Проверить можно за пять минут, руками, на своей же странице.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.