The Daily Newsstand · Free, Always
Tuesday, September 15, 2026

ChatGPT не открывает страницу в 93% быстрых ответов: что видит модель и что чинить на сайте

Translate

В быстром режиме, без нажатой кнопки «Think», ChatGPT открывает страницу живьём в 7% ответов. В остальных 93% он её не открывает вовсе: в дело идёт готовая карточка — заголовок целиком (зафиксированы 289 знаков) и сниппет на 200 знаков, вырезанный задолго до вопроса. Часть карточек лежит в индексе OpenAI, часть приезжает выдачей Google, снятой скрейпингом. Сайт можно вылизать по канонам SEO и не попасть в ответ: в него никто не заглядывал.

Откуда это известно. С мая по июль 2026 в ответнах ChatGPT у каждого источника стояла служебная пометка, каким каналом его достали: собственный индекс OpenAI или один из трёх внешних поставщиков скрейпинга. За эту пометку и зацепились: французская команда RESONEO собрала на ней корпус из 1249 ответов и 88 000 результатов поиска в них, захваты июля-августа 2026 (think.resoneo.com). Вопросы задавали с флота аккаунтов — бесплатных, платных, разлогиненных, из разных стран, — потому что от аккаунта зависит режим ответа, а от режима, как выяснилось, зависит и состав источников.

На своём домене подняли страницы с уникальным отпечатком — по ним видно, приходил ли за страницей робот. Поток ответов с ChatGPT писали расширением браузера. Рядом разобрали серверные логи на 325 000 адресов за три месяца. И отдельно спрашивали модель с принудительно отключённым живым доступом в сеть — так видно, что у неё уже лежит в кэше, а за чем она идёт в интернет.

Вместо страницы ИИ-модель читает карточку: заголовок и 200 знаков, снятых в день обхода

Карточка собирается один раз, при обходе. Сниппет вырезают от H1 и того, что стоит визуально рядом: категория, alt картинки, дата, автор, оглавление. Отбора под смысл вопроса тут нет — вопроса ещё не существует.

Для больших страниц следствие неприятное: таблица характеристик, раздел про доставку и блок с ценами со второго экрана до ИИ-модели не доезжают. Посмотрите, что стоит в первых двух-трёх элементах после вашего H1: хлебная крошка, дата и подпись автора и есть то, чем сайт представляется в 93% ответов.

Один и тот же сниппет уходит и в ответ про цену, и в ответ про доставку

Сниппет из индекса не зависит от вопроса: одна и та же врезка на 200 знаков идёт и в ответ про стоимость, и в ответ про сроки. Пока страницу не обойдут заново, других вариантов у неё нет.

Meta description на этом пути игнорируется полностью: он писался под поисковую выдачу, где сниппет пересобирают под запрос, а в индексе OpenAI эта роль занята текстом со страницы. По захватам RESONEO он идёт в дело в одном случае из трёх и только для результатов из выдачи Google, снятой скрейпингом.

Кнопка «Think» на бесплатном тарифе даёт столько же источников, сколько платная подписка

В режиме размышления страница открывается по-настоящему, и корпус переворачивается: около 75% URL приходят из выдачи Google и лишь четверть — из индекса OpenAI. Источников заметно больше, порядка 28 доменов на разговор.

Бесплатный аккаунт с нажатой кнопкой «Think» даёт 35,3 URL против 35,1 у платного режима размышления, а состав зеркальный: у бесплатного 74,7% источников идёт через собственный индекс, у платного 75,3% — через Google. Один клик удваивает число источников, с 15,1 до 35,3 URL, без смены тарифа. Совет купить подписку бьёт не туда: корпус выбирает режим ответа.

Режим ответа меняет корпус источников сильнее, чем тариф.

Режим ответа меняет корпус источников сильнее, чем тариф.

Бюджет поиска у платного режима размышления сократился почти вдвое между 26 и 31 июля 2026, с 47,2 до 33,9 URL, — до выхода новой версии модели 6 августа. Менялась поисковая инфраструктура, а не модель.

JSON-LD вырезают по дороге к ИИ-модели, а подпись к картинке доезжает

Там, где страница открывается — режим размышления и те самые 7% быстрых ответов, — её переводят в текстовый формат. Из HTML выбрасывают <script>, <iframe> и JSON-LD целиком: разметка, которую ставят специально для машин, до ИИ-модели не доходит ни одним полем. Alt-текст картинок и текст, скрытый CSS-стилями, наоборот, сохраняются.

Ещё у страницы есть жёсткий лимит 4 МБ: превышение даёт HTTP 400 и отказ от чтения целиком — не усечение, а ноль.

Прочитанное кладётся в общий кэш: копия свежа около 30 минут, дальше отдаётся устаревшая версия, а обновление идёт в фоне. В корпусе RESONEO попадались копии спустя 90 с лишним дней после обхода, а Cache-Control: no-store и noindex этот слой игнорирует.

Микроразметка этим путём до модели не доходит, а скрытый стилями текст доходит.

Микроразметка этим путём до модели не доходит, а скрытый стилями текст доходит.

Снимать разметку из-за этого не надо, её читают Google и Яндекс. Вопрос в другом: где ещё, кроме неё, лежит тот же факт.

Всё это — из служебного поля в трафике ChatGPT

В мае 2026 в потоке ответов ChatGPT у каждого источника появилась пометка, откуда он взят: собственный индекс OpenAI или один из трёх внешних поставщиков скрейпинга. Чужой трафик никто не перехватывает, TLS и QUIC такого не дают: каждый читает расшифрованный поток своего браузера в инспекторе, DevTools → Network. Пометку независимо заметили минимум пять человек.

Процентам в этой статье я верю из-за масштаба корпуса: флот аккаунтов разных стран и тарифов, маячковые страницы на своём домене и разбор серверных логов на 325 000 URL.

Первую трактовку в конце июня 2026 дал SEO-консультант Suganthan Mohanadasan: закрытый канал для лицензированных изданий вроде Reuters и Wikipedia (suganthan.com). Через десять дней он снял свою версию публично — у читателя с бесплатным тарифом в Италии та же метка стояла у всех цитирований подряд, включая крошечные сайты. Поле называет канал, которым провели запрос конкретного пользователя, и качества источника не оценивает.

Одно и то же поле объясняли трижды, и первую версию автор снял сам.

Одно и то же поле объясняли трижды, и первую версию автор снял сам.

Третья версия — начало сентября: Peec AI описала находку как семейство примерно из 12 вертикальных индексов (peec.ai), а у RESONEO шопинг и локальный поиск идут по отдельным меткам торговых фидов; открытый вопрос, а не деталь для сглаживания. Внутреннее имя системы OpenAI не подтверждала ни разу, включая прямой запрос SearchEngineWatch (searchenginewatch.com). Документально подтверждён общий принцип: с апреля 2026 в справке Enterprise описан режим, где ChatGPT берёт «indexed and cached web content» вместо живого поиска (help.openai.com).

Открытый GPTBot ничего не говорит о том, пустят ли вас в цитаты

У ChatGPT минимум четыре обходчика с независимыми правами (developers.openai.com). GPTBot собирает данные для обучения. OAI-SearchBot решает, попадёте ли вы в цитаты и сниппеты поиска: закрывшие его остаются разве что навигационными ссылками. ChatGPT-User заходит по инициативе пользователя, и robots.txt к нему может не применяться. OAI-AdsBot проверяет посадочные страницы объявлений.

Закрыть GPTBot и оставить OAI-SearchBot — разумная позиция: не отдавать тексты на обучение, но остаться в ответах. С 15 сентября 2026 новые домены на Cloudflare получают её почти из коробки: категории Training и Agent на страницах с рекламой закрыты по умолчанию, а Search, куда входит OAI-SearchBot, остаётся открытой (cresva.ai). Проверить всё равно надо: дефолт перебивается своими же руками — общий запрет User-agent: * с Disallow: / или список ИИ-ботов из чужой статьи закрывает поисковый обходчик заодно с обучающим. Правку robots.txt системы OpenAI подхватывают примерно за сутки.

Скрипт проверяет каждого обходчика отдельно и не врёт, когда файл не отдали:

import urllib.error, urllib.request
from urllib.robotparser import RobotFileParser

BOTS = ("OAI-SearchBot", "GPTBot", "ChatGPT-User", "OAI-AdsBot")

def audit_bots(domain: str, timeout: float = 10.0) -> dict[str, str]:
    try:
        with urllib.request.urlopen(f"https://{domain}/robots.txt", timeout=timeout) as r:
            body = r.read().decode("utf-8", errors="replace")
    except urllib.error.HTTPError as err:
        # 401 и 403 парсер по умолчанию считает запретом на всё, хотя правил я не видел
        unknown = err.code in (401, 403) or err.code >= 500
        return dict.fromkeys(BOTS, f"неизвестно (HTTP {err.code})" if unknown
                             else "разрешён (robots.txt не отдан)")
    except (urllib.error.URLError, TimeoutError) as err:
        return dict.fromkeys(BOTS, f"неизвестно (сеть: {err})")
    rp = RobotFileParser()
    rp.parse(body.splitlines())
    return {b: "разрешён" if rp.can_fetch(b, f"https://{domain}/") else "закрыт" for b in BOTS}

for bot, verdict in audit_bots("example.com").items():
    print(f"{bot}: {verdict}")

Сделано, когда скрипт печатает четыре строки, в строке OAI-SearchBot стоит разрешён, а статуса неизвестно нет ни в одной. Обработка ошибок не педантизм: голый RobotFileParser на 401 и 403 молча ставит запрет на всё, а на сетевой ошибке роняет скрипт — короткая версия напечатала бы четыре закрыт там, где правил я не видел вовсе.

Что из этого следует для сайта — цена и дата должны стоять предложением в тексте

Ключевой вывод — цена, дата, автор и назначение продукта идут обычным предложением в основной текст, ближе к H1, и повторяются в alt соседней картинки. В быстром режиме карточку режут от H1 и соседних элементов, включая alt, а там, где страницу открывают, JSON-LD исчезает.

Факт, который живёт только внутри <script type="application/ld+json">, для ChatGPT не существует ни в одном из режимов. Тот случай, когда страница проходит валидатор разметки, даёт красивый сниппет в поиске и остаётся немой в ответе ИИ-модели.

Заодно прочитайте первые 200 знаков после H1: отвечают ли они на вопрос, ради которого страницу открывают.

Самые ценные визиты ИИ-модели приходят без UTM-метки

Клики по видимым в ответе ссылкам несут метку utm_source со значением chatgpt.com. А страницы, которые ИИ-модель открыла сама в режиме размышления и действительно прочитала — те, у которых шанс попасть в цитату около 74%, — не несут UTM-метки вообще.

Механика простая: UTM появляется, когда по ссылке кликнул человек. Чтение роботом метки не создаёт, а картинки перехостятся на серверах OpenAI и следов в логах не оставляют. Строка «визиты из ChatGPT» в отчёте описывает хвост процесса, а не присутствие в ответах.

Обходчика ИИ на новую страницу приводит ссылка с другой страницы, а из sitemap он не приходит

Команда RESONEO 16 дней держала под наблюдением свой домен и проверила четыре способа завести страницу в индекс OpenAI: сирота, прочитанная один раз, со ссылкой с известной страницы и запись в sitemap. В индекс за это время не попала ни одна страница — ни одним из четырёх способов. Разошлись они на шаг раньше, на обходе: GPTBot скачивает sitemap ежедневно, но по адресам, которые есть только там, не ходит — 0 из 8 URL, а восемь страниц с обычной ссылкой обошёл в тот же день. Это единственный сигнал, который дало наблюдение: ссылка приводит обходчика. Что нужно странице, чтобы после обхода попасть в индекс, замер не показал.

Для sitemap обидно, но логично: файл качают, а обход идёт по ссылкам. Новая страница за фильтром, пагинацией или JS-меню для этого маршрута не существует, сколько её ни перечисляй в карте сайта.

Нет визита — ссылка стоит там, куда обходчик сам не заходит, и поднимать надо её. Оговорка исследователей: каким роботом наполняется индекс, они не знают — маячковые страницы почти не ловили OAI-SearchBot, хотя индекс по ним отдавал результаты.

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.