The Daily Newsstand · Free, Always
Tuesday, September 22, 2026

Как меняется AI Visibility в новом чате и внутри диалога при одном и том же финальном запросе

Translate

В изученных мной замерах AI Visibility бренд часто проверяют с помощью фиксированного набора независимых промптов. Такой подход описан, например, в методике замера видимости брендов и в разборе Brand Mention Rate и Share of Voice. Каждый запрос запускают отдельно, при необходимости повторяют несколько раз, а затем считают, как часто бренд появляется в ответах. Такой протокол удобен для повторных измерений и сравнения результатов.

Но этот подход опирается на одно методическое допущение. Каждый запрос рассматривается отдельно от предыдущей истории разговора.

Эта статья не про очередной фактор AI Visibility и не про выбор лучшей CRM. Я проверял, сохраняется ли результат замера по независимым запросам, если тот же коммерческий вопрос задается после контролируемой истории разговора.

Финальный запрос во всех сценариях был одинаковым.

Какие CRM-системы ты бы рассматривал для компании в России?

До запуска я зафиксировал исследовательский вопрос, тексты сценариев, финальный промпт, число повторов, правила разметки и критерий выбора бренда для отдельного теста. После завершения прогонов отдельно проверил 33 фактических утверждения из ответов и интерпретировал результаты.

Отправку реплик в 45 отдельных диалогах и сохранение ответов без сокращений выполнял ChatGPT Work по заранее заданному протоколу. Исследовательский вопрос, критерии сравнения и выводы агент не определял.

CRM использовалась только как экспериментальный стенд. Целью не было определить лучшую систему или сравнить качество ChatGPT, Perplexity и Алисы AI.

Как проходил эксперимент

Контрольный сценарий S0 был самым простым. Новый чат открывался сразу с финального вопроса.

В S1 до него система узнавала, что речь идет о небольшой B2B-компании с восемью сотрудниками в продажах, которая не хочет сложного внедрения.

В S5 контекст был другим. Компания продавала B2B-услуги, сделка длилась несколько месяцев, в ней участвовали несколько сотрудников, было много звонков, писем и повторных контактов.

S9 проверял предварительное упоминание бренда. Пользователь нейтрально называл одну CRM, сообщал, что пока ничего о ней не знает, а затем просил посмотреть рынок шире.

В S11 несколько CRM сначала называла сама нейросеть. После этого разговор переводился с конкретных продуктов на принцип выбора и завершался тем же финальным вопросом.

Для каждой системы было по три новых чата на сценарий. Всего получилось 45 диалогов.

В S0 финальный запрос задавался без предыдущей истории. В остальных сценариях ему предшествовал контролируемый контекст. После этого я сравнивал состав брендов, которые система действительно предлагала рассмотреть.

Не каждое появление CRM в ответе считалось одинаковым. Для разметки я использовал 3 уровня.

Mention означал, что бренд просто встретился в тексте.

Consideration означал, что система включила продукт в набор вариантов для рассмотрения.

Recommendation означал, что продукт был связан с условиями пользователя и получил явное обоснование выбора.

Похожее разделение между простым упоминанием, вторичной альтернативой и рекомендацией с аргументацией используется и в разборе качества присутствия бренда в ответах нейросетей.

Основной единицей сравнения стал набор рассматриваемых брендов. В него входили CRM, которые система действительно предлагала рассмотреть.

Сначала я проверил разброс в контрольных прогонах

Если два одинаковых запроса сами по себе дают разные списки, нельзя любое последующее отличие считать эффектом контекста.

Поэтому сначала я измерил, насколько отличаются друг от друга три S0-прогона внутри каждой системы.

Для сравнения использовал коэффициент Жаккара.

J(A,B) = |A ∩ B| / |A ∪ B|

Если два набора совпадают полностью, коэффициент равен 1. Чем меньше общих брендов, тем ближе значение к нулю.

В трёх контрольных прогонах средний Jaccard у Perplexity составил 0,905, у ChatGPT — 0,827, у Алисы AI — 0,667. Уже здесь видно, почему одного ответа недостаточно для оценки видимости. Даже при неизменном запросе состав брендов может меняться.

У ChatGPT в контрольный набор вошли семь CRM, которые появились минимум в 2 из 3 прогонов. Первым во всех 3 случаях был Битрикс24.

У Perplexity устойчивый набор тоже состоял из 7 брендов, а первым трижды был amoCRM.

У Алисы набор оказался шире, а первая позиция менялась.

Дальше я сравнивал контекстные результаты не с одним случайным ответом, а с обычным разбросом внутри той же системы.

Как изменился набор CRM для небольшой B2B-компании

В S1 до финального вопроса система знала, что в отделе продаж восемь человек и компания не хочет сложного внедрения.

У ChatGPT среднее сходство контекстных наборов с контрольными составило 0,483. Для сравнения, между самими контрольными прогонами показатель был 0,827. Списки сократились до трёх-четырёх CRM. amoCRM, Битрикс24 и Мегаплан вошли во все 3 ответа.

У Perplexity среднее сходство с контролем составило 0,231, тогда как между контрольными прогонами было 0,905. В каждом S1-прогоне система оставляла четыре CRM. В среднем сохранялось два бренда из контрольного набора, пять исчезали и два новых появлялись.

У Алисы разница была меньше. Среднее сходство с контролем составило 0,509, а между контрольными прогонами — 0,667. Списки при этом оставались длиннее и включали семь-восемь вариантов.

Для каждого сценария я сравнивал все три набора со всеми тремя контрольными. Получалось девять пар, после чего рассчитывал средний Jaccard. Поэтому значения 0,483 и 0,231 получены не из одного выбранного сравнения, а из всех девяти пар.

У ChatGPT и Perplexity среднее сходство S1 с контролем оказалось заметно ниже, чем сходство контрольных запусков между собой.

Сам результат предсказуем. Система получила дополнительные требования и должна была учитывать их при выборе. Для AI Visibility важнее другое. Финальный коммерческий запрос остался прежним, а набор рассматриваемых брендов изменился.

Замер по независимым запросам такой эффект не учитывает.

Как изменился набор CRM при длинном цикле сделки

В S5 речь шла о B2B-услугах с циклом сделки в несколько месяцев. В процессе участвовали несколько сотрудников, было много звонков, писем и повторных контактов.

У ChatGPT среднее сходство с контролем составило 0,618, тогда как между контрольными прогонами было 0,827. ELMA365, amoCRM и Битрикс24 присутствовали во всех 3 ответах, BPMSoft и Мегаплан — в 2.

У Perplexity среднее сходство с контролем составило 0,586, а между контрольными прогонами — 0,905. Во всех 3 ответах появились 1С:CRM, ELMA365, amoCRM и Битрикс24. BPMSoft и Мегаплан вошли в 2 ответа из 3.

У Алисы показатель составил 0,455 против 0,667 в контроле. При этом список не сокращался. Система каждый раз оставляла 10 CRM. BPMSoft, ELMA365 и SimpleOne появлялись во всех 3 ответах, а BPMSoft трижды занимала первую позицию.

Разные вводные по-разному меняли состав рекомендаций. Но S1 и S5 все еще можно объяснить обычной персонализацией. Модель получила новые требования и перестроила выбор под них.

Поэтому для проверки самого протокола важнее оказался S9.

Что меняется после предварительного упоминания бренда

В S9 новых требований к CRM не было.

Сначала пользователь говорил:

Коллега недавно упоминал BPMSoft, но я пока ничего о ней не знаю.

Потом:

Хочу сначала посмотреть рынок шире.

После этого задавался тот же общий вопрос о CRM для компании в России.

Чтобы не выбрать удобный бренд уже после просмотра результатов, правило отбора было задано заранее. Сначала выполнялись все 9 контрольных прогонов. Бренд должен был встретиться минимум в 4 из 9 ответов, но не во всех 9. Если подходило несколько вариантов, выбирался первый по алфавиту.

Этим условиям соответствовали BPMSoft, ELMA365 и Мегаплан. Первой по алфавиту была BPMSoft.

После предварительного упоминания картина изменилась.

В ChatGPT BPMSoft входила в 2 из 3 контрольных наборов и в 3 из 3 наборов S9. Еще заметнее изменилась первая позиция. В контроле трижды первым был Битрикс24, а после упоминания BPMSoft трижды первой стала BPMSoft.

У Алисы частота BPMSoft выросла с 1/3 до 3/3, то есть на 66,7 процентного пункта.

У Perplexity роста по частоте быть не могло, потому что BPMSoft уже присутствовала во всех трех контрольных ответах.

В сумме по трем системам BPMSoft выросла с 6/9 до 9/9.

В одном из прогонов ChatGPT после первого упоминания сначала объяснил, что такое BPMSoft, а затем сам расширил разговор до рынка BPM/low-code. Когда в конце был задан общий вопрос о CRM, BPMSoft оказалась первым вариантом перед Битрикс24, ELMA365, 1С:CRM, amoCRM и другими продуктами.

3 повторов на систему недостаточно, чтобы говорить об устойчивом эффекте такого предварительного упоминания во всех случаях. Но в этом пилоте похожий сдвиг появился как минимум в двух системах. Объяснить его только новыми требованиями пользователя нельзя, потому что в S9 дополнительных требований к CRM не было.

Когда бренды называла сама система, результат был другим

В S11 проверялась похожая, но не такая же ситуация. Сначала нейросеть сама называла несколько CRM. Затем пользователь переводил разговор на принцип выбора и задавал тот же финальный вопрос.

Общего устойчивого эффекта здесь не получилось.

У ChatGPT продукты из первого ответа почти не возвращались в итоговый российский набор. У Perplexity и Алисы возврат был заметнее, но многие из этих брендов и без того часто появлялись в контроле.

Отдельные изменения были у YCLIENTS, МоегоСклада и SberCRM, однако одинакового роста хотя бы в двух системах пилот не показал.

Поэтому S11 я не использую как подтверждение основной версии.

Если считать доказательством любой повтор бренда после его появления выше по диалогу, исследование быстро превратится в поиск удобных примеров.

Изменение набора не говорит о качестве рекомендации

S1 и S5 можно объяснить довольно просто. Система получила больше условий и подстроила выбор под них.

Поэтому отдельно я проверил конкретные утверждения, которыми нейросети обосновывали выбор CRM. После объединения повторов осталось 33 утверждения и группы однотипных утверждений.

По официальным материалам производителей полностью подтвердились 15, еще 4 — частично. 8 подтвердить не удалось, а для 6 не нашлось достаточно оснований ни для подтверждения, ни для опровержения.

Лучше всего проверку проходили базовые свойства продуктов — функции CRM, коммуникационные возможности, BPM/low-code и варианты развертывания. С точными ценами, сроками запуска и общими оценками сложности внедрения расхождений было больше.

Из этого не следует, что контекст ухудшает рекомендации. Изменение набора брендов и качество его обоснования — разные вещи, поэтому проверять их нужно отдельно.

Что показывает замер по независимым запросам

После пилота у меня нет оснований отказываться от таких замеров. Они вполне могут отвечать на вопрос, как часто бренд появляется при заданном наборе независимых промптов в конкретной системе, режиме и в конкретный момент времени.

Но это более узкая задача. Она не показывает, насколько вероятно появление бренда среди рекомендаций после другого многошагового контекста.

В S1 среднее сходство с контролем у ChatGPT и Perplexity оказалось заметно ниже, чем сходство контрольных прогонов между собой. В S9 предварительное упоминание BPMSoft изменило частоту бренда как минимум в двух системах, а в ChatGPT изменилась ещё и первая позиция.

Поэтому AI Visibility по независимым запросам описывает результат конкретного протокола замера. Считать его универсальной вероятностью рекомендации бренда нельзя.

То же ограничение относится к Share of Voice, если показатель рассчитывается по независимым промптам. В этом случае результат тоже зависит от выбранного набора запросов и условий их запуска.

Для каких решений подходит такой отчет

Замер по независимым запросам остается полезным, если использовать его для той задачи, под которую он построен. С его помощью можно сравнивать, как часто бренд появляется при фиксированном наборе промптов в одной системе и одном режиме, а также отслеживать изменения при неизменном протоколе.

Но эту частоту нельзя автоматически считать вероятностью того, что бренд будет рекомендован после другого многошагового контекста. В пилоте один и тот же финальный запрос после разных историй разговора давал разные наборы CRM. В S9 изменился результат и после предварительного упоминания BPMSoft, хотя новых требований к CRM пользователь не добавлял.

Поэтому при разработке или заказе мониторинга я бы фиксировал не только список промптов, систему, режим и число повторов. Нужно также указывать, как ведется разговор. Каждый запрос задается в новом чате или после предыдущих реплик?

Если нужно отслеживать динамику видимости по одному и тому же набору независимых запросов, такой замер для этого подходит. Если по его результатам хотят судить о рекомендациях внутри многошагового диалога, этого уже недостаточно. Тогда нужна отдельная проверка, в которой предыдущие реплики становятся частью протокола.

Практический вывод здесь довольно узкий. AI Visibility не становится от этого неправильной метрикой. Но выводы по ней не должны выходить за пределы того, что действительно измерялось.

Что этот эксперимент пока не позволяет утверждать

Пилот небольшой. На каждую комбинацию системы и сценария пришлось по 3 повтора, а все прогоны были выполнены в один день (22.09.2026)

Технические условия тоже различались. В ChatGPT и Perplexity использовался веб-поиск. Для Алисы четко определить обращение к вебу не удалось. У Perplexity не фиксировалось точное время каждого запуска, а один из прогонов ChatGPT в S11 прошёл без веб-поиска.

Разметку Consideration и Recommendation я выполнял вручную по заранее заданным правилам. В отдельных случаях другой разметчик мог бы провести границу иначе.

Есть и более существенное ограничение. В S1 и S5 вместе с историей разговора менялись требования к CRM. Поэтому эти сценарии показывают чувствительность результата к накопленному контексту, но не позволяют отделить влияние многошагового диалога от влияния самих требований. Для этого нужен отдельный эксперимент, где один и тот же набор условий сначала задаётся целиком в одном промпте, а затем распределяется по нескольким репликам.

S9 ближе к проверке траектории разговора, поскольку новых требований к CRM там не добавлялось. Но и его нельзя считать чистым тестом влияния одного упоминания бренда. В промежуточных ответах система сама развивала тему BPMSoft, поэтому здесь проверялась вся последовательность диалога, а не только первая реплика пользователя.

Результаты относятся только к выбранным формулировкам, дате запуска, использованным режимам и одному предметному полю — CRM для компаний в России. Эксперимент не показывает, как часто реальные пользователи ведут многошаговые диалоги, не измеряет продажи, не раскрывает внутренние алгоритмы систем и не доказывает, что какой-либо сервис AI Visibility считает свои показатели неправильно.

Следующий эксперимент стоит строить строже. Потребуется больше повторов, фиксация версий и режимов, независимая двойная разметка и парное сравнение одинаковых требований в одном промпте и в многошаговом диалоге.

Замер по независимым запросам остается полезным для сопоставимого мониторинга, если протокол не меняется. Но переносить его результат на диалоги с предшествующей историей без отдельной проверки нельзя.

Этот пилот показал более узкую вещь. Набор брендов зависел и от финального вопроса, и от того, что происходило в разговоре до него. Насколько в этом эффекте важна именно многошаговость, а насколько содержание предыдущих реплик, должен показать следующий эксперимент.

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.