Цифрам о «видимости в нейросетях» легко нарисовать любую картину: спросить модель один раз, поймать удачный ответ и показать его в отчёте. Мы так не делаем. На этой странице — как именно Брендометр измеряет, что нейросети отвечают о брендах, почему мы считаем частоты, а не «позиции», и что мы принципиально не обещаем.

Один запрос к нейросети ничего не доказывает

Языковая модель генерирует текст вероятностно: на каждом шаге она выбирает следующее слово из распределения, а не воспроизводит заранее готовый ответ. Поэтому на один и тот же вопрос, заданный в одинаковых условиях, модель даёт разные ответы. Сегодня она назовёт ваш бренд, завтра — трёх конкурентов без вас, и оба ответа для неё «правильные».

Единичная проверка — это одна случайная реализация из распределения ответов. Делать по ней выводы — всё равно что оценивать честность монеты по одному броску. Любой сервис, который показывает «позицию бренда в ChatGPT» по одному запросу, показывает шум.

Серии независимых прогонов в чистых сессиях

Вместо единичного запроса мы выполняем серию прогонов: каждый промпт задаётся каждому движку несколько раз. Каждый прогон — независимое наблюдение, и для этого он выполняется в «чистой» сессии:

  • новый диалог без истории — предыдущие ответы не влияют на следующие;
  • без персонализации, памяти и профиля пользователя — модель не «подыгрывает» тому, кто спрашивает;
  • одинаковые формулировки промптов и настройки от замера к замеру — иначе динамику недель нельзя сравнивать между собой.

Это сознательное упрощение: реальные пользователи видят персонализированные ответы, и их мы воспроизвести не можем. Чистая сессия — это воспроизводимая «базовая линия», общая для всех: то, что модель отвечает по умолчанию, без знания о конкретном человеке.

Частоты вместо «позиций»

В ответе нейросети нет позиций в привычном смысле SEO: бренд либо попал в сгенерированный текст, либо нет, и от прогона к прогону это меняется. Поэтому наша основная метрика — частота: в какой доле ответов серии бренд упоминается и в какой доле — явно рекомендуется. «Бренд упоминается в 60% ответов на этот вопрос в ChatGPT» — осмысленное и проверяемое утверждение; «бренд на 2-м месте в ChatGPT» — нет.

95%-е доверительные интервалы Вилсона

Частота, посчитанная по небольшой серии, сама подвержена случайности: 6 упоминаний из 10 прогонов — это не ровно «60%». Поэтому каждую долю мы сопровождаем 95%-м доверительным интервалом, рассчитанным по методу Вилсона. Для 6 из 10 интервал составит примерно от 31% до 83%: истинная частота с высокой вероятностью лежит в этом диапазоне.

Метод Вилсона выбран не случайно: в отличие от «наивного» нормального приближения он корректно ведёт себя на малых сериях и на долях около 0% и 100% — а это типичные для мониторинга брендов ситуации (бренд, который почти никогда или почти всегда попадает в ответ).

Практическое следствие: рост доли с 40% до 50% при перекрывающихся интервалах — ещё не рост, а шум. Мы показываем интервалы именно затем, чтобы вы не принимали решения по случайным колебаниям.

«Рекомендован» — не то же самое, что «упомянут»

«Модель назвала бренд» и «модель посоветовала бренд» — разные события с разной ценностью. Упоминание «для полноты списка», нейтральное перечисление и явная рекомендация («я бы выбрал X, потому что…») по-разному влияют на решение пользователя. Простой поиск названия бренда по тексту эти случаи не различает — а заодно спотыкается о склонения, латиницу/кириллицу и упоминания «тёзок».

Поэтому каждый ответ размечает отдельная LLM-классификация: упомянут ли бренд вообще, рекомендован ли он явно, в какой тональности о нём говорится и какие конкуренты названы рядом. Классификатор тоже модель и тоже может ошибаться — поэтому любую разметку можно проверить по сырому тексту ответа (см. ниже) и мы регулярно выборочно контролируем качество разметки вручную.

Фиксация модели каждого движка

«ChatGPT» или «Алиса» — это не одна модель, а витрина, за которой модели регулярно меняются. Смена модели способна изменить метрики скачком без каких-либо действий с вашей стороны. Поэтому для каждого ответа мы сохраняем движок и конкретную версию модели, которая его сгенерировала, а на графиках динамики отмечаем маркеры смены моделей. Если доля упоминаний резко выросла в день обновления модели — это заслуга обновления, а не последней публикации, и мы не даём перепутать одно с другим.

Полные сырые ответы как доказательство

Каждая цифра в Брендометре разворачивается до первичных данных: мы храним полный текст каждого ответа вместе с датой, движком, версией модели и процитированными источниками. Любую долю, тональность или упоминание конкурента можно проверить, открыв конкретные ответы, из которых она посчитана. Агрегатам без первичных данных верить не нужно — в том числе нашим.

Что мы принципиально не обещаем

Ответы нейросетей нельзя контролировать напрямую. Поэтому мы не обещаем и никогда не будем обещать:

  • «Поднять позиции в ChatGPT» — позиций там нет, а гарантировать попадание бренда в вероятностно генерируемый текст невозможно. Тот, кто гарантирует, — лукавит;
  • «вписать бренд в ответы» — ни у кого нет доступа «внутрь» чужих моделей;
  • мгновенный эффект — изменения в источниках доходят до ответов с задержкой от дней до месяцев, в зависимости от движка.

Что мы делаем: честно измеряем текущее состояние, показываем источники, на которые опираются модели, и фиксируем динамику после ваших действий — так, чтобы отличить реальный эффект от шума и от смены модели. Влиять на видимость можно только опосредованно, через источники, и результат всегда вероятностный.

Ограничения методологии

Чтобы картина была полной, о границах применимости — прямо:

  • мы измеряем ответы на ваш набор промптов — это выборка, а не все формулировки, которыми спрашивают реальные пользователи;
  • чистые сессии не учитывают персонализацию: конкретному пользователю модель может отвечать иначе;
  • частоты по серии прогонов — статистическая оценка с интервалом, а не «перепись» всех ответов движка.

Мы считаем, что честные цифры с оговорками полезнее красивых без них. Если у вас есть вопросы к методологии — напишите на support@brandometer.ru, обсудим детали.