Как проверять гипотезы в AI-поиске: эксперимент, сравнение, оценка эффекта
Ответ нейросети меняется от запуска к запуску, даже если на сайте ничего не поменялось. Разбираем, как поставить проверку так, чтобы отличить эффект правки от обычного разброса, и какой минимальный набор замеров для этого нужен.
С видимостью в нейросетях есть неприятная особенность: задайте один и тот же вопрос дважды — получите два разных ответа. Иногда с разным набором упомянутых компаний.
Из-за этого обычная проверка «поправили страницу — спросили ассистента — стало лучше» ничего не доказывает. Ответ мог измениться сам.
Ниже — как ставить проверку, чтобы её результату можно было верить.
Единица измерения — один промпт в одной системе
Не «видимость бренда» и не «позиции в нейросетях». Наблюдаемая величина выглядит так: конкретная формулировка вопроса, заданная конкретному ассистенту, в конкретных условиях.
Меняете формулировку — это другое наблюдение. Меняете ассистента — тоже. Складывать их в одно среднее нельзя: у разных систем разные индексы и разные правила отбора источников.
Поэтому первый шаг любой проверки — зафиксировать список промптов письменно и больше его не трогать до конца эксперимента.
Что создаёт разброс
Прежде чем измерять эффект, надо понимать, с каким шумом вы имеете дело.
Сама генерация. Модель вероятностная: при одинаковом входе ответы отличаются. Это базовый разброс, он есть всегда.
Платформа. Индекс обновляется, правила отбора источников меняются, модель под тем же названием может быть обновлена без объявления. Замер месячной давности сравним с сегодняшним только с оговорками.
Информационный фон. Появилась статья о вашей отрасли на крупной площадке — состав источников поменялся, и ваша правка тут ни при чём.
Настройки запроса. Включённый веб-поиск, регион, язык, история диалога — всё это меняет задачу. Один параметр незаметно поменяли — эксперимент недействителен.
Гипотеза формулируется до замера
Гипотеза должна связывать конкретное изменение с конкретным наблюдением. Формат такой:
Если на странице услуги указать цену и срок числом в первом экране, то в ответах на промпты группы «сколько стоит…» доля ответов с упоминанием нашего домена вырастет.
Здесь есть всё нужное: что меняем, где смотрим, что считаем результатом. Формулировка «улучшим контент — вырастет видимость» гипотезой не является, потому что её нельзя опровергнуть.
Главную метрику выбирайте по задаче:
| Задача | Что считать |
|---|---|
| Нас вообще не упоминают | доля ответов с упоминанием бренда |
| Упоминают, но без ссылки | доля ответов со ссылкой на наш домен |
| Ссылаются, но врут | доля ответов, где факты о нас верны |
| Ссылаются не на ту страницу | доля ответов с нужной посадочной |
Шесть шагов
- Зафиксируйте промпты. 15–30 формулировок под один сценарий, записанных дословно.
- Зафиксируйте условия. Ассистент, регион, язык, включён ли веб-поиск, новый чат на каждый запрос.
- Сделайте базовый замер. Каждый промпт прогоняется несколько раз — минимум три, лучше пять. Записывается не впечатление, а факт: упомянуты, со ссылкой, факты верны.
- Внесите одно изменение. Одно. Если поменять текст, разметку и внешние публикации разом, вы не узнаете, что сработало.
- Выждите. Индексы обновляются не мгновенно; неделя-две — разумный минимум.
- Повторите замер в тех же условиях и сравните доли, а не отдельные ответы.
Как отличить эффект от шума
Простое правило: если в базовом замере вас упоминали в 2 ответах из 15, а после правки — в 4 из 15, это скорее шум. Если было 2 из 15, а стало 11 из 15 — это уже похоже на эффект.
Уверенность растёт от повторяемости. Тот же результат на втором замере через неделю убеждает сильнее, чем однократный скачок. И наоборот: эффект, который исчез при перепроверке, эффектом не был.
Полезная страховка — контрольная группа: возьмите похожую страницу, которую вы не трогали, и замеряйте её теми же промптами. Если выросли обе, дело было не в вашей правке.
Что писать в отчёте
Отчёт должен позволить повторить проверку через полгода. Минимум:
- дата, ассистент и версия, регион, настройки;
- список промптов дословно;
- что именно изменили и на каких страницах;
- числа до и после — по каждому промпту, а не только итог;
- вывод и следующий шаг.
Отчёт без списка промптов и условий бесполезен: его нельзя перепроверить, а значит, нельзя и опереться на него при следующем решении.
Когда за это браться
Честно: если на сайте расходятся цены, нет мобильной версии или не настроена аналитика — эксперименты с видимостью в нейросетях преждевременны. Сначала должно быть что показывать.
Смежные материалы: «Сайт в эпоху AI-поиска» и «AI-агенты приходят на сайт».
Оригинал опубликован на verstalabs.ru.
Подпишитесь на ВЕРСТУ
Разборы, приёмы и цифры из практики студии — коротко и по делу, без рассылок ради рассылок.