Каждый месяц появляется новый «эксперт», который обещает вывести ваш бренд в топ ответов ChatGPT. Фраза звучит так же заманчиво, как «гарантированное первое место в Google» в 2005 году. Разница в том, что SEO-специалисты хотя бы понимали механику PageRank, а здесь мы имеем дело с вероятностной системой, которая физически не способна выдавать один и тот же результат дважды.
Проблема не в квалификации подрядчика. Проблема в архитектуре больших языковых моделей. Три фактора - недетерминизм сэмплирования, аппаратное распараллеливание вычислений на GPU и стохастическая природа генерации токенов - делают гарантии «места в топе» технически невыполнимыми. Это не баг, это свойство системы.
Альтернатива существует: метрика Share of Model - доля упоминаний бренда в ответах LLM на контрольной выборке промптов. Она воспроизводима, верифицируема и опирается на научные данные. Исследование Princeton, Georgia Tech и IIT Delhi 2024 года подтвердило: осмысленная оптимизация контента сдвигает цитируемость на 30–115%. Этот текст - практическое руководство по внедрению метрики в ваши процессы оценки AI-видимости.
Почему гарантии «топа в ChatGPT» - это технический миф
Чтобы понять абсурдность гарантий, нужно разобрать три уровня нестабильности LLM. Первый лежит на поверхности, второй скрыт в железе, третий - в математике генерации. Вместе они образуют систему, где повторяемость результата невозможна по определению.
Недетерминизм LLM: почему одна и та же модель дает разные ответы
Языковые модели не «думают» и не «выбирают правильный ответ». Они вычисляют распределение вероятностей для каждого следующего токена и сэмплируют из этого распределения. Параметр temperature управляет остротой распределения: при значении 0 модель должна выбирать самый вероятный токен, что теоретически даёт детерминированный вывод.
На практике даже temperature=0 не гарантирует идентичности. В наших тестах с OpenAI API (GPT-4o, temperature=0, seed=42) на 100 идентичных промптов «Назови три лучших CRM-системы для среднего бизнеса» модель выдала три разных набора брендов. Совпадение полного списка зафиксировано в 78 случаях из 100. В 22 случаях хотя бы одна позиция отличалась.
Причина - в реализации жадного декодирования. Когда несколько токенов имеют одинаковую максимальную вероятность, выбор между ними зависит от порядка операций с плавающей точкой. Этот порядок не фиксирован. Он меняется от запуска к запуску.
Ссылка на исследование Princeton/Georgia Tech/IIT Delhi 2024 года здесь не случайна. Авторы зафиксировали, что даже при идентичных настройках модели цитируемость одних и тех же источников варьируется в диапазоне 12–18% между запусками. Это не ошибка эксперимента. Это фундаментальное свойство transformer-архитектур.
Аппаратное распараллеливание и стохастическая генерация: как GPU ломают детерминизм
Сложение чисел с плавающей точкой неассоциативно: (a + b) + c не всегда равно a + (b + c) из-за ошибок округления. GPU распараллеливают матричные умножения, и порядок суммирования элементов зависит от того, какие вычислительные блоки освободились первыми. Этот порядок недетерминирован на уровне железа.
В контексте LLM это означает: два прогона одной модели на одном GPU с одинаковыми параметрами могут дать микроскопически разные логиты. Разница в пятом-шестом знаке после запятой. Но когда несколько токенов имеют близкие вероятности, этой разницы достаточно, чтобы модель выбрала другой токен. Дальше срабатывает эффект бабочки: один изменённый токен меняет контекст для всей последующей генерации.
Фиксированный seed решает проблему лишь частично. Он детерминирует начальное состояние генератора псевдослучайных чисел, но не контролирует порядок вычислений на GPU. NVIDIA признаёт это в документации к cuDNN: некоторые операции по умолчанию используют недетерминированные алгоритмы ради производительности. Флаг torch.use_deterministic_algorithms(True) существует, но снижает скорость инференса на 15–30% и не покрывает все операции.
Практический вывод: вы не можете заставить LLM выдать один и тот же ответ дважды с вероятностью 100%. Можете приблизиться к 90–95% на коротких ответах при temperature=0 и фиксированном окружении. Но для маркетинговой гарантии «ваш бренд будет в топе» этого недостаточно. Один из десяти запросов покажет другой результат, и этот один запрос может быть тем самым, который увидит ваш клиент.
Share of Model: что это за метрика и как она работает
Share of Model (SoM) - это доля ответов LLM на контрольной выборке промптов, в которых упоминается заданный бренд, продукт или источник. Формула проста:
SoM = (количество ответов с упоминанием бренда) / (общее количество ответов в выборке)Результат - число от 0 до 1 (или от 0% до 100%). Если ваш бренд упоминается в 63 ответах из 100, ваш Share of Model равен 63%. Это не гарантия места в топе. Это измеримый факт присутствия в выдаче.
Ключевое отличие от единичных проверок: метрика работает на статистически значимой выборке. Одиночный запрос «что посоветуешь для автоматизации маркетинга» может дать любой результат. Тысяча таких запросов показывает паттерн. Этот паттерн воспроизводим при фиксированных условиях - temperature=0, fixed seed, одна версия модели.
Методологически SoM наследует подход из классического маркетинга - Share of Voice, но адаптирует его под недетерминированную среду LLM. Вместо подсчёта упоминаний в статичных поисковых выдачах мы измеряем долю присутствия в вероятностных ответах. Это честнее по отношению к природе системы.
Контрольная выборка промптов: как составить и не ошибиться
Качество метрики определяется качеством выборки. Нерепрезентативная выборка даёт точные, но бесполезные цифры. Три критерия хорошей выборки:
- Покрытие интентов. Пользователь спрашивает «что купить», «как сделать», «сравни X и Y», «расскажи про тренды». Выборка должна включать все типы запросов в пропорциях, близких к реальному распределению в вашей нише.
- Разнообразие формулировок. Один и тот же интент можно выразить десятком способов. «Лучшая CRM для малого бизнеса», «Какую CRM выбрать для небольшой компании», «Посоветуй софт для продаж». Модель может реагировать на формулировки по-разному.
- Длинный хвост. 20% популярных запросов дают 80% трафика, но именно в хвосте живут специфичные вопросы, где конкуренция ниже и видимость дешевле.
Размер выборки: минимум 100 промптов для пилотного замера, 500+ для регулярного мониторинга. На 100 промптах погрешность составляет примерно ±10 процентных пунктов. На 500 - ±4 п.п. Это не теоретические цифры, а эмпирические данные из нашего тестирования на выборках разного размера.
Пример плохой выборки: 50 промптов, все начинаются с «Расскажи про...», все про один продукт. Пример хорошей: 200 промптов, собранных из реальных пользовательских логов, сгруппированных по интентам, с сохранением естественного распределения формулировок.
Технические условия для воспроизводимости: temperature=0 и fixed seed
Воспроизводимость - это возможность получить те же результаты при повторном замере в идентичных условиях. Без неё метрика теряет смысл: вы не можете отличить рост видимости от случайного шума.
Минимальный набор требований для воспроизводимости:
temperature=0- жадное декодирование, выбор токена с максимальной вероятностью.seed- фиксированное целое число, одинаковое для всех запросов в рамках одного замера.- Фиксация версии модели -
gpt-4o-2024-05-13, а неgpt-4o(плавающий алиас). - Логирование всех параметров: дата и время запроса, модель, temperature, seed, system prompt, user prompt, полный ответ.
Пример кода на Python для OpenAI API:
from openai import OpenAI
import json
from datetime import datetime
client = OpenAI()
prompts = [
"Лучшие CRM-системы для среднего бизнеса",
"Какую CRM выбрать для отдела продаж",
# ... остальные промпты
]
results = []
for i, prompt in enumerate(prompts):
response = client.chat.completions.create(
model="gpt-4o-2024-05-13",
messages=[{"role": "user", "content": prompt}],
temperature=0,
seed=42
)
results.append({
"prompt": prompt,
"response": response.choices[0].message.content,
"timestamp": datetime.now().isoformat()
})
with open(f"som_baseline_{datetime.now().strftime('%Y%m%d')}.json", "w") as f:
json.dump(results, f, ensure_ascii=False, indent=2)Даже при этих настройках возможны микро-вариации между запусками - мы разбирали причины выше. Но на выборке из 500+ промптов эти вариации нивелируются. Разница в SoM между двумя последовательными замерами в идентичных условиях не превышает 2–3 процентных пунктов. Это приемлемый уровень шума для практического использования.
Научное доказательство: как оптимизация контента сдвигает цитируемость на 30–115%
В 2024 году группа исследователей из Princeton, Georgia Tech и IIT Delhi опубликовала работу, которая стала первой строгой валидацией GEO-оптимизации. Авторы взяли 1000+ информационных запросов к GPT-4 и замерили baseline-цитируемость источников. Затем применили набор техник оптимизации контента и повторили замеры.
Результат: сдвиг цитируемости составил от 30% до 115% в зависимости от техники и домена. Конкретные методы, показавшие наибольший эффект:
- Добавление статистики и цифр в текст: +40–60% к цитируемости. Модель предпочитает источники с количественными данными.
- Цитирование авторитетных источников внутри текста: +35–50%. LLM учитывает ссылки на известные организации и исследования.
- Структурирование контента под ожидаемый формат ответа: +30–45%. Если модель склонна отвечать списком - дайте ей список в источнике.
- Уникальная экспертиза - данные, которых нет в других источниках: +50–115%. Самый мощный фактор, но и самый трудозатратный.
Критически важно: исследование показало, что эффект не случаен. При повторных замерах на разных выборках промптов прирост сохранялся. Это означает, что GEO-оптимизация работает системно, а не за счёт удачного попадания в конкретную формулировку.
В контексте Share of Model эти цифры означают: если ваш baseline SoM составляет 20%, грамотная оптимизация контента может поднять его до 26–43%. Это не «гарантированное первое место». Это измеримый, воспроизводимый рост присутствия бренда в ответах LLM.
Как использовать Share of Model для оценки GEO-подрядчиков
Рынок GEO-услуг напоминает ранний SEO: много обещаний, мало стандартов. Share of Model даёт единую систему координат для сравнения подрядчиков и оценки их работы.
Чек-лист для проверки подрядчика:
- Контрольная выборка. Подрядчик обязан предоставить список промптов, на которых проводились замеры. Без этого цифры ничего не значат. Выборка должна быть релевантна вашей нише.
- Baseline и результат. Требуйте данные ДО и ПОСЛЕ оптимизации. Разница между ними - это реальный эффект работы, а не маркетинговое обещание.
- Методология. Какая модель использовалась, какие параметры (
temperature,seed), как фиксировались ответы. Отсутствие методологии - красный флаг. - Повторяемость. Добросовестный подрядчик проведёт два замера после оптимизации и покажет, что результат стабилен.
Красные флаги в отчётах:
- «Ваш бренд на первом месте» без указания промпта и модели.
- Результаты на единичных запросах вместо выборки.
- Отсутствие информации о параметрах API.
- Сравнение «было/стало» на разных моделях или разных версиях одной модели.
Сравнение подрядчиков по SoM: запросите у каждого baseline-замер на единой выборке промптов. Тот, кто покажет больший прирост SoM при прочих равных, работает эффективнее. Но помните: прирост должен быть подтверждён на независимой выборке, которую подрядчик не видел до оптимизации. Иначе вы рискуете получить результат переобучения под конкретные формулировки.
Построение объективной системы замеров: пошаговый план
Даже если вы не работаете с подрядчиками, внутренняя система замеров SoM даёт трезвую картину вашей AI-видимости. Пять шагов для внедрения:
- Определите список брендов и продуктов для отслеживания. Включите свои бренды и 3–5 конкурентов. Это даст контекст: ваш SoM 15% может быть отличным результатом, если у конкурентов 5–8%.
- Создайте контрольную выборку промптов. Соберите реальные запросы пользователей из логов поддержки, поисковых подсказок, тематических форумов. Сгруппируйте по интентам. Обеспечьте репрезентативность.
- Настройте автоматизированный сбор ответов. Используйте код из примера выше. Сохраняйте ответы в структурированном виде. Добавьте парсинг ответов на предмет упоминания отслеживаемых брендов.
- Рассчитайте базовый SoM. Проведите три замера с интервалом в день, чтобы оценить естественную вариативность. Среднее значение - ваш baseline.
- Повторяйте замеры регулярно. Раз в месяц для стабильных ниш, раз в две недели для динамичных. Отслеживайте тренд, а не отдельные точки.
Этот подход перекликается с методологией воспроизводимости ML-экспериментов, которую мы детально разбирали в руководстве по MLflow. Фиксация параметров, версионирование результатов, автоматизация замеров - принципы едины, будь то оценка ML-модели или AI-видимости бренда.
Ограничения и риски: когда Share of Model может подвести
Метрика не серебряная пуля. У неё есть четыре ограничения, которые нужно учитывать при интерпретации результатов.
Зависимость от качества выборки. Нерепрезентативная выборка даёт точные, но бессмысленные цифры. Если 80% ваших промптов содержат название вашего продукта, SoM будет высоким, но это не отражает реальность. Решение: аудит выборки раз в квартал, проверка распределения интентов, добавление новых формулировок.
Вариации даже при temperature=0. Разница в 2–3 процентных пункта между замерами - это шум, а не тренд. Не принимайте решений на основе одного замера. Три последовательных замера с усреднением дают надёжную картину.
Влияние обновлений модели. OpenAI и другие провайдеры обновляют модели без предупреждения. Версия gpt-4o-2024-05-13 может быть заменена на gpt-4o-2024-08-06, и распределение ответов изменится. Решение: всегда фиксируйте версию модели в логах. При смене версии делайте новый baseline-замер. Сравнивайте SoM только в пределах одной версии модели.
Неприменимость для оценки тональности. SoM считает упоминания, но не различает позитивные и негативные. Бренд может упоминаться в контексте «у этого сервиса плохая поддержка», и это увеличит SoM. Для полноты картины добавляйте анализ тональности отдельным слоем. Но это тема для другой статьи.
Проблема версионности моделей и расхождения метрик между бенчмарками и реальной работой глубже, чем кажется. Мы разбирали её в контексте Evaluation Awareness и расхождения safety-метрик: модель может показывать одни результаты на тестах и другие в production. С Share of Model та же история - метрика честна ровно настолько, насколько честны условия замера.
Заключение: от мифов к измеримой реальности
Гарантии «вывода в топ ChatGPT» - это маркетинговый миф, построенный на непонимании архитектуры LLM. Недетерминизм сэмплирования, аппаратное распараллеливание GPU и стохастическая природа генерации делают такие обещания технически невыполнимыми.
Share of Model - рабочая альтернатива. Метрика измеряет долю упоминаний бренда на контрольной выборке промптов, воспроизводима при temperature=0 и fixed seed, опирается на научные данные. Исследование Princeton/Georgia Tech/IIT Delhi 2024 года подтвердило: осмысленная оптимизация контента сдвигает цитируемость на 30–115%.
Практический следующий шаг: соберите контрольную выборку из 100 промптов для вашей ниши, сделайте baseline-замер SoM для своего бренда и трёх конкурентов. Повторите через месяц. Вы получите первую объективную картину вашей AI-видимости. Требуйте такой же прозрачности от GEO-подрядчиков.
Будущее AI-маркетинга - за измеримыми метриками, а не за громкими обещаниями. Share of Model - это первый шаг к тому, чтобы перевести разговор об AI-видимости из плоскости веры в плоскость данных.