Как выбрать нужные 50 000 запросов из миллионов: скоринг семантики по вкладу в деньги
2-уровневая формула (6 компонентов на запрос + 6 на URL) · 36 настраиваемых фильтров · пересборка приоритетов под другую бизнес-модель за один клик
Проблема
Классический путь «запрос → кластеризация» не работал на масштабе книжного каталога
Простые подходы ломались один за другим: сортировка по частотности вытягивала наверх информационный шум и гео-запросы; сырые метрики (доход в рублях, клики в штуках, частотность в показах) были физически несопоставимы; один и тот же запрос вёл сразу на несколько URL, и семантика дублировалась; отдельные супер-хиты ломали любую линейную шкалу приоритизации.
При этом нужно было держать в фокусе сразу несколько типов ценности одновременно: трафик, который конвертируется в разовые покупки (PPD), трафик в подписку, новых и уже знакомых с продуктом пользователей.
Отошли от логики «запрос → кластеризация» и пошли от обратного — «страница → запрос». Стало ясно, что нужна не сортировка, а композитная модель с нормировкой: каждая метрика переводится через логарифм в процентильный ранг (0..1), а веса компонентов должны настраиваться под задачу, а не быть зашиты в код.
Поиск решения
Решение
Двухуровневая формула. Score запроса — 6 компонентов (широкая и точная частотность, спрос по товарной вертикали, клики органики, число слов во фразе), с бонусом за подтверждение несколькими источниками и понижающими множителями для вопросных и гео-запросов. Score URL — 6 компонентов: вклад лучших запросов с затуханием по рангу, доход, собственный трафик и три раздельные цели (покупки, подписка, абонемент). Вокруг формулы — контур управления: веса-ползунки с автобалансировкой и живым превью без пересчёта; семантический фильтр по Левенштейну для расчёта только по нужной теме; 36 жёстких фильтров (23 по запросу, 13 по URL); бюджет отчёта распределяется по типам страниц автоматически, с ручными исключениями под специфику раздела; умное закрепление запроса за URL — вручную заданные правила плюс автоматический словарь сущностей.

Результат и что это дало бизнесу
Инструмент даёт ранжированный пул запросов под любой лимит (например, 50 000 строк) с гарантированной квотой приоритетных типов страниц. Одним движением ползунка отчёт пересобирается «под подписку» или «под разовые покупки» — без пересборки данных с нуля.

Семантическое ядро отражает реальные деньги и трафик, а не частотности. Приоритеты можно развернуть под смену продуктового фокуса за час, а не за недели ручной перекластеризации. Снапшот настроек в каждом запуске даёт воспроизводимость: любое решение можно повторить и сравнить «до/после».
Made on
Tilda