Кто ворует трафик друг у друга: контроль каннибализации листингов
Метрики: аудит каталога за один запуск вместо дней ручного сравнения · 3 уровня анализа (листинг / раздел сайта / товар) · раздельные пулы «книги / аудиокниги»
Проблема
На книжном каталоге с тысячами жанровых подборок и тегов одни и те же товары регулярно попадали на первую страницу сразу нескольких листингов
Это создавало две проблемы одновременно: часть товаров теряла во внутреннем весе, потому что не получала уникального размещения, а сами листинги каннибализировали друг друга — поисковик не мог понять, какую из двух почти идентичных страниц ранжировать выше.
Найти такие пересечения можно было только вручную — открыть десятки листингов и сравнить состав. На каталоге такого масштаба это часы работы, которую физически невозможно делать регулярно.
Первая версия метрики — «глобальная уникальность»: доля товаров листинга, которых нет ни в одном другом листинге выборки. Метрика оказалась бесполезной: она показывала факт «товар есть где-то ещё», но не показывала ни степень дублирования, ни то, с каким конкретно листингом идёт пересечение. Для решения проблемы нужно было не число, а причина — с кем именно «расклеивать» страницу.
Поиск решения
Решение
Построили pairwise-расчёт: для каждого листинга берётся максимальное пересечение товаров с любым другим листингом сайта, уникальность = 100% минус этот максимум. Вместе с процентом инструмент сразу показывает конкретный листинг-дубль. Запуск — вставить список URL и нажать «Запустить анализ»; настройки (CSS-селекторы, потоки, ретраи) фиксируются снапшотом. Отчёт из трёх срезов: по листингам (топ худших/лучших, экспорт CSV), по разделам сайта (уникальность внутри раздела, чтобы ловить деградацию конкретного слага), по товарам (метрика видимости — кто переэкспонирован, а кто не получает веса вообще).
Результат и что это дало бизнесу
Разовые догадки превратились в регулярный управляемый процесс: понятно, какие листинги «расклеивать» в первую очередь, какие разделы сайта деградируют как система, какие товары нужно перераспределить.

Меньше каннибализации → равномернее распределение внутреннего веса → больше товаров и листингов реально получают трафик. Решения по приоритизации разбора теперь принимаются на данных, а не на ощущениях.
Made on
Tilda