Что утечка кода Яндекса рассказала о поведенческих факторах
27 января 2023 года в сеть попал репозиторий с исходным кодом Яндекса — его выложил бывший сотрудник. Внутри нашёлся файл со списком факторов ранжирования. О поведенческих спорили годами, а тут впервые появился документ, в который можно ткнуть пальцем. Разбираем, что в нём было на самом деле.
Факторов 1 922, но работает меньшинство
В первом файле, который разобрали SEO-специалисты, — 1 922 фактора ранжирования. Цифра разошлась по заголовкам, но важнее другое: больше 64% факторов помечены как устаревшие или неиспользуемые. По подсчёту Sistrix, активных на момент утечки было 417.
Позже в других файлах репозитория нашли ещё около 17 800 факторов. Поэтому «у Яндекса тысячи факторов» — правда. А вот «все они влияют на позиции» — нет: большая часть списка — история разработки, а не работающий алгоритм.
Поведенческие — не теория
Главный спор последних лет — учитывает ли поиск поведение пользователей — для Яндекса закрыт. В коде прямо описаны сигналы поведения: CTR в выдаче, время на сайте, показатель отказов и возвраты к результатам поиска.
Есть и более тонкие вещи. Один из факторов описывает долю кликов: сколько кликов по запросу досталось вашему URL относительно всех кликов в выдаче, причём с поправкой на регион. Время пребывания упоминается в 102 факторах, из них действующих — 39: остальные помечены как устаревшие. То есть Яндекс смотрит не на один «таймер», а на десятки срезов: устройство, длительность визита, средние значения по странице.
Важен не клик, а то, что было после
Если сложить эти факторы вместе, получится описание сценария, а не одного действия. Кликнули — остались или вернулись в выдачу? Сколько пробыли? Пришли ли снова? Сайт, с которого уходят искать дальше, получает сигнал против себя.
Сниппет, скорость загрузки и первый экран влияют на позиции не сами по себе, а через поведение людей, которые на них реагируют.
Отсюда практический вывод: бессмысленно «оптимизировать время на сайте» отдельно от того, что человек на сайте видит. Поиск измеряет результат встречи пользователя со страницей, и улучшать нужно саму встречу.
Это слепок, а не инструкция
Список факторов актуален примерно на июль 2022 года. Весов в файле нет: неизвестно, какой фактор значит много, а какой — почти ничего. В коде хватает наследия MatrixNet — алгоритма 2009 года, хотя с 2017-го Яндекс работает на CatBoost.
Это фотография одного дня, а не схема алгоритма. Любой, кто после утечки «знает формулу Яндекса», знает только названия переменных.
Обратная сторона
Раз поведение — фактор, его пытаются подделывать. Позиция Яндекса записана в справке Вебмастера: имитация действий пользователей — это поисковый спам. Туда входят и программы, и задания вида «введи запрос и перейди на сайт», и услуги по искусственному увеличению посещений из поиска.
Следствие — ограничения в ранжировании всего сайта или его разделов. Снимаются они не по заявке, а когда нарушение устранено и алгоритмы убедились, что оно не повторяется.
Поэтому честный разговор о поведенческих всегда включает риски. Как и в каком объёме работать с кликами, решает специалист — и отвечает за это решение перед клиентом тоже он.
Что с этим делать
- Смотрите в Метрике не только позиции, но и время, отказы и возвраты именно по поисковому трафику, а не по сайту в целом.
- Чините первый экран и скорость раньше, чем наращиваете трафик: плохое поведение реальных людей ничем не перекрыть.
- Проверяйте сниппеты по главным запросам: клик начинается в выдаче, а не на сайте.
- Не верьте тем, кто «знает веса факторов». Их не знает никто за пределами Яндекса.


