Семантический поиск: как BERT и YATI понимают смысл запроса

Ещё десять лет назад поиск был во многом механическим: система искала на страницах те же слова, что ввёл пользователь, и чем больше совпадений — тем выше позиция. Отсюда родились килограммы «SEO-текстов», где ключ «купить пластиковые окна недорого Москва» встречался восемнадцать раз на 2000 знаков. Сегодня такой текст не просто не работает — он вредит. Причина в том, что и Google, и Яндекс перешли на семантический поиск: они пытаются понять не буквы запроса, а его смысл, интент и контекст. Технологической основой этого перехода стали трансформерные нейросети — BERT у Google и YATI у Яндекса. Я занимаюсь продвижением с 2003 года и на своих проектах видел этот сдвиг вживую: тексты, написанные «для роботов», начали проседать, а страницы, отвечающие на реальный вопрос человека, — расти. В этой статье разберу, как устроен семантический поиск изнутри, что реально понимают BERT и YATI, и, главное, что с этим делать практикующему оптимизатору.

Что такое семантический поиск и чем он отличается от старого

Старый поиск работал на модели «мешка слов» (bag of words). Документ представлялся как набор терминов с весами по формуле TF-IDF: чем чаще слово встречается на странице и чем реже оно во всём интернете, тем выше его вес. Плюс сигналы ссылок (PageRank) и поведения. Смысла в этой модели не было вообще — только статистика совпадений строк.

Семантический поиск решает принципиально другую задачу: понять, что человек имел в виду, и найти документы, которые отвечают на этот смысл, даже если в них нет ни одного слова из запроса. Классический пример: по запросу «чем занять ребёнка в дождь» релевантна страница «настольные игры для дома», хотя пересечения слов почти нулевые. Раньше такую страницу поиск бы не показал. Сейчас показывает — потому что понимает, что «занять ребёнка в дождь» и «домашние игры» лежат близко в смысловом пространстве.

Ключевых отличий семантического поиска три. Во-первых, он учитывает контекст слова: «ключ» в запросе «гаечный ключ» и «ключ от квартиры» — это разные сущности. Во-вторых, он понимает синонимию и перефразирование без ручных словарей. В-третьих, он анализирует запрос целиком, а не по отдельным словам, поэтому корректно обрабатывает предлоги, отрицания и порядок слов. Именно поэтому подход к текстам сменился: теперь важно полно и естественно раскрыть тему, а не набить вхождения. Об этом я подробно писал в материале про то, как написать SEO-текст для людей и поисковиков.

Эмбеддинги: как машина превращает смысл в числа

Чтобы сравнивать смыслы, компьютеру нужно перевести слова и тексты в понятный ему формат — числа. Этим занимаются эмбеддинги (embeddings) — векторные представления. Каждое слово, фраза или целый документ превращается в вектор из сотен чисел, координату в многомерном смысловом пространстве. Похожие по смыслу объекты оказываются близко, далёкие — далеко.

Красота эмбеддингов в том, что в этом пространстве работает арифметика смыслов. Классический пример из ранних моделей вроде word2vec: вектор «король» минус «мужчина» плюс «женщина» даёт вектор, ближайший к «королева». Модель нигде не выучила это правило явно — оно возникло из статистики совместной встречаемости слов в миллиардах текстов. Близость двух векторов измеряют косинусным расстоянием: чем меньше угол между ними, тем ближе смысл.

Но у ранних эмбеддингов был фундаментальный изъян: каждое слово имело один фиксированный вектор независимо от контекста. Слово «лук» получало усреднённое представление и овоща, и оружия, и элемента одежды — каша. Прорыв случился, когда появились контекстные эмбеддинги: вектор слова стал вычисляться заново для каждого предложения с учётом окружения. Именно это умеют трансформеры BERT и YATI, и именно поэтому они понимают смысл, а не просто набор слов.

Трансформеры и механизм внимания: сердце технологии

BERT и YATI построены на архитектуре трансформера, представленной Google в 2017 году в работе «Attention is All You Need». Главная идея — механизм внимания (self-attention). Когда модель обрабатывает слово, она смотрит на все остальные слова предложения и решает, какие из них важны для понимания именно этого слова прямо сейчас.

Разберу на примере. Предложение: «Банк реки был крутым». Слово «банк» многозначно, но механизм внимания видит рядом «реки» и «крутым» и подтягивает эти связи — вектор «банка» смещается в сторону «берега», а не финансовой организации. В предложении «Банк одобрил кредит» внимание зацепится за «одобрил» и «кредит», и тот же «банк» получит уже финансовый смысл. Одно слово — два разных вектора в зависимости от соседей. Это и есть контекстное понимание.

BERT читает предложение сразу в обе стороны — и слева направо, и справа налево (отсюда Bidirectional в названии). Обучали его хитро: закрывали случайные слова маской и заставляли модель угадать их по контексту, а также предсказывать, идёт ли одно предложение логически за другим. Прогнав через это триллионы слов, сеть выработала глубокое статистическое понимание языка. Google внедрил BERT в поиск в конце 2019 года, и он затронул каждый десятый запрос — в первую очередь длинные, разговорные и содержащие важные предлоги.

YATI: ответ Яндекса и его особенности

Яндекс представил YATI (Yet Another Transformer with Improvements) в ноябре 2020 года, назвав его крупнейшим изменением в поиске за десять лет. Архитектурно это тоже трансформер, но с рядом принципиальных отличий, важных для рунета.

Во-первых, YATI изначально заточен под русский язык с его богатой морфологией, свободным порядком слов и падежами. Это критично: английский BERT здесь работал бы хуже. Во-вторых — и это ключевое — YATI обучали предсказывать не текст, а поведение пользователей. Модель училась угадывать, на какой из показанных в выдаче документов человек кликнет и, что важнее, задержится ли он там (долгий клик — сигнал, что ответ найден). То есть YATI связывает смысл запроса, смысл документа и реальную удовлетворённость людей. Поэтому в Яндексе так важны поведенческие факторы — они буквально вшиты в модель ранжирования.

YATI не смотрит на весь документ целиком (это вычислительно неподъёмно на масштабе), а работает с наиболее релевантными фрагментами — заголовками, стримами текста, ключевыми пассажами. Практический вывод: смысл должен быть сконцентрирован и считываться из значимых зон страницы, а не размазан. Ту же логику развивают более свежие нейросетевые модели — я разбирал это в статьях про нейросети в SEO и про AI-поиск в Яндексе и Google.

BERT против YATI: сравнение подходов

Обе модели решают одну задачу — понять смысл, но акценты у них разные. Сведу главное в таблицу.

Параметр BERT (Google) YATI (Яндекс)
Год внедрения в поиск 2019 2020
Базовая архитектура Трансформер, двунаправленный Трансформер с доработками
Основная задача обучения Предсказание замаскированных слов Предсказание кликов и удовлетворённости
Язык-приоритет Английский (затем многоязычие) Русский и языки рунета
Роль поведения пользователей Косвенная, отдельные сигналы Прямая, вшита в обучение
Что сильнее ловит Смысл длинных разговорных запросов Связку «смысл ↔ реальная польза»

Вывод для практика простой: под Google важнее полнота и точность ответа на смысл запроса, под Яндекс — ещё и то, чтобы страница реально удерживала пользователя и решала его задачу. Оба требования сходятся в одной точке — качественном, релевантном контенте.

Интент запроса: что на самом деле хочет пользователь

Семантический поиск невозможен без понимания интента — намерения за запросом. Одна и та же формулировка может скрывать разные цели, и трансформеры научились их различать. Классическая типология интентов:

  • Информационный — «как понизить давление», «что такое эмбеддинг». Человек хочет знать.
  • Навигационный — «вход в госуслуги», «сбербанк онлайн». Хочет попасть на конкретный сайт.
  • Коммерческий (исследование) — «лучшие робот-пылесосы 2026», «сравнение тарифов». Выбирает перед покупкой.
  • Транзакционный — «купить iphone 16 128 гб», «заказать пиццу». Готов к действию.

Ошибка в определении интента убивает ранжирование вернее любых технических огрехов. Если по коммерческому запросу «пластиковые окна цена» вы даёте длинную энциклопедическую статью об истории ПВХ — вы промахнулись мимо намерения, и никакой семантический движок не поставит вас в топ, потому что люди уходят разочарованными. Прежде чем писать страницу, я всегда изучаю выдачу: какой тип страниц там уже в топе — карточки, каталоги, статьи, — это и есть ответ поиска о доминирующем интенте. Как правильно раскладывать запросы по смыслу и интенту, я показывал в гайде про кластеризацию семантического ядра, а базу — в материале о том, как составить семантическое ядро.

Как оптимизировать сайт под семантический поиск: пошагово

Теория без применения бесполезна, поэтому даю рабочий алгоритм, по которому я готовлю контент под смысловое ранжирование.

  1. Определите интент по выдаче. Вбейте главный запрос, посмотрите топ-10. Тип страниц-лидеров = формат, который вы должны сделать.
  2. Соберите смысловое поле, а не список ключей. Нужны не вхождения, а сущности и подтемы, которые раскрывают вопрос: термины, смежные понятия, типичные подвопросы. Это ядро LSI-копирайтинга.
  3. Закройте все подвопросы темы. Полнота раскрытия — прямой сигнал релевантности для трансформера. Соберите вопросы из блока «Ещё спрашивают», подсказок, форумов и ответьте на них в тексте.
  4. Структурируйте страницу. Логичные заголовки H1–H6, списки, таблицы. YATI работает с фрагментами — помогите ему увидеть смысл в заголовках и первых предложениях разделов.
  5. Пишите естественно. Синонимы, разные формулировки, живой язык. Модель понимает перефразирование — переспам вхождений теперь только вредит и может привести к фильтрам.
  6. Добавьте структурированные данные. Микроразметка Schema.org явно сообщает поиску тип сущностей на странице и помогает ему связать контент со смыслом запроса.
  7. Проверьте удовлетворённость. Особенно под Яндекс: удобство, скорость, отсутствие агрессивной рекламы. Если люди уходят — YATI это запомнит.

Частые ошибки при работе с семантикой

За годы аудитов я вижу одни и те же промахи. Собрал их с решениями в таблицу.

Ошибка Почему вредит Что делать
Переспам ключей Сигнал манипуляции, риск фильтра, плохая читаемость Писать для человека, синонимы, естественная плотность
Промах по интенту Страница не отвечает на намерение, люди уходят Формат под доминирующий интент выдачи
Узкое раскрытие темы Низкая полнота, слабая релевантность Закрыть все подвопросы и смежные сущности
Каннибализация Несколько страниц под один смысл конкурируют Свести в одну или разнести интенты
Игнор поведения YATI обучен на удовлетворённости Улучшать UX, скорость, глубину ответа
Тонкий контент Нечего анализировать модели, нет смысла Экспертная глубина, факты, примеры

Отдельно предостерегу от каннибализации ключевых слов: в семантическом мире две почти одинаковые по смыслу страницы не усиливают, а размывают друг друга — поиск не понимает, какую показать, и часто не показывает ни одну.

Чек-лист готовности страницы к семантическому ранжированию

Перед публикацией прогоняю каждую важную страницу по короткому списку:

  • Интент страницы совпадает с доминирующим интентом выдачи по запросу.
  • Формат (статья/каталог/карточка) соответствует топу.
  • Раскрыты все ключевые подвопросы темы, есть ответы на смежные вопросы.
  • Текст читается естественно, без роботных вхождений и «воды».
  • Логичная структура заголовков, есть списки и таблицы для сложных мест.
  • Первые предложения разделов несут смысл и содержат ключевые сущности.
  • Настроена микроразметка под тип контента.
  • Страница быстрая и удобная, есть внятная точка ответа/действия.
  • Нет конкурирующих по смыслу страниц-дублей внутри сайта.
  • Есть внутренняя перелинковка по смыслу, связывающая страницу с темой.

Если все пункты закрыты — вы говорите с BERT и YATI на одном языке. Дальше подключаются авторитетность и внешние сигналы, но фундамент смысла заложен.

Что дальше: от понимания к генерации

BERT и YATI научили поиск понимать смысл запроса. Следующий этап уже идёт — генеративные модели, которые не просто находят документы, а формируют готовый ответ прямо в выдаче: SGE у Google, нейро-ответы у Яндекса. Для оптимизатора это не революция, а логичное продолжение той же линии: чтобы вас процитировала генеративная модель, нужно быть источником чёткого, структурированного, фактурного ответа на смысл вопроса. То есть ровно то, что мы делаем под семантический поиск, только требования к экспертности и структуре растут. Кто научился писать под смысл сейчас — окажется готов и к генеративной выдаче.

Готовы перевести сайт со «слов» на «смысл»?

Семантический поиск не прощает старых приёмов, но щедро вознаграждает тех, кто действительно закрывает потребность пользователя. Если вы хотите, чтобы страницы ранжировались по смыслу, а не боролись за вхождения, начните с диагностики: закажите бесплатный SEO аудит сайта — я покажу, где контент промахивается мимо интента и не дораскрывает темы. Если нужен системный результат — можно заказать SEO продвижение под ключ, взять LSI-тексты на заказ, написанные под смысловое ранжирование, или обсудить стратегию на SEO консультации. Работаю с поиском с 2003 года и помогу вашему сайту говорить с BERT и YATI на одном языке.

Закажите SEO продвижение сайта

Выведем ваш сайт в ТОП Яндекса и Google. Бесплатная консультация — разберём сайт, найдём точки роста и предложим стратегию продвижения.

Оставить заявку Бесплатный SEO аудит
Аудит сайта

Comments

  • Дмитрий Соколов

    Отличное объяснение эмбеддингов, наконец-то понял, что значит ‘близость векторов’. А как вообще узнать, правильно ли поиск понял интент моей страницы? Есть какой-то способ проверить?

    • Анатолий Кузнецов

      Спасибо! Самый быстрый способ — вбить целевой запрос и посмотреть, страницы какого типа в топе. Если там каталоги, а у вас статья — интент не совпал. Плюс смотрите, по каким фразам страница уже собирает показы в Вебмастере: это подскажет, как её понял поиск. Если хотите, разберу вашу страницу в рамках бесплатного аудита.

  • Марина

    А правда, что теперь вообще можно не думать про ключевые слова, раз поиск понимает смысл? Или всё-таки вхождения нужны?

    • Анатолий Кузнецов

      Ключи никуда не делись, просто изменилась их роль. Вхождения нужны как ориентиры — покажите главные сущности темы в заголовках и тексте. Но набивать частотность больше нельзя, это вредит. Задача — полно раскрыть смысл естественным языком, и ключи впишутся сами.

  • Игорь Пехов

    YATI обучали на кликах — значит, поведенческие можно накрутить и вылезти в топ? Знаю сервисы, которые это предлагают.

    • Анатолий Кузнецов

      Технически поведение — сигнал, но накрутка ловится антифродом Яндекса, и прилёт фильтра почти гарантирован, особенно сейчас. Модель смотрит на паттерны в масштабе, эмуляция видна. Дешевле и надёжнее реально улучшить страницу, чтобы люди задерживались сами. У меня есть отдельный материал про проверку сайта на фильтры — рекомендую.

  • Alex_web

    Спасибо за таблицу сравнения BERT и YATI, забрал в закладки. Не хватило только про многоязычные модели типа mBERT, но это уже придирки.

  • Ольга Ветрова

    Получается, старые SEO-тексты по 3000 знаков с ключами в каждом абзаце теперь надо переписывать? У меня таких на сайте штук сорок.

    • Анатолий Кузнецов

      Не обязательно всё сразу. Начните с тех, что приносят или могут приносить трафик — по данным Вебмастера и Метрики. Переписывайте под смысл: убирайте переспам, дораскрывайте подвопросы, добавляйте структуру. Сорок страниц реально разгрести за пару месяцев по приоритету. Если нужна помощь с приоритизацией — пишите.

  • Роман

    А как трансформер понимает отрицание? Например ‘кроссовки не для бега’ — он же может проигнорировать ‘не’?

  • Ната

    Наконец статья, где про YATI по-человечески, а не пересказ пресс-релиза Яндекса. Респект автору.

  • Сергей Кузьмин

    Вопрос практика: если я закрываю все подвопросы темы, страница разрастается до 15-20 тысяч знаков. Это не считается переоптимизацией по объёму?

  • veronika.m

    А для интернет-магазина это как работает? У меня карточки товаров, там особо смысла не раскроешь, там характеристики.

    • Анатолий Кузнецов

      Для карточек смысл раскрывается через полноту данных: характеристики, описание применения, отзывы, ответы на вопросы, похожие товары. YATI видит сущность ‘товар’ и оценивает, насколько полно закрыт запрос покупателя. Плюс сильно помогает product-микроразметка. У меня есть отдельный гайд по оптимизации карточек — там всё по шагам.

  • Тимофей

    Интересно, а голосовой поиск это тот же семантический движок или отдельная история? Запросы голосом же совсем разговорные.

  • Anna K.

    Спасибо, отправила статью своему копирайтеру, а то он всё ещё плотность ключей в 5% считает калькулятором.

  • Виктор

    Не соглашусь, что ссылки уже не главное. По моим проектам без нормального ссылочного никакой смысл в топ не вытаскивает.

  • Полина Р.

    А эмбеддинги сайт как-то может сам использовать? Или это только внутри поисковика живёт?

  • maksim_seo

    Хорошо разжёвано про механизм внимания на примере с банком реки. Обычно про self-attention пишут так, что мозг вытекает. Тут понятно.

  • Оставить комментарий

    Ваш адрес email не будет опубликован. Обязательные поля помечены *

    Этот сайт использует Akismet для борьбы со спамом. Узнайте, как обрабатываются ваши данные комментариев.