Мультимодальный поиск: текст, картинки и голос в одной выдаче

Ещё пять лет назад поиск был почти полностью текстовым: пользователь набирал слова, а алгоритм подбирал документы с этими словами. Сегодня всё иначе. Человек фотографирует непонятную деталь и спрашивает голосом «где купить такую же», диктует запрос на бегу, дополняет его картинкой из галереи — и получает единый ответ, где перемешаны сайты, товарные карточки, видео, изображения и сгенерированный текст. Это и есть мультимодальный поиск: система принимает и обрабатывает несколько типов входных данных сразу и формирует выдачу, в которой разные форматы соседствуют в одном интерфейсе. Я, Анатолий Кузнецов, занимаюсь продвижением с 2003 года и последние два года плотно наблюдаю, как эта механика переворачивает привычные подходы к оптимизации. В этой статье разберу без воды, как всё устроено внутри и что конкретно делать, чтобы ваш сайт попадал в ответ независимо от того, набрал пользователь запрос, произнёс его или сфотографировал.

Что такое мультимодальный поиск и чем он отличается от классического

Классический поиск оперирует одной модальностью — текстом. Вы вводите строку, алгоритм сопоставляет её с проиндексированными документами по совпадению слов, синонимов и смыслов. Мультимодальный поиск работает с несколькими каналами восприятия одновременно: текст, изображение, звук (голос), а в перспективе видео и даже данные с камеры в реальном времени. Ключевое слово здесь — «одновременно». Пользователь может сфотографировать диван, добавить текст «в бежевом цвете» и голосом уточнить «до 40 тысяч». Система должна понять все три сигнала как единый запрос и выдать релевантный результат.

Технологически это стало возможным благодаря мультимодальным нейросетевым моделям — их обучают на парах «изображение-текст», «звук-текст» и так далее, чтобы разные форматы проецировались в единое смысловое пространство (эмбеддинги). Проще говоря, фотография кошки и слово «кошка» превращаются в близкие точки внутри математической модели. Именно поэтому Яндекс через Нейро и Google через AI-режим научились «видеть» картинку и «слышать» голос так же уверенно, как раньше читали текст. Если вы ещё не разобрались, как работает нейропоиск в целом, рекомендую сначала прочитать материал про AI-поиск и нейросетевые ответы Яндекса и Google — там заложена база, на которую опирается всё, о чём я пишу дальше.

Главное отличие для нас, оптимизаторов: раньше мы боролись за место в списке из десяти синих ссылок, а теперь боремся за присутствие в гибридной выдаче, где текстовый ответ соседствует с товарной галереей, видеокарточкой и блоком изображений. Один и тот же коммерческий интент можно перехватить через три разные точки входа, и это одновременно и вызов, и подарок.

Три модальности: как поисковик понимает текст, картинку и голос

Чтобы грамотно оптимизировать сайт, нужно понимать, что происходит с каждым типом запроса до того, как он превратится в выдачу. Разберу по порядку.

Текстовый канал

Здесь всё привычно, но с поправкой на нейросети. Алгоритм больше не ищет точное вхождение фразы — он извлекает намерение. Запрос «чем отмыть пригоревшую эмалированную кастрюлю» и «как очистить эмаль от нагара» для мультимодальной модели почти идентичны. Поэтому семантика строится вокруг смыслов, а не вокруг словоформ. Тут работает вся классика LSI-подхода: тематическая полнота текста, естественные связанные термины, ответ на реальный вопрос. Если хотите освежить принцип, посмотрите разбор LSI-копирайтинга как метода продвижения — он лёг в основу того, как современные модели оценивают релевантность.

Визуальный канал

Когда пользователь загружает фотографию, модель раскладывает её на объекты, атрибуты (цвет, форма, материал, бренд) и контекст. Дальше она либо ищет визуально похожие изображения в индексе, либо распознаёт объект и переводит его в текстовый запрос. Именно поэтому качество и разметка ваших изображений напрямую влияют на то, попадёте ли вы в визуальную выдачу. Это уже не «приятное дополнение», а полноценный источник трафика.

Голосовой канал

Голос сначала превращается в текст через распознавание речи, но с важной особенностью: устные запросы длиннее, разговорнее и почти всегда сформулированы как вопрос или команда. «Окей, где ближайшая круглосуточная аптека с детским нурофеном» — это не то же самое, что печатный запрос «аптека нурофен». Голосовая выдача чаще всего однозначна: система зачитывает один ответ, а не список. Значит, борьба идёт за позицию номер один и за попадание в быстрый ответ. Подробно механику голоса я разбирал в статье про оптимизацию под голосовой поиск и Алису.

Как формируется единая выдача из разных источников

Самое интересное происходит на этапе сборки результата. Поисковая система не просто складывает три списка в кучу — она решает, какой формат лучше всего отвечает на интент, и ранжирует блоки между собой. Здесь работает несколько слоёв.

Сначала определяется доминирующая модальность запроса. Если человек фотографирует товар, приоритет отдаётся визуально-товарным блокам. Если задаёт вопрос голосом — приоритет у краткого фактического ответа и разметки. Если печатает информационный запрос — на первый план выходят текстовые документы и сгенерированная нейросводка. Затем система подмешивает вспомогательные форматы: под текстовым ответом появляется галерея картинок, справа — товарные карточки, ниже — видео. Всё это ранжируется по единой шкале полезности.

Для нас это означает, что источники трафика диверсифицируются. Один и тот же посетитель может прийти на сайт из текстовой ссылки, кликнув по картинке в визуальном блоке или перейдя из видеокарточки. Поэтому стратегию продвижения теперь нельзя строить только вокруг текста. Ниже — таблица, которая показывает, какой формат контента перехватывает какой тип интента.

Тип запроса Доминирующая модальность Что показывает выдача Что оптимизировать на сайте
«как приготовить плов в казане» Текст + видео Нейросводка, видеорецепт, статьи Пошаговый текст, HowTo-разметка, видео
Фото кроссовок с вопросом «где купить» Картинка + коммерция Товарные карточки, визуально похожие Качественные фото, Product-разметка, alt
«окей, сколько варить креветки» Голос Один зачитанный ответ Прямой краткий ответ, FAQ-разметка
«лучший ноутбук для монтажа 2026» Текст Нейросводка со ссылками, обзоры Экспертный лонгрид, сравнения, E-E-A-T
Скриншот ошибки на экране Картинка + текст Инструкции по решению Тексты с распознаваемыми терминами

Оптимизация под визуальный поиск: картинки становятся точкой входа

Долгое время работа с изображениями сводилась к «сжать и прописать alt». В мультимодальном мире этого мало. Картинка теперь — самостоятельный документ, который может ранжироваться отдельно и приводить трафик напрямую. Вот что реально влияет на попадание в визуальную выдачу.

  • Оригинальность и качество. Стоковые фото, которые встречаются на тысячах сайтов, проигрывают уникальным. Модель распознаёт дубли и понижает их. Снимайте товары и объекты сами, где это возможно.
  • Резкость и разрешение. Размытое фото на 300 пикселей нейросеть просто не разберёт на объекты. Давайте достаточное разрешение, но в современных форматах, чтобы не убить скорость — про это есть отдельный разбор форматов WebP и AVIF.
  • Осмысленный alt и окружающий текст. Alt по-прежнему важен, но теперь модель читает и подпись, и заголовок рядом, и весь контекст блока. Картинка дивана в статье про интерьеры ранжируется точнее, чем та же картинка в отрыве от текста.
  • Имя файла и структура. divan-uglovoj-bezhevyj.webp работает лучше, чем IMG_9382.webp. Мелочь, но она добавляет сигнал.
  • Разметка Schema. ImageObject, Product, Recipe помогают системе связать картинку с сущностью.

Если у вас интернет-магазин, визуальный поиск — это прямые деньги: пользователь фотографирует вещь и хочет купить похожую. Полный чек-лист работы с изображениями я собрал в материале про оптимизацию изображений для SEO, а тонкости товарных фото — в разборе оптимизации карточек товаров. Настоятельно советую пройтись по обоим, потому что именно здесь большинство сайтов теряет лёгкий трафик.

Оптимизация под голосовой поиск: краткость и структура ответа

Голосовой запрос почти всегда требует одного ответа, а не списка. Ассистент — Алиса, Маруся, Google Assistant — зачитывает ту информацию, которую система сочла самой точной и лаконичной. Чтобы попадать в этот ответ, нужно менять саму структуру контента.

Работает следующее. Во-первых, прямой ответ в первых предложениях блока: если раздел называется «Сколько хранится открытое молоко», первая же фраза должна давать цифру — «Открытое молоко хранится в холодильнике 3–4 дня». Ассистент вырежет именно её. Во-вторых, разговорные формулировки: устные запросы длиннее и содержат вопросительные слова «как», «где», «почему», «сколько». Закладывайте эти естественные вопросы в подзаголовки. В-третьих, разметка. FAQ и HowTo дают системе готовую пару «вопрос-ответ», которую удобно озвучить. Про это подробно писал в гайде по микроразметке FAQ и HowTo.

Ещё один момент, который часто упускают: голосовой поиск сильно завязан на локальный контекст. «Ближайшая», «рядом», «недалеко» — это всегда про геолокацию. Если вы работаете с офлайн-точками, без проработки локального SEO в голосовой выдаче делать нечего. Ассистент отдаёт предпочтение бизнесам с заполненными карточками, отзывами и корректными данными в справочниках.

Текстовый контент в эпоху нейросводок: как остаться в ответе

Может показаться, что раз выдача теперь мультимодальная, текст потерял значение. Наоборот. Именно текст остаётся фундаментом, из которого нейросеть собирает свои сводки, а картинки и видео чаще всего лишь дополняют его. Проблема в другом: когда система сама генерирует ответ, пользователь может не кликнуть по вашей ссылке. Значит, задача — быть тем источником, который нейросеть цитирует и на который ссылается.

Что для этого нужно. Чёткая структура с логичными заголовками — модели проще извлекать факты из хорошо размеченного документа, поэтому важна корректная иерархия заголовков H1–H6. Фактическая плотность: цифры, конкретика, определения, а не «вода» и общие слова. Экспертность и авторитетность — сигналы E-E-A-T, о которых я подробно рассказывал в материале про авторитетность сайта, ИКС и E-E-A-T. И, конечно, текст должен быть написан для человека, а не под алгоритм — как я всегда говорю, читаемость первична; методику разбирал в статье о том, как писать SEO-текст для людей и поисковиков.

Отдельно про попадание в блок с быстрым ответом. Мультимодальная выдача любит «нулевую позицию» — краткий выделенный ответ наверху. Чтобы туда попасть, дайте прямой ответ на вопрос в 40–60 словах сразу после соответствующего подзаголовка. Механику я разбирал в разборе избранных сниппетов и блока ноль.

Роль видео в гибридной выдаче

Видео — четвёртая модальность, которая быстро набирает вес. Поисковики распознают речь в ролике, читают субтитры, анализируют превью и всё чаще вставляют видеокарточки прямо в основную выдачу, а не только в отдельную вкладку. Для многих тем «как сделать что-то своими руками», обзоров и распаковок видео перехватывает интент лучше текста.

Практические выводы простые. Загружайте ролики с текстовой расшифровкой и осмысленным описанием — так модель понимает содержание. Делайте цепляющие превью: в мультимодальной выдаче миниатюра конкурирует за клик наравне с картинками. Размечайте видео через VideoObject. И размещайте ролик на странице рядом с релевантным текстом, чтобы усилить оба формата. Системный подход к видеоформату я собрал в отдельном руководстве по SEO для видео на YouTube, Rutube и VK.

Пошаговый план перехода на мультимодальную оптимизацию

Теория без внедрения бесполезна, поэтому даю конкретный порядок действий, который сам применяю на проектах.

  1. Аудит текущих точек входа. Посмотрите в вебмастере и аналитике, из каких форматов уже идёт трафик: только текст или есть картинки и видео. Это база для приоритетов.
  2. Инвентаризация изображений. Проверьте оригинальность, разрешение, alt, имена файлов и разметку у ключевых страниц. Начните с коммерчески важных.
  3. Внедрение структурированных данных. Product, FAQ, HowTo, Recipe, VideoObject, ImageObject — по типу контента. Это язык, на котором вы разговариваете с мультимодальной моделью. Начните с гайда по микроразметке Schema.org.
  4. Переработка текстов под прямые ответы. Первое предложение каждого раздела — готовый ответ на вопрос из подзаголовка.
  5. Добавление голосовых формулировок. Внесите естественные вопросительные подзаголовки, отражающие устную речь.
  6. Работа с видео. Хотя бы для топовых страниц добавьте ролик с расшифровкой.
  7. Контроль скорости. Тяжёлые картинки и видео убивают Core Web Vitals, а без скорости никакая модальность не спасёт. Проверьте Core Web Vitals и скорость загрузки.
  8. Мониторинг и итерации. Отслеживайте, по каким форматам растёт видимость, и перераспределяйте усилия.

Частые ошибки, которые лишают вас мультимодального трафика

За годы практики я вижу одни и те же грабли. Сведу их в таблицу — сверьтесь со своим сайтом.

Ошибка Чем грозит Как исправить
Стоковые картинки на всех страницах Выпадение из визуальной выдачи Уникальные фото и иллюстрации
Alt вида «изображение123» Модель не понимает объект Осмысленное описание объекта
Ответ на вопрос спрятан в конце текста Не попадаете в голос и блок ноль Прямой ответ в первом предложении
Нет структурированных данных Слабый сигнал для сборки выдачи Внедрить релевантную Schema
Видео без расшифровки и описания Ролик не индексируется по смыслу Добавить транскрипт и VideoObject
Тяжёлые медиа без оптимизации Проседают Core Web Vitals Сжатие, WebP/AVIF, lazy-load
Игнор геоданных при офлайн-бизнесе Потеря голосового локального трафика Заполнить карточки и справочники

Отдельно предостерегу от соблазна нагенерировать сотни картинок и текстов нейросетью «для объёма». Мультимодальные модели отлично распознают шаблонный контент и относятся к нему прохладно. Ставка всегда на уникальность и пользу. Если решаете использовать ИИ в работе, делайте это осознанно — как инструмент, а не как конвейер штамповки; свой взгляд я изложил в материале про нейросети в SEO.

Что будет дальше: тренды мультимодального поиска

Направление движения понятно. Во-первых, поиск в реальном времени через камеру: наводите телефон на объект и сразу получаете информацию без промежуточного фото. Во-вторых, углубление персонализации — система будет учитывать не только запрос, но и контекст: время, местоположение, историю. В-третьих, рост доли действий прямо в выдаче: заказ, бронирование, покупка без перехода на сайт. Это значит, что нам придётся бороться уже не только за клик, но и за то, чтобы наши данные и предложения были доступны системе в машиночитаемом виде.

Вывод для стратегии простой: сайт должен быть одинаково понятен и человеку, и мультимодальной модели во всех форматах сразу. Тот, кто раньше остальных перестроит контент под текст, картинку, голос и видео одновременно, соберёт трафик, который конкуренты ещё даже не считают своим. Если хотите системно выстроить такую работу на год вперёд, у меня есть подробный разбор SEO-стратегии с нуля на 12 месяцев — мультимодальность туда встраивается органично.

Заказать продвижение и получить бесплатный аудит

Мультимодальный поиск — это не про далёкое будущее, а про трафик, который перераспределяется прямо сейчас. Пока конкуренты продолжают думать только о текстовых ключах, можно занять визуальную, голосовую и видеовыдачу и получить посетителей там, где за них почти никто не борется. Но перестройка требует системного подхода: аудита точек входа, работы с медиа, разметки и переработки контента под прямые ответы.

Если хотите, чтобы этим занялся практик с опытом с 2003 года, начните с малого — закажите бесплатный SEO аудит сайта. Я покажу, из каких форматов вы уже теряете трафик и что даст быстрый результат. Готовы двигаться комплексно — можно сразу заказать SEO продвижение под ключ или обсудить детали на SEO-консультации. А если основная точка роста — контент, который цитируют нейросводки, посмотрите LSI-тексты на заказ и актуальные тарифы на продвижение. Пишите — разберём ваш проект предметно.

Закажите SEO продвижение сайта

Выведем ваш сайт в ТОП Яндекса и Google. Бесплатная консультация — разберём сайт, найдём точки роста и предложим стратегию продвижения.

Оставить заявку Бесплатный SEO аудит
Аудит сайта

Comments

  • Дмитрий Соколов

    Анатолий, спасибо за разбор. А как понять, идёт ли уже трафик с картинок или это всё теория? В обычной аналитике я вижу только общие цифры.

    • Анатолий Кузнецов

      Дмитрий, в Яндекс.Вебмастере есть отдельный отчёт по поиску по картинкам, а в Search Console — вкладка Изображения в отчёте по эффективности. Начните оттуда, увидите долю визуального трафика по каждой странице. Если хотите, могу разобрать ваш сайт в рамках бесплатного аудита.

  • Марина

    У нас интернет-магазин мебели, фотки в основном от поставщиков, одинаковые у всех. Правда ли, что из-за этого мы вылетаем из выдачи по картинкам?

    • Анатолий Кузнецов

      Марина, да, это одна из самых частых проблем в мебельной нише. Одинаковые фото поставщика конкурируют между десятками магазинов, и система понижает дубли. Даже пара собственных студийных или интерьерных снимков на карточку заметно улучшает позиции. Плюс обязательно проработайте alt и Product-разметку.

  • Игорь Пантелеев

    А голосовой поиск в рунете вообще приносит нормальный объём? Или это пока баловство и все продолжают печатать?

  • Sveta_marketolog

    Отличная таблица с ошибками, сразу пошла проверять свои alt. У нас реально половина картинок называется IMG_что-то там. Стыдно, но исправим.

  • Алексей

    Не совсем согласен, что текст остаётся фундаментом. По моим наблюдениям нейросводка часто отвечает сама и на сайт вообще никто не идёт. Зачем тогда писать лонгриды?

    • Анатолий Кузнецов

      Алексей, справедливое возражение, но нюанс вот в чём: нейросводку кто-то должен наполнить фактами, и это ваш текст. Быть процитированным источником — это и узнаваемость бренда, и переходы по ссылке из сводки, которая всё чаще проставляется. Плюс остаётся масса запросов, где сводки нет вообще. Лонгриды не ради объёма, а ради фактической плотности, которую модель захочет процитировать.

  • Наталья Коваль

    Подскажите, VideoObject размечать обязательно, если видео залито на YouTube и просто встроено на страницу? Или ютуб сам всё делает?

    • Анатолий Кузнецов

      Наталья, YouTube размечает ролик на своей стороне, но когда видео встроено на вашу страницу, разметка VideoObject на самой странице помогает связать ролик именно с вашим контентом и претендовать на видеокарточку в выдаче по вашему URL. Так что да, размечать стоит, лишним не будет.

  • Рустам

    Camera в реальном времени это конечно круто, но не переоценка ли? У большинства людей интернет тормозит, какая там дополненная реальность.

  • Ольга П.

    Спасибо, забрала статью в закладки. Особенно полезно про прямой ответ в первом предложении раздела, раньше всегда прятала суть в середину.

  • Виктор Данилов

    А как быть B2B-услугам? У нас нет товаров и красивых картинок, только сухие услуги. Мультимодальность вообще про нас?

    • Анатолий Кузнецов

      Виктор, про вас в первую очередь через голос и текст. B2B-запросы часто задают голосом на бегу, и тут выигрывает прямой структурированный ответ плюс FAQ-разметка. А визуально можно давать схемы процессов, инфографику, скриншоты кейсов — это тоже распознаётся. Так что модальности другие, но потенциал есть. Могу подсказать точки роста на консультации.

  • Kirill_dev

    По поводу имён файлов транслитом — а кириллицей нельзя? divan-bezhevyj кириллицей будет ещё понятнее для рунета?

  • Елена Тихонова

    Внедрили FAQ-разметку месяц назад, реально стали появляться в блоке с вопросами. Подтверждаю, что работает. Теперь возьмёмся за картинки по вашему чек-листу.

  • Артём

    Вопрос про уникальность ИИ-картинок: если я генерирую иллюстрации нейросетью, они же технически уникальные. Это считается за уникальный контент или всё равно понижается?

  • Галина Мороз

    Очень доступно написано, даже мне без технического бэкграунда понятно. Отправила разработчику ссылку, пусть внедряет разметку.

  • Станислав

    А есть ли смысл заморачиваться с мультимодальностью для локального сервиса типа шиномонтажа? Или там всё решают карты и отзывы?

  • Юлия

    Спасибо за упоминание Core Web Vitals. Мы как раз навставляли тяжёлых видео и скорость упала, теперь понятно почему просели позиции.

  • Оставить комментарий

    Ваш адрес email не будет опубликован. Обязательные поля помечены *

    Этот сайт использует Akismet для борьбы со спамом. Узнайте, как обрабатываются ваши данные комментариев.