Мультимодальный поиск: текст, картинки и голос в одной выдаче
Ещё пять лет назад поиск был почти полностью текстовым: пользователь набирал слова, а алгоритм подбирал документы с этими словами. Сегодня всё иначе. Человек фотографирует непонятную деталь и спрашивает голосом «где купить такую же», диктует запрос на бегу, дополняет его картинкой из галереи — и получает единый ответ, где перемешаны сайты, товарные карточки, видео, изображения и сгенерированный текст. Это и есть мультимодальный поиск: система принимает и обрабатывает несколько типов входных данных сразу и формирует выдачу, в которой разные форматы соседствуют в одном интерфейсе. Я, Анатолий Кузнецов, занимаюсь продвижением с 2003 года и последние два года плотно наблюдаю, как эта механика переворачивает привычные подходы к оптимизации. В этой статье разберу без воды, как всё устроено внутри и что конкретно делать, чтобы ваш сайт попадал в ответ независимо от того, набрал пользователь запрос, произнёс его или сфотографировал.
Что такое мультимодальный поиск и чем он отличается от классического
Классический поиск оперирует одной модальностью — текстом. Вы вводите строку, алгоритм сопоставляет её с проиндексированными документами по совпадению слов, синонимов и смыслов. Мультимодальный поиск работает с несколькими каналами восприятия одновременно: текст, изображение, звук (голос), а в перспективе видео и даже данные с камеры в реальном времени. Ключевое слово здесь — «одновременно». Пользователь может сфотографировать диван, добавить текст «в бежевом цвете» и голосом уточнить «до 40 тысяч». Система должна понять все три сигнала как единый запрос и выдать релевантный результат.
Технологически это стало возможным благодаря мультимодальным нейросетевым моделям — их обучают на парах «изображение-текст», «звук-текст» и так далее, чтобы разные форматы проецировались в единое смысловое пространство (эмбеддинги). Проще говоря, фотография кошки и слово «кошка» превращаются в близкие точки внутри математической модели. Именно поэтому Яндекс через Нейро и Google через AI-режим научились «видеть» картинку и «слышать» голос так же уверенно, как раньше читали текст. Если вы ещё не разобрались, как работает нейропоиск в целом, рекомендую сначала прочитать материал про AI-поиск и нейросетевые ответы Яндекса и Google — там заложена база, на которую опирается всё, о чём я пишу дальше.
Главное отличие для нас, оптимизаторов: раньше мы боролись за место в списке из десяти синих ссылок, а теперь боремся за присутствие в гибридной выдаче, где текстовый ответ соседствует с товарной галереей, видеокарточкой и блоком изображений. Один и тот же коммерческий интент можно перехватить через три разные точки входа, и это одновременно и вызов, и подарок.
Три модальности: как поисковик понимает текст, картинку и голос
Чтобы грамотно оптимизировать сайт, нужно понимать, что происходит с каждым типом запроса до того, как он превратится в выдачу. Разберу по порядку.
Текстовый канал
Здесь всё привычно, но с поправкой на нейросети. Алгоритм больше не ищет точное вхождение фразы — он извлекает намерение. Запрос «чем отмыть пригоревшую эмалированную кастрюлю» и «как очистить эмаль от нагара» для мультимодальной модели почти идентичны. Поэтому семантика строится вокруг смыслов, а не вокруг словоформ. Тут работает вся классика LSI-подхода: тематическая полнота текста, естественные связанные термины, ответ на реальный вопрос. Если хотите освежить принцип, посмотрите разбор LSI-копирайтинга как метода продвижения — он лёг в основу того, как современные модели оценивают релевантность.
Визуальный канал
Когда пользователь загружает фотографию, модель раскладывает её на объекты, атрибуты (цвет, форма, материал, бренд) и контекст. Дальше она либо ищет визуально похожие изображения в индексе, либо распознаёт объект и переводит его в текстовый запрос. Именно поэтому качество и разметка ваших изображений напрямую влияют на то, попадёте ли вы в визуальную выдачу. Это уже не «приятное дополнение», а полноценный источник трафика.
Голосовой канал
Голос сначала превращается в текст через распознавание речи, но с важной особенностью: устные запросы длиннее, разговорнее и почти всегда сформулированы как вопрос или команда. «Окей, где ближайшая круглосуточная аптека с детским нурофеном» — это не то же самое, что печатный запрос «аптека нурофен». Голосовая выдача чаще всего однозначна: система зачитывает один ответ, а не список. Значит, борьба идёт за позицию номер один и за попадание в быстрый ответ. Подробно механику голоса я разбирал в статье про оптимизацию под голосовой поиск и Алису.
Как формируется единая выдача из разных источников
Самое интересное происходит на этапе сборки результата. Поисковая система не просто складывает три списка в кучу — она решает, какой формат лучше всего отвечает на интент, и ранжирует блоки между собой. Здесь работает несколько слоёв.
Сначала определяется доминирующая модальность запроса. Если человек фотографирует товар, приоритет отдаётся визуально-товарным блокам. Если задаёт вопрос голосом — приоритет у краткого фактического ответа и разметки. Если печатает информационный запрос — на первый план выходят текстовые документы и сгенерированная нейросводка. Затем система подмешивает вспомогательные форматы: под текстовым ответом появляется галерея картинок, справа — товарные карточки, ниже — видео. Всё это ранжируется по единой шкале полезности.
Для нас это означает, что источники трафика диверсифицируются. Один и тот же посетитель может прийти на сайт из текстовой ссылки, кликнув по картинке в визуальном блоке или перейдя из видеокарточки. Поэтому стратегию продвижения теперь нельзя строить только вокруг текста. Ниже — таблица, которая показывает, какой формат контента перехватывает какой тип интента.
| Тип запроса | Доминирующая модальность | Что показывает выдача | Что оптимизировать на сайте |
|---|---|---|---|
| «как приготовить плов в казане» | Текст + видео | Нейросводка, видеорецепт, статьи | Пошаговый текст, HowTo-разметка, видео |
| Фото кроссовок с вопросом «где купить» | Картинка + коммерция | Товарные карточки, визуально похожие | Качественные фото, Product-разметка, alt |
| «окей, сколько варить креветки» | Голос | Один зачитанный ответ | Прямой краткий ответ, FAQ-разметка |
| «лучший ноутбук для монтажа 2026» | Текст | Нейросводка со ссылками, обзоры | Экспертный лонгрид, сравнения, E-E-A-T |
| Скриншот ошибки на экране | Картинка + текст | Инструкции по решению | Тексты с распознаваемыми терминами |
Оптимизация под визуальный поиск: картинки становятся точкой входа
Долгое время работа с изображениями сводилась к «сжать и прописать alt». В мультимодальном мире этого мало. Картинка теперь — самостоятельный документ, который может ранжироваться отдельно и приводить трафик напрямую. Вот что реально влияет на попадание в визуальную выдачу.
- Оригинальность и качество. Стоковые фото, которые встречаются на тысячах сайтов, проигрывают уникальным. Модель распознаёт дубли и понижает их. Снимайте товары и объекты сами, где это возможно.
- Резкость и разрешение. Размытое фото на 300 пикселей нейросеть просто не разберёт на объекты. Давайте достаточное разрешение, но в современных форматах, чтобы не убить скорость — про это есть отдельный разбор форматов WebP и AVIF.
- Осмысленный alt и окружающий текст. Alt по-прежнему важен, но теперь модель читает и подпись, и заголовок рядом, и весь контекст блока. Картинка дивана в статье про интерьеры ранжируется точнее, чем та же картинка в отрыве от текста.
- Имя файла и структура. divan-uglovoj-bezhevyj.webp работает лучше, чем IMG_9382.webp. Мелочь, но она добавляет сигнал.
- Разметка Schema. ImageObject, Product, Recipe помогают системе связать картинку с сущностью.
Если у вас интернет-магазин, визуальный поиск — это прямые деньги: пользователь фотографирует вещь и хочет купить похожую. Полный чек-лист работы с изображениями я собрал в материале про оптимизацию изображений для SEO, а тонкости товарных фото — в разборе оптимизации карточек товаров. Настоятельно советую пройтись по обоим, потому что именно здесь большинство сайтов теряет лёгкий трафик.
Оптимизация под голосовой поиск: краткость и структура ответа
Голосовой запрос почти всегда требует одного ответа, а не списка. Ассистент — Алиса, Маруся, Google Assistant — зачитывает ту информацию, которую система сочла самой точной и лаконичной. Чтобы попадать в этот ответ, нужно менять саму структуру контента.
Работает следующее. Во-первых, прямой ответ в первых предложениях блока: если раздел называется «Сколько хранится открытое молоко», первая же фраза должна давать цифру — «Открытое молоко хранится в холодильнике 3–4 дня». Ассистент вырежет именно её. Во-вторых, разговорные формулировки: устные запросы длиннее и содержат вопросительные слова «как», «где», «почему», «сколько». Закладывайте эти естественные вопросы в подзаголовки. В-третьих, разметка. FAQ и HowTo дают системе готовую пару «вопрос-ответ», которую удобно озвучить. Про это подробно писал в гайде по микроразметке FAQ и HowTo.
Ещё один момент, который часто упускают: голосовой поиск сильно завязан на локальный контекст. «Ближайшая», «рядом», «недалеко» — это всегда про геолокацию. Если вы работаете с офлайн-точками, без проработки локального SEO в голосовой выдаче делать нечего. Ассистент отдаёт предпочтение бизнесам с заполненными карточками, отзывами и корректными данными в справочниках.
Текстовый контент в эпоху нейросводок: как остаться в ответе
Может показаться, что раз выдача теперь мультимодальная, текст потерял значение. Наоборот. Именно текст остаётся фундаментом, из которого нейросеть собирает свои сводки, а картинки и видео чаще всего лишь дополняют его. Проблема в другом: когда система сама генерирует ответ, пользователь может не кликнуть по вашей ссылке. Значит, задача — быть тем источником, который нейросеть цитирует и на который ссылается.
Что для этого нужно. Чёткая структура с логичными заголовками — модели проще извлекать факты из хорошо размеченного документа, поэтому важна корректная иерархия заголовков H1–H6. Фактическая плотность: цифры, конкретика, определения, а не «вода» и общие слова. Экспертность и авторитетность — сигналы E-E-A-T, о которых я подробно рассказывал в материале про авторитетность сайта, ИКС и E-E-A-T. И, конечно, текст должен быть написан для человека, а не под алгоритм — как я всегда говорю, читаемость первична; методику разбирал в статье о том, как писать SEO-текст для людей и поисковиков.
Отдельно про попадание в блок с быстрым ответом. Мультимодальная выдача любит «нулевую позицию» — краткий выделенный ответ наверху. Чтобы туда попасть, дайте прямой ответ на вопрос в 40–60 словах сразу после соответствующего подзаголовка. Механику я разбирал в разборе избранных сниппетов и блока ноль.
Роль видео в гибридной выдаче
Видео — четвёртая модальность, которая быстро набирает вес. Поисковики распознают речь в ролике, читают субтитры, анализируют превью и всё чаще вставляют видеокарточки прямо в основную выдачу, а не только в отдельную вкладку. Для многих тем «как сделать что-то своими руками», обзоров и распаковок видео перехватывает интент лучше текста.
Практические выводы простые. Загружайте ролики с текстовой расшифровкой и осмысленным описанием — так модель понимает содержание. Делайте цепляющие превью: в мультимодальной выдаче миниатюра конкурирует за клик наравне с картинками. Размечайте видео через VideoObject. И размещайте ролик на странице рядом с релевантным текстом, чтобы усилить оба формата. Системный подход к видеоформату я собрал в отдельном руководстве по SEO для видео на YouTube, Rutube и VK.
Пошаговый план перехода на мультимодальную оптимизацию
Теория без внедрения бесполезна, поэтому даю конкретный порядок действий, который сам применяю на проектах.
- Аудит текущих точек входа. Посмотрите в вебмастере и аналитике, из каких форматов уже идёт трафик: только текст или есть картинки и видео. Это база для приоритетов.
- Инвентаризация изображений. Проверьте оригинальность, разрешение, alt, имена файлов и разметку у ключевых страниц. Начните с коммерчески важных.
- Внедрение структурированных данных. Product, FAQ, HowTo, Recipe, VideoObject, ImageObject — по типу контента. Это язык, на котором вы разговариваете с мультимодальной моделью. Начните с гайда по микроразметке Schema.org.
- Переработка текстов под прямые ответы. Первое предложение каждого раздела — готовый ответ на вопрос из подзаголовка.
- Добавление голосовых формулировок. Внесите естественные вопросительные подзаголовки, отражающие устную речь.
- Работа с видео. Хотя бы для топовых страниц добавьте ролик с расшифровкой.
- Контроль скорости. Тяжёлые картинки и видео убивают Core Web Vitals, а без скорости никакая модальность не спасёт. Проверьте Core Web Vitals и скорость загрузки.
- Мониторинг и итерации. Отслеживайте, по каким форматам растёт видимость, и перераспределяйте усилия.
Частые ошибки, которые лишают вас мультимодального трафика
За годы практики я вижу одни и те же грабли. Сведу их в таблицу — сверьтесь со своим сайтом.
| Ошибка | Чем грозит | Как исправить |
|---|---|---|
| Стоковые картинки на всех страницах | Выпадение из визуальной выдачи | Уникальные фото и иллюстрации |
| Alt вида «изображение123» | Модель не понимает объект | Осмысленное описание объекта |
| Ответ на вопрос спрятан в конце текста | Не попадаете в голос и блок ноль | Прямой ответ в первом предложении |
| Нет структурированных данных | Слабый сигнал для сборки выдачи | Внедрить релевантную Schema |
| Видео без расшифровки и описания | Ролик не индексируется по смыслу | Добавить транскрипт и VideoObject |
| Тяжёлые медиа без оптимизации | Проседают Core Web Vitals | Сжатие, WebP/AVIF, lazy-load |
| Игнор геоданных при офлайн-бизнесе | Потеря голосового локального трафика | Заполнить карточки и справочники |
Отдельно предостерегу от соблазна нагенерировать сотни картинок и текстов нейросетью «для объёма». Мультимодальные модели отлично распознают шаблонный контент и относятся к нему прохладно. Ставка всегда на уникальность и пользу. Если решаете использовать ИИ в работе, делайте это осознанно — как инструмент, а не как конвейер штамповки; свой взгляд я изложил в материале про нейросети в SEO.
Что будет дальше: тренды мультимодального поиска
Направление движения понятно. Во-первых, поиск в реальном времени через камеру: наводите телефон на объект и сразу получаете информацию без промежуточного фото. Во-вторых, углубление персонализации — система будет учитывать не только запрос, но и контекст: время, местоположение, историю. В-третьих, рост доли действий прямо в выдаче: заказ, бронирование, покупка без перехода на сайт. Это значит, что нам придётся бороться уже не только за клик, но и за то, чтобы наши данные и предложения были доступны системе в машиночитаемом виде.
Вывод для стратегии простой: сайт должен быть одинаково понятен и человеку, и мультимодальной модели во всех форматах сразу. Тот, кто раньше остальных перестроит контент под текст, картинку, голос и видео одновременно, соберёт трафик, который конкуренты ещё даже не считают своим. Если хотите системно выстроить такую работу на год вперёд, у меня есть подробный разбор SEO-стратегии с нуля на 12 месяцев — мультимодальность туда встраивается органично.
Заказать продвижение и получить бесплатный аудит
Мультимодальный поиск — это не про далёкое будущее, а про трафик, который перераспределяется прямо сейчас. Пока конкуренты продолжают думать только о текстовых ключах, можно занять визуальную, голосовую и видеовыдачу и получить посетителей там, где за них почти никто не борется. Но перестройка требует системного подхода: аудита точек входа, работы с медиа, разметки и переработки контента под прямые ответы.
Если хотите, чтобы этим занялся практик с опытом с 2003 года, начните с малого — закажите бесплатный SEO аудит сайта. Я покажу, из каких форматов вы уже теряете трафик и что даст быстрый результат. Готовы двигаться комплексно — можно сразу заказать SEO продвижение под ключ или обсудить детали на SEO-консультации. А если основная точка роста — контент, который цитируют нейросводки, посмотрите LSI-тексты на заказ и актуальные тарифы на продвижение. Пишите — разберём ваш проект предметно.
Закажите SEO продвижение сайта
Выведем ваш сайт в ТОП Яндекса и Google. Бесплатная консультация — разберём сайт, найдём точки роста и предложим стратегию продвижения.
Comments
Анатолий, спасибо за разбор. А как понять, идёт ли уже трафик с картинок или это всё теория? В обычной аналитике я вижу только общие цифры.
Дмитрий, в Яндекс.Вебмастере есть отдельный отчёт по поиску по картинкам, а в Search Console — вкладка Изображения в отчёте по эффективности. Начните оттуда, увидите долю визуального трафика по каждой странице. Если хотите, могу разобрать ваш сайт в рамках бесплатного аудита.
У нас интернет-магазин мебели, фотки в основном от поставщиков, одинаковые у всех. Правда ли, что из-за этого мы вылетаем из выдачи по картинкам?
Марина, да, это одна из самых частых проблем в мебельной нише. Одинаковые фото поставщика конкурируют между десятками магазинов, и система понижает дубли. Даже пара собственных студийных или интерьерных снимков на карточку заметно улучшает позиции. Плюс обязательно проработайте alt и Product-разметку.
А голосовой поиск в рунете вообще приносит нормальный объём? Или это пока баловство и все продолжают печатать?
Отличная таблица с ошибками, сразу пошла проверять свои alt. У нас реально половина картинок называется IMG_что-то там. Стыдно, но исправим.
Не совсем согласен, что текст остаётся фундаментом. По моим наблюдениям нейросводка часто отвечает сама и на сайт вообще никто не идёт. Зачем тогда писать лонгриды?
Алексей, справедливое возражение, но нюанс вот в чём: нейросводку кто-то должен наполнить фактами, и это ваш текст. Быть процитированным источником — это и узнаваемость бренда, и переходы по ссылке из сводки, которая всё чаще проставляется. Плюс остаётся масса запросов, где сводки нет вообще. Лонгриды не ради объёма, а ради фактической плотности, которую модель захочет процитировать.
Подскажите, VideoObject размечать обязательно, если видео залито на YouTube и просто встроено на страницу? Или ютуб сам всё делает?
Наталья, YouTube размечает ролик на своей стороне, но когда видео встроено на вашу страницу, разметка VideoObject на самой странице помогает связать ролик именно с вашим контентом и претендовать на видеокарточку в выдаче по вашему URL. Так что да, размечать стоит, лишним не будет.
Camera в реальном времени это конечно круто, но не переоценка ли? У большинства людей интернет тормозит, какая там дополненная реальность.
Спасибо, забрала статью в закладки. Особенно полезно про прямой ответ в первом предложении раздела, раньше всегда прятала суть в середину.
А как быть B2B-услугам? У нас нет товаров и красивых картинок, только сухие услуги. Мультимодальность вообще про нас?
Виктор, про вас в первую очередь через голос и текст. B2B-запросы часто задают голосом на бегу, и тут выигрывает прямой структурированный ответ плюс FAQ-разметка. А визуально можно давать схемы процессов, инфографику, скриншоты кейсов — это тоже распознаётся. Так что модальности другие, но потенциал есть. Могу подсказать точки роста на консультации.
По поводу имён файлов транслитом — а кириллицей нельзя? divan-bezhevyj кириллицей будет ещё понятнее для рунета?
Внедрили FAQ-разметку месяц назад, реально стали появляться в блоке с вопросами. Подтверждаю, что работает. Теперь возьмёмся за картинки по вашему чек-листу.
Вопрос про уникальность ИИ-картинок: если я генерирую иллюстрации нейросетью, они же технически уникальные. Это считается за уникальный контент или всё равно понижается?
Очень доступно написано, даже мне без технического бэкграунда понятно. Отправила разработчику ссылку, пусть внедряет разметку.
А есть ли смысл заморачиваться с мультимодальностью для локального сервиса типа шиномонтажа? Или там всё решают карты и отзывы?
Спасибо за упоминание Core Web Vitals. Мы как раз навставляли тяжёлых видео и скорость упала, теперь понятно почему просели позиции.
Оставить комментарий
Мы используем cookies
Для улучшения работы сайта и вашего удобства. Оставаясь на сайте, вы соглашаетесь с политикой конфиденциальности.