B2BPRO.KZ | Рекламное агентство в Алматы

llms.txt и разметка: что реально нужно сайту для ИИ-поиска

Маркетолог за ноутбуком с объёмными синими буквами SEO на столе и значками поиска и сообщений

Для попадания в ИИ-ответы сайту не нужен ни файл llms.txt, ни особая разметка: Google прямо пишет, что для AI Overviews и AI Mode никаких дополнительных требований и специальных оптимизаций нет. Страница должна быть доступна для индексации и показываться в поиске со сниппетом. Всё остальное сводится к тому, насколько ясно и проверяемо написан сам текст.

Типичная картина на проектах B2BPRO.KZ выглядит так. Владелец сайта прочитал, что «под нейросети теперь нужен отдельный файл», заказал его у подрядчика, а потом выяснилось, что половина страниц закрыта в robots.txt, FAQ спрятан в раскрывающиеся блоки без текста в коде, а ответа на главный вопрос клиента нет нигде. Файл лежит в корне, трафика из ИИ нет. Ниже разбираем, что из модных рекомендаций работает, что нет и в каком порядке вкладывать время.

Что такое llms.txt и откуда он взялся

llms.txt — это текстовый файл в формате Markdown, который лежит в корне сайта и коротко объясняет языковым моделям, о чём сайт и где на нём главные материалы. Предложил формат Джереми Ховард, спецификация опубликована 3 сентября 2024 года и размещена на сайте llmstxt.org. Стандартом в смысле W3C или IETF он не является: это открытое предложение, которое каждый сайт и каждая система принимают или игнорируют по своему усмотрению.

Идея простая. Обычная HTML-страница содержит меню, баннеры, скрипты и подвал, а модели, которая читает сайт в ответ на вопрос пользователя, нужна суть. Файл llms.txt даёт ей короткий конспект и ссылки на чистые версии страниц.

По спецификации файл устроен так:

  1. Заголовок первого уровня с названием сайта или проекта. Это единственный обязательный элемент.
  2. Цитата-блок с кратким описанием проекта.
  3. Необязательный текст с пояснениями: абзацы и списки, но без заголовков.
  4. Разделы со вторым уровнем заголовков, внутри которых списки ссылок в формате Markdown, при желании с пояснением после двоеточия.
  5. Раздел «Optional» для второстепенных ссылок, которые модель может пропустить, если ей нужен короткий контекст.

Файл можно положить в корень (/llms.txt) или в подпапку, и тогда он относится к страницам внутри неё. Если подходящих файлов несколько, по замыслу авторов берётся наиболее специфичный.

Читают ли llms.txt поисковые системы и ИИ-ассистенты?

Нет подтверждения, что Google учитывает llms.txt: в справке поисковика о работе в ИИ-функциях такого файла нет, зато есть прямое указание, что новые машиночитаемые файлы не требуются. В документе Google «AI features and your website» сказано, что для показа в AI Overviews и AI Mode не нужны ни дополнительные технические требования, ни специальные оптимизации, ни новые «текстовые файлы для ИИ». Первоисточник: справка Google об ИИ-функциях поиска.

Это важный момент для Казахстана, где значительная часть аудитории всё ещё приходит через обычный поиск Google и Яндекса, а ИИ-обзоры работают поверх того же индекса. Если страница не проиндексирована или показывается без сниппета, она не попадёт и в ИИ-ответ. Никакой файл этого не исправит.

Что с остальными системами? Заявлений от крупных поставщиков ассистентов, что llms.txt входит в их правила выбора источников, мы не нашли, а бездоказательным утверждениям вида «после добавления файла видимость выросла на столько-то процентов» верить не стоит: у таких цифр обычно нет методики. Честная формулировка звучит так: файл ничего не ломает, стоит недорого, пользу для ИИ-поиска никто официально не подтвердил.

Единственная ситуация, где llms.txt уже полезен на практике, это работа с ассистентами для разработчиков. Если у вас есть техническая документация или API, чистый конспект со ссылками на Markdown-версии помогает инструментам, которые читают документацию по запросу. Для сайта услуг с каталогом и блогом выгода заметно скромнее.

Нужна ли разметка schema.org для ИИ-поиска?

Разметка schema.org — это словарь, с помощью которого в коде страницы помечают, что перед поисковиком: статья, организация, товар, вопрос с ответом. Для ИИ-поиска Google не требует какой-то особой схемы: в той же справке сказано, что специального структурированного описания для AI Overviews добавлять не нужно. Но это не значит, что разметка бесполезна.

У неё две реальные задачи. Первая: помочь поисковику однозначно понять, о чём страница, кто автор, какая у компании организация, когда материал опубликован и обновлён. Это общие принципы работы со структурированными данными, их описывает введение в структурированные данные Google. Вторая: получить расширенные элементы в выдаче там, где они ещё поддерживаются.

Здесь нужна оговорка про разметку FAQPage, которая годами была самой популярной. Google объявил, что расширенный результат с вопросами и ответами перестал показываться с 7 мая 2026 года, а его описание убрали из документации в июне 2026 года (страница о FAQ в справке Google). До этого с сентября 2023 года он и так показывался только авторитетным государственным сайтам и сайтам о здоровье. Обычному сайту компании ждать от этой разметки сниппета с раскрывающимися вопросами больше не приходится.

Значит ли это, что FAQ-блок на странице надо убирать? Нет. Видимый блок «Частые вопросы» с самодостаточными ответами по-прежнему полезен: он закрывает разговорные запросы и даёт ассистенту готовые короткие фрагменты. Бесполезной стала только ставка на красивый сниппет за счёт разметки.

Что реально влияет на попадание в ИИ-ответы

Реально работают четыре вещи: доступность страницы для краулера, ясный текст с прямым ответом, проверяемые факты со ссылками на первоисточники и понятное владельцу сайта управление сниппетами. Сводка по инструментам, о которых обычно спорят:

Инструмент Что подтверждено официально Что делать
Индексация и сниппет Google требует, чтобы страница была проиндексирована и могла показываться со сниппетом Проверить robots.txt, noindex, ошибки сервера в Search Console
llms.txt Спецификация есть, учёт со стороны Google в справке не заявлен Необязательно: по желанию, после основных работ
Разметка schema.org Специальной схемы для ИИ-функций нет; разметка должна описывать то, что видно на странице Article, Organization, BreadcrumbList; без выдуманных полей
Разметка FAQPage Расширенный результат в Google отключён с 7 мая 2026 года Не рассчитывать на сниппет; видимый FAQ оставить
Управление показом Работают nosnippet, data-nosnippet, max-snippet, noindex Использовать только если действительно нужно ограничить показ
Google-Extended Токен в robots.txt для обучения и привязки Gemini к данным; на включение в поиск не влияет Решение о политике использования контента

Если смотреть на таблицу глазами руководителя, то вывод такой: первая строка важнее всех остальных вместе взятых. Сначала нужно, чтобы поисковик вообще мог взять страницу, и только потом имеет смысл тратить бюджет на файлы и разметку.

Как проверить, что боты видят ваш сайт

Проверка занимает около часа и начинается с robots.txt. Откройте вашдомен.kz/robots.txt и посмотрите, нет ли строк Disallow: / для всех роботов или для нужных разделов (услуги, блог, каталог). Этот файл управляет сканированием, и принципы его работы описаны в введении в robots.txt от Google. После переезда на новый движок, редизайна или запуска сайта на тестовом домене именно здесь чаще всего находится запрет, который забыли снять.

Дальше по шагам:

  1. В Google Search Console откройте отчёт «Страницы» и найдите, какие важные URL значатся как «Заблокировано в robots.txt», «Исключено тегом noindex» или «Просканировано, но пока не проиндексировано».
  2. Проверьте через инструмент проверки URL, что проверяемая страница индексируется и что Google видит основной текст, а не пустой шаблон. Если страница строится скриптами, сравните то, что видит человек, с тем, что отдаёт сервер в исходном коде.
  3. Убедитесь, что текст не спрятан внутри элементов, которые рендерятся только после клика. Раскрывающийся ответ в аккордеоне должен лежать в коде страницы, а не подгружаться отдельным запросом.
  4. Проверьте в Яндекс Вебмастере, что страницы находятся в поиске и что нет ошибок сканирования: для российскоязычного поиска в Казахстане это второй канал, которым нельзя пренебрегать.
  5. Если на сайте стоит защита от ботов, например на уровне хостинга или CDN, посмотрите логи: часть сервисов отдаёт поисковым роботам ошибку 403 или страницу проверки, и тогда страница для них недоступна.

Токен Google-Extended стоит упомянуть отдельно. Это не краулер, а директива для robots.txt: по справке Google, она определяет, может ли контент, уже сканируемый Google, использоваться для обучения будущих моделей Gemini и для привязки ответов к данным. На попадание в обычный поиск и на ранжирование она не влияет (список краулеров и токенов Google). То есть запрет через этот токен не выведет сайт из выдачи, но и разрешение не гарантирует ссылку в ответе ассистента. Решать, разрешать ли использование контента для обучения, должен владелец сайта в зависимости от политики компании.

Как составить llms.txt, если вы всё же решили его сделать

Если файл нужен как дешёвая страховка или у вас есть документация, собрать его можно за час. Порядок действий:

  1. Выберите 10–20 страниц, которые лучше всего отвечают на вопросы клиентов: основные услуги, цены (если они открыты и актуальны), условия работы, ответы на частые вопросы, контакты.
  2. Напишите заголовок первого уровня с названием компании и цитату-блок из двух-трёх предложений: что вы делаете, для кого, в каком регионе.
  3. Сгруппируйте ссылки по разделам со вторым уровнем заголовков и к каждой добавьте короткое пояснение после двоеточия, что именно на странице.
  4. Второстепенное вынесите в раздел «Optional».
  5. Положите файл в корень сайта так, чтобы он открывался по адресу вашдомен.kz/llms.txt как обычный текст, и убедитесь, что он не закрыт в robots.txt.
  6. Включите файл в график проверок: каждый раз, когда страница уходит с сайта или меняет адрес, ссылка в файле должна обновляться.

Пример структуры для сайта агентства:

# Название компании

> Агентство в Алматы: поддержка Битрикс24, разработка сайтов, контекстная реклама и SEO. Работаем с компаниями по всему Казахстану.

## Услуги
- [Техподдержка Битрикс24](https://example.kz/support/): что входит, как подать заявку
- [Разработка сайтов](https://example.kz/sites/): этапы, сроки, технологии

## Материалы
- [Как выбрать подрядчика](https://example.kz/blog/podryadchik/): критерии и чек-лист

## Optional
- [О компании](https://example.kz/about/)

Не вставляйте в файл ничего, чего нет на сайте. Если в нём написано одно, а на странице другое, вы создаёте источник путаницы, а не помощника. Именно поэтому описания и цены в нём должны совпадать с живыми страницами.

С чего начать сайту компании в Казахстане: порядок работ

Лучше начинать с содержимого страниц, а не с файлов. По нашему опыту, основная потеря видимости в ИИ-ответах связана не с отсутствием llms.txt, а с тремя причинами: нет прямого ответа в начале страницы, нет конкретики (сроки, условия, названия) и нет подтверждений вроде ссылок на официальные документы. Для запросов, которые люди задают ассистентам, действует простая логика: ответ берётся из фрагмента, который можно вырезать из страницы без потери смысла.

Рабочий порядок для сайта услуг:

  1. Откройте доступ: robots.txt, noindex, ошибки сканирования, карта сайта.
  2. Перепишите первые абзацы ключевых страниц: прямой ответ на вопрос из заголовка в два-три предложения, без вступлений.
  3. Добавьте конкретику, привязанную к региону: тенге, местные требования, примеры казахстанских компаний, если они у вас есть и подтверждены.
  4. Поставьте внешние ссылки на первоисточники там, где приводите цифры и правила: справка вендора, документация, официальная статистика.
  5. Настройте разметку Article и Organization так, чтобы она точно совпадала с видимыми данными: автор, даты, название организации, логотип.
  6. Добавьте llms.txt, если на предыдущие шаги уже потрачено время и бюджет остался.

Если у вас нет ресурса, чтобы разобраться со всем этим самим, начните с аудита: наши специалисты проверят доступность страниц для поисковых роботов, структуру текстов и разметку, а затем составят приоритетный список правок. Заказать такую проверку можно на странице SEO-продвижение сайта.

Типичные ошибки при подготовке сайта к ИИ-поиску

Самая частая ошибка: считать файл или разметку заменой текста. Ассистент не цитирует то, чего нет на странице, а разметка, расходящаяся с видимым содержимым, нарушает рекомендации Google: структурированные данные должны описывать контент, который реально показывается пользователю.

Вторая ошибка: массово генерировать страницы «под вопросы нейросетей» без экспертизы. Такой контент отвечает на запрос, но не отвечает на вопрос «почему вам стоит доверять», а это решающий фактор и для людей, и для поисковых систем.

Третья: закрыть сайт от всех ботов «чтобы нейросети не воровали тексты» и удивляться, что страницы пропали из поиска. Если вам нужно ограничить обучение моделей, это делается отдельными директивами для конкретных токенов, а не общим запретом сканирования.

Четвёртая: менять структуру сайта без переадресаций. Старые адреса, на которые ссылались другие сайты и которые уже попали в ответы ассистентов, начинают возвращать ошибку, и накопленная видимость теряется. Любой переезд, включая редизайн, нужно планировать вместе со списком редиректов.

Пятая: измерять результат по ощущениям. Чтобы понять, приводят ли ИИ-ответы людей на сайт, нужны метки в аналитике, отчёты по источникам трафика и регулярные ручные проверки: раз в месяц задайте ассистенту 10–15 вопросов, которые задают ваши клиенты, и зафиксируйте, названа ли ваша компания и дана ли ссылка. Ведите этот список в таблице, чтобы видеть динамику.

Когда файл и разметка всё же имеют смысл

Если у вас много технической документации, интернет-магазин с большим каталогом или сервис с API, то аккуратный llms.txt со ссылками на чистые Markdown-версии страниц можно считать полезным вложением: он упрощает жизнь инструментам, которые читают документацию. Если у компании сложная структура брендов и юрлиц, пригодится разметка Organization с перечнем официальных профилей: она помогает однозначно связать сайт с компанией.

Для типового сайта услуг в Казахстане разумнее потратить те же часы на переписывание ключевых страниц и на техническую проверку. Файл можно добавить следом, когда база готова: вреда от него нет, но и чудес ждать не стоит.

Отдельно скажу про ожидания от сроков. Изменения в тексте и доступности страниц Google подхватывает при следующем сканировании, а справка предупреждает, что после правки настроек показа пересканирование может занять от нескольких дней до нескольких месяцев. Поэтому оценивать эффект через неделю после правок бессмысленно: фиксируйте исходные позиции и ответы ассистентов сегодня, а сравнивайте через два-три месяца. Так вы увидите, какие именно изменения дали результат, и не будете ломать рабочие страницы ради быстрого эффекта.

Частые вопросы

Нужен ли llms.txt, чтобы сайт попал в ответы ChatGPT и Google?

Нет, обязательным он не является. Google в своей справке пишет, что для AI Overviews и AI Mode не требуются ни новые файлы для ИИ, ни специальная разметка, а нужна лишь индексация страницы со сниппетом. Подтверждённых заявлений о том, что основные ассистенты выбирают источники по llms.txt, мы не нашли, поэтому файл стоит считать необязательным дополнением.

Можно ли навредить сайту, если добавить llms.txt?

Вреда от самого файла нет: он лежит отдельно от страниц и не влияет на индексацию. Риск появляется, только если в нём устаревшие ссылки или описания, которые расходятся с сайтом. Поэтому после создания файла его нужно сверять со страницами при каждом изменении структуры или цен.

Нужна ли разметка FAQPage, если расширенный результат отключён?

Для получения сниппета в Google она не нужна: расширенный результат с вопросами и ответами перестал показываться с 7 мая 2026 года. Видимый блок «Частые вопросы» на странице при этом оставьте, он по-прежнему помогает читателям и даёт ассистентам готовые короткие ответы. Разметка допустима, если она точно повторяет видимый текст.

Как узнать, что страница доступна для поискового робота Google?

Откройте Google Search Console, введите адрес страницы в инструмент проверки URL и посмотрите, проиндексирована ли она и какой текст видит робот. Дополнительно проверьте файл robots.txt и тег noindex: страница, закрытая от сканирования или индексации, не попадёт ни в обычную выдачу, ни в ИИ-обзоры.

Закрывает ли Google-Extended сайт от поиска?

Нет, это директива только для использования контента в обучении и привязке ответов моделей Gemini. По справке Google, она не влияет на включение сайта в Google Поиск и не является сигналом ранжирования. Запрещать её или нет, решает владелец сайта по своей политике использования контента.

Прокрутить вверх