Для попадания в ИИ-ответы сайту не нужен ни файл llms.txt, ни особая разметка: Google прямо пишет, что для AI Overviews и AI Mode никаких дополнительных требований и специальных оптимизаций нет. Страница должна быть доступна для индексации и показываться в поиске со сниппетом. Всё остальное сводится к тому, насколько ясно и проверяемо написан сам текст.
Типичная картина на проектах B2BPRO.KZ выглядит так. Владелец сайта прочитал, что «под нейросети теперь нужен отдельный файл», заказал его у подрядчика, а потом выяснилось, что половина страниц закрыта в robots.txt, FAQ спрятан в раскрывающиеся блоки без текста в коде, а ответа на главный вопрос клиента нет нигде. Файл лежит в корне, трафика из ИИ нет. Ниже разбираем, что из модных рекомендаций работает, что нет и в каком порядке вкладывать время.
Что такое llms.txt и откуда он взялся
llms.txt — это текстовый файл в формате Markdown, который лежит в корне сайта и коротко объясняет языковым моделям, о чём сайт и где на нём главные материалы. Предложил формат Джереми Ховард, спецификация опубликована 3 сентября 2024 года и размещена на сайте llmstxt.org. Стандартом в смысле W3C или IETF он не является: это открытое предложение, которое каждый сайт и каждая система принимают или игнорируют по своему усмотрению.
Идея простая. Обычная HTML-страница содержит меню, баннеры, скрипты и подвал, а модели, которая читает сайт в ответ на вопрос пользователя, нужна суть. Файл llms.txt даёт ей короткий конспект и ссылки на чистые версии страниц.
По спецификации файл устроен так:
- Заголовок первого уровня с названием сайта или проекта. Это единственный обязательный элемент.
- Цитата-блок с кратким описанием проекта.
- Необязательный текст с пояснениями: абзацы и списки, но без заголовков.
- Разделы со вторым уровнем заголовков, внутри которых списки ссылок в формате Markdown, при желании с пояснением после двоеточия.
- Раздел «Optional» для второстепенных ссылок, которые модель может пропустить, если ей нужен короткий контекст.
Файл можно положить в корень (/llms.txt) или в подпапку, и тогда он относится к страницам внутри неё. Если подходящих файлов несколько, по замыслу авторов берётся наиболее специфичный.
Читают ли llms.txt поисковые системы и ИИ-ассистенты?
Нет подтверждения, что Google учитывает llms.txt: в справке поисковика о работе в ИИ-функциях такого файла нет, зато есть прямое указание, что новые машиночитаемые файлы не требуются. В документе Google «AI features and your website» сказано, что для показа в AI Overviews и AI Mode не нужны ни дополнительные технические требования, ни специальные оптимизации, ни новые «текстовые файлы для ИИ». Первоисточник: справка Google об ИИ-функциях поиска.
Это важный момент для Казахстана, где значительная часть аудитории всё ещё приходит через обычный поиск Google и Яндекса, а ИИ-обзоры работают поверх того же индекса. Если страница не проиндексирована или показывается без сниппета, она не попадёт и в ИИ-ответ. Никакой файл этого не исправит.
Что с остальными системами? Заявлений от крупных поставщиков ассистентов, что llms.txt входит в их правила выбора источников, мы не нашли, а бездоказательным утверждениям вида «после добавления файла видимость выросла на столько-то процентов» верить не стоит: у таких цифр обычно нет методики. Честная формулировка звучит так: файл ничего не ломает, стоит недорого, пользу для ИИ-поиска никто официально не подтвердил.
Единственная ситуация, где llms.txt уже полезен на практике, это работа с ассистентами для разработчиков. Если у вас есть техническая документация или API, чистый конспект со ссылками на Markdown-версии помогает инструментам, которые читают документацию по запросу. Для сайта услуг с каталогом и блогом выгода заметно скромнее.
Нужна ли разметка schema.org для ИИ-поиска?
Разметка schema.org — это словарь, с помощью которого в коде страницы помечают, что перед поисковиком: статья, организация, товар, вопрос с ответом. Для ИИ-поиска Google не требует какой-то особой схемы: в той же справке сказано, что специального структурированного описания для AI Overviews добавлять не нужно. Но это не значит, что разметка бесполезна.
У неё две реальные задачи. Первая: помочь поисковику однозначно понять, о чём страница, кто автор, какая у компании организация, когда материал опубликован и обновлён. Это общие принципы работы со структурированными данными, их описывает введение в структурированные данные Google. Вторая: получить расширенные элементы в выдаче там, где они ещё поддерживаются.
Здесь нужна оговорка про разметку FAQPage, которая годами была самой популярной. Google объявил, что расширенный результат с вопросами и ответами перестал показываться с 7 мая 2026 года, а его описание убрали из документации в июне 2026 года (страница о FAQ в справке Google). До этого с сентября 2023 года он и так показывался только авторитетным государственным сайтам и сайтам о здоровье. Обычному сайту компании ждать от этой разметки сниппета с раскрывающимися вопросами больше не приходится.
Значит ли это, что FAQ-блок на странице надо убирать? Нет. Видимый блок «Частые вопросы» с самодостаточными ответами по-прежнему полезен: он закрывает разговорные запросы и даёт ассистенту готовые короткие фрагменты. Бесполезной стала только ставка на красивый сниппет за счёт разметки.
Что реально влияет на попадание в ИИ-ответы
Реально работают четыре вещи: доступность страницы для краулера, ясный текст с прямым ответом, проверяемые факты со ссылками на первоисточники и понятное владельцу сайта управление сниппетами. Сводка по инструментам, о которых обычно спорят:
| Инструмент | Что подтверждено официально | Что делать |
|---|---|---|
| Индексация и сниппет | Google требует, чтобы страница была проиндексирована и могла показываться со сниппетом | Проверить robots.txt, noindex, ошибки сервера в Search Console |
| llms.txt | Спецификация есть, учёт со стороны Google в справке не заявлен | Необязательно: по желанию, после основных работ |
| Разметка schema.org | Специальной схемы для ИИ-функций нет; разметка должна описывать то, что видно на странице | Article, Organization, BreadcrumbList; без выдуманных полей |
| Разметка FAQPage | Расширенный результат в Google отключён с 7 мая 2026 года | Не рассчитывать на сниппет; видимый FAQ оставить |
| Управление показом | Работают nosnippet, data-nosnippet, max-snippet, noindex | Использовать только если действительно нужно ограничить показ |
| Google-Extended | Токен в robots.txt для обучения и привязки Gemini к данным; на включение в поиск не влияет | Решение о политике использования контента |
Если смотреть на таблицу глазами руководителя, то вывод такой: первая строка важнее всех остальных вместе взятых. Сначала нужно, чтобы поисковик вообще мог взять страницу, и только потом имеет смысл тратить бюджет на файлы и разметку.
Как проверить, что боты видят ваш сайт
Проверка занимает около часа и начинается с robots.txt. Откройте вашдомен.kz/robots.txt и посмотрите, нет ли строк Disallow: / для всех роботов или для нужных разделов (услуги, блог, каталог). Этот файл управляет сканированием, и принципы его работы описаны в введении в robots.txt от Google. После переезда на новый движок, редизайна или запуска сайта на тестовом домене именно здесь чаще всего находится запрет, который забыли снять.
Дальше по шагам:
- В Google Search Console откройте отчёт «Страницы» и найдите, какие важные URL значатся как «Заблокировано в robots.txt», «Исключено тегом noindex» или «Просканировано, но пока не проиндексировано».
- Проверьте через инструмент проверки URL, что проверяемая страница индексируется и что Google видит основной текст, а не пустой шаблон. Если страница строится скриптами, сравните то, что видит человек, с тем, что отдаёт сервер в исходном коде.
- Убедитесь, что текст не спрятан внутри элементов, которые рендерятся только после клика. Раскрывающийся ответ в аккордеоне должен лежать в коде страницы, а не подгружаться отдельным запросом.
- Проверьте в Яндекс Вебмастере, что страницы находятся в поиске и что нет ошибок сканирования: для российскоязычного поиска в Казахстане это второй канал, которым нельзя пренебрегать.
- Если на сайте стоит защита от ботов, например на уровне хостинга или CDN, посмотрите логи: часть сервисов отдаёт поисковым роботам ошибку 403 или страницу проверки, и тогда страница для них недоступна.
Токен Google-Extended стоит упомянуть отдельно. Это не краулер, а директива для robots.txt: по справке Google, она определяет, может ли контент, уже сканируемый Google, использоваться для обучения будущих моделей Gemini и для привязки ответов к данным. На попадание в обычный поиск и на ранжирование она не влияет (список краулеров и токенов Google). То есть запрет через этот токен не выведет сайт из выдачи, но и разрешение не гарантирует ссылку в ответе ассистента. Решать, разрешать ли использование контента для обучения, должен владелец сайта в зависимости от политики компании.
Как составить llms.txt, если вы всё же решили его сделать
Если файл нужен как дешёвая страховка или у вас есть документация, собрать его можно за час. Порядок действий:
- Выберите 10–20 страниц, которые лучше всего отвечают на вопросы клиентов: основные услуги, цены (если они открыты и актуальны), условия работы, ответы на частые вопросы, контакты.
- Напишите заголовок первого уровня с названием компании и цитату-блок из двух-трёх предложений: что вы делаете, для кого, в каком регионе.
- Сгруппируйте ссылки по разделам со вторым уровнем заголовков и к каждой добавьте короткое пояснение после двоеточия, что именно на странице.
- Второстепенное вынесите в раздел «Optional».
- Положите файл в корень сайта так, чтобы он открывался по адресу
вашдомен.kz/llms.txtкак обычный текст, и убедитесь, что он не закрыт в robots.txt. - Включите файл в график проверок: каждый раз, когда страница уходит с сайта или меняет адрес, ссылка в файле должна обновляться.
Пример структуры для сайта агентства:
# Название компании > Агентство в Алматы: поддержка Битрикс24, разработка сайтов, контекстная реклама и SEO. Работаем с компаниями по всему Казахстану. ## Услуги - [Техподдержка Битрикс24](https://example.kz/support/): что входит, как подать заявку - [Разработка сайтов](https://example.kz/sites/): этапы, сроки, технологии ## Материалы - [Как выбрать подрядчика](https://example.kz/blog/podryadchik/): критерии и чек-лист ## Optional - [О компании](https://example.kz/about/)
Не вставляйте в файл ничего, чего нет на сайте. Если в нём написано одно, а на странице другое, вы создаёте источник путаницы, а не помощника. Именно поэтому описания и цены в нём должны совпадать с живыми страницами.
С чего начать сайту компании в Казахстане: порядок работ
Лучше начинать с содержимого страниц, а не с файлов. По нашему опыту, основная потеря видимости в ИИ-ответах связана не с отсутствием llms.txt, а с тремя причинами: нет прямого ответа в начале страницы, нет конкретики (сроки, условия, названия) и нет подтверждений вроде ссылок на официальные документы. Для запросов, которые люди задают ассистентам, действует простая логика: ответ берётся из фрагмента, который можно вырезать из страницы без потери смысла.
Рабочий порядок для сайта услуг:
- Откройте доступ: robots.txt, noindex, ошибки сканирования, карта сайта.
- Перепишите первые абзацы ключевых страниц: прямой ответ на вопрос из заголовка в два-три предложения, без вступлений.
- Добавьте конкретику, привязанную к региону: тенге, местные требования, примеры казахстанских компаний, если они у вас есть и подтверждены.
- Поставьте внешние ссылки на первоисточники там, где приводите цифры и правила: справка вендора, документация, официальная статистика.
- Настройте разметку Article и Organization так, чтобы она точно совпадала с видимыми данными: автор, даты, название организации, логотип.
- Добавьте llms.txt, если на предыдущие шаги уже потрачено время и бюджет остался.
Если у вас нет ресурса, чтобы разобраться со всем этим самим, начните с аудита: наши специалисты проверят доступность страниц для поисковых роботов, структуру текстов и разметку, а затем составят приоритетный список правок. Заказать такую проверку можно на странице SEO-продвижение сайта.
Типичные ошибки при подготовке сайта к ИИ-поиску
Самая частая ошибка: считать файл или разметку заменой текста. Ассистент не цитирует то, чего нет на странице, а разметка, расходящаяся с видимым содержимым, нарушает рекомендации Google: структурированные данные должны описывать контент, который реально показывается пользователю.
Вторая ошибка: массово генерировать страницы «под вопросы нейросетей» без экспертизы. Такой контент отвечает на запрос, но не отвечает на вопрос «почему вам стоит доверять», а это решающий фактор и для людей, и для поисковых систем.
Третья: закрыть сайт от всех ботов «чтобы нейросети не воровали тексты» и удивляться, что страницы пропали из поиска. Если вам нужно ограничить обучение моделей, это делается отдельными директивами для конкретных токенов, а не общим запретом сканирования.
Четвёртая: менять структуру сайта без переадресаций. Старые адреса, на которые ссылались другие сайты и которые уже попали в ответы ассистентов, начинают возвращать ошибку, и накопленная видимость теряется. Любой переезд, включая редизайн, нужно планировать вместе со списком редиректов.
Пятая: измерять результат по ощущениям. Чтобы понять, приводят ли ИИ-ответы людей на сайт, нужны метки в аналитике, отчёты по источникам трафика и регулярные ручные проверки: раз в месяц задайте ассистенту 10–15 вопросов, которые задают ваши клиенты, и зафиксируйте, названа ли ваша компания и дана ли ссылка. Ведите этот список в таблице, чтобы видеть динамику.
Когда файл и разметка всё же имеют смысл
Если у вас много технической документации, интернет-магазин с большим каталогом или сервис с API, то аккуратный llms.txt со ссылками на чистые Markdown-версии страниц можно считать полезным вложением: он упрощает жизнь инструментам, которые читают документацию. Если у компании сложная структура брендов и юрлиц, пригодится разметка Organization с перечнем официальных профилей: она помогает однозначно связать сайт с компанией.
Для типового сайта услуг в Казахстане разумнее потратить те же часы на переписывание ключевых страниц и на техническую проверку. Файл можно добавить следом, когда база готова: вреда от него нет, но и чудес ждать не стоит.
Отдельно скажу про ожидания от сроков. Изменения в тексте и доступности страниц Google подхватывает при следующем сканировании, а справка предупреждает, что после правки настроек показа пересканирование может занять от нескольких дней до нескольких месяцев. Поэтому оценивать эффект через неделю после правок бессмысленно: фиксируйте исходные позиции и ответы ассистентов сегодня, а сравнивайте через два-три месяца. Так вы увидите, какие именно изменения дали результат, и не будете ломать рабочие страницы ради быстрого эффекта.
Частые вопросы
Нужен ли llms.txt, чтобы сайт попал в ответы ChatGPT и Google?
Нет, обязательным он не является. Google в своей справке пишет, что для AI Overviews и AI Mode не требуются ни новые файлы для ИИ, ни специальная разметка, а нужна лишь индексация страницы со сниппетом. Подтверждённых заявлений о том, что основные ассистенты выбирают источники по llms.txt, мы не нашли, поэтому файл стоит считать необязательным дополнением.
Можно ли навредить сайту, если добавить llms.txt?
Вреда от самого файла нет: он лежит отдельно от страниц и не влияет на индексацию. Риск появляется, только если в нём устаревшие ссылки или описания, которые расходятся с сайтом. Поэтому после создания файла его нужно сверять со страницами при каждом изменении структуры или цен.
Нужна ли разметка FAQPage, если расширенный результат отключён?
Для получения сниппета в Google она не нужна: расширенный результат с вопросами и ответами перестал показываться с 7 мая 2026 года. Видимый блок «Частые вопросы» на странице при этом оставьте, он по-прежнему помогает читателям и даёт ассистентам готовые короткие ответы. Разметка допустима, если она точно повторяет видимый текст.
Как узнать, что страница доступна для поискового робота Google?
Откройте Google Search Console, введите адрес страницы в инструмент проверки URL и посмотрите, проиндексирована ли она и какой текст видит робот. Дополнительно проверьте файл robots.txt и тег noindex: страница, закрытая от сканирования или индексации, не попадёт ни в обычную выдачу, ни в ИИ-обзоры.
Закрывает ли Google-Extended сайт от поиска?
Нет, это директива только для использования контента в обучении и привязке ответов моделей Gemini. По справке Google, она не влияет на включение сайта в Google Поиск и не является сигналом ранжирования. Запрещать её или нет, решает владелец сайта по своей политике использования контента.
