Google в своём руководстве для владельцев сайтов прямо пишет, что поиск не использует llms.txt, — и это лучший повод наконец разобраться, зачем файл нужен и кому. llms.txt — это текстовый файл в формате Markdown, который лежит в корне сайта или в его разделе и коротко объясняет языковым моделям и AI-агентам, что это за сайт и по каким ссылкам искать подробности. Формат предложил исследователь Джереми Ховард в сентябре 2024 года, спецификация опубликована на llmstxt.org и в августе 2026 года получила вторую редакцию. Ниже — кто на сентябрь 2026 года подтверждённо читает llms.txt, а кто нет, как устроен файл по спецификации, как составить его за вечер, что в него не класть и как проверить, что он вообще кому-то нужен.
llms.txt — оглавление для агента, а не сигнал для поисковика
Проще всего понять llms.txt через то, чем он не является. Это не robots.txt: он ничего не разрешает и не запрещает. Это не sitemap.xml: он не перечисляет все страницы сайта. И это не метатег, который учитывается при ранжировании. llms.txt — это короткая записка для машины, которая уже пришла на сайт с конкретным вопросом и хочет быстро понять, куда смотреть.
Автор спецификации объясняет задачу так: страницы сайтов сделаны для людей, в них навигация, реклама и скрипты, а контекст языковой модели ограничен, и каждый лишний фрагмент стоит времени и денег. Поэтому агенту удобнее получить в одном месте сжатое описание и список ссылок, по которым лежит подробный текст. Спецификация прямо говорит, что файл рассчитан в первую очередь на использование во время ответа, а не на обучение моделей.
Я сравниваю llms.txt со справочным столом в библиотеке. Библиотекарь не пересказывает все книги, он говорит: вам про договоры — третий зал, вторая полка, и начните вот с этого сборника. Если справочного стола нет, читатель всё равно найдёт книгу, просто дольше и с шансом взять не ту. Если стол есть, но за ним сидит человек, который путает залы, — лучше бы его не было.
Отсюда главный вывод: llms.txt ничего не добавляет к содержанию сайта. Он только помогает агенту быстрее дойти до того, что на сайте уже есть. Если нужных фактов на страницах нет, файл их не создаст.
Кто читает llms.txt на сентябрь 2026 года: подтверждено и не подтверждено
Вокруг файла много уверенных обещаний, поэтому я разделил источники на две группы: что написано в документации самих компаний и что пересказывают статьи про GEO. Во второй группе встречаются утверждения вида «ChatGPT читает llms.txt в первую очередь», и подтверждения им в первоисточниках я не нашёл. В таблице — только первая группа.
| Система | Что известно из первоисточника | Вывод |
|---|---|---|
| Google Search | Руководство Search Central «Optimizing your website for generative AI features on Google Search» (обновлено 10 июля 2026 года): создавать машиночитаемые файлы, «AI-файлы» и Markdown для появления в поиске, включая его генеративные функции, не нужно, потому что поиск Google их не использует; файл не вредит и не помогает видимости | не читает для поиска |
| Яндекс | В тексте справки Яндекс Вебмастера на сентябрь 2026 года llms.txt не упоминается; для управления доступом описан robots.txt. При этом сама справка отдаёт свой llms.txt и Markdown-версии страниц | публикует для справки, поддержка в поиске не заявлена |
| Chrome Lighthouse | В категории проверок для агентного браузинга есть аудит llms.txt: файл должен отдаваться без ошибки сервера; по разборам аудита он также смотрит на заголовок первого уровня, ссылки в формате Markdown и минимальную длину; отсутствие файла считается «не применимо» | проверяет форму, не качество |
| Anthropic, Perplexity | Публикуют llms.txt для своей документации; в их справке о веб-роботах управление доступом описано через robots.txt, чтение llms.txt роботами не заявлено | публикуют, но не обещают читать |
| OpenAI, Gemini API | Сайт llmstxt.org называет их документацию среди тех, кто публикует llms.txt | публикуют |
| Агенты по запросу | По словам автора спецификации, чаще всего файл используют агенты для программирования, когда ищут документацию библиотек | подтверждённый сценарий |
Что это значит на практике. Подтверждённый читатель у llms.txt — агент, который во время работы сам решил или получил указание открыть файл: инструмент для разработчиков, подключённый к документации, или ассистент с доступом к интернету, которому пользователь дал ссылку. Плюс проверяльщики вроде Lighthouse. Поисковые индексы в этот список не входят: Google отказался прямо, Яндекс не высказывался.
Формат молодой, и позиции компаний меняются. Если кто-то из крупных игроков объявит поддержку, это будет новость с датой и ссылкой на документацию. Утверждение без такой ссылки — слух, даже если его повторяют десять агентств.
Публикуют — не значит читают
Самый частый аргумент в пользу файла звучит так: раз OpenAI, Anthropic и Google держат у себя llms.txt, значит, их нейросети его читают. Логика понятная, но это две разные вещи. Показательный пример — Яндекс: справка его Вебмастера отдаёт собственный llms.txt, а в тексте той же справки о поддержке файла поиском нет ни слова.
Компании публикуют llms.txt для своей документации для разработчиков. Там файл полезен по прямому назначению: программист подключает агента к документации API, и агент по оглавлению быстро находит нужный раздел. Многие такие файлы собирает сама площадка документации: на llmstxt.org перечислены сервисы, которые генерируют llms.txt автоматически, в том числе Mintlify и GitBook для документации, плагины Yoast SEO и AIOSEO для WordPress и конструктор Wix.
При этом в справке тех же компаний о своих веб-роботах управление доступом описано через robots.txt: Anthropic объясняет, как закрыть обход ClaudeBot, Claude-SearchBot и Claude-User, Perplexity описывает PerplexityBot и Perplexity-User. Утверждения «наш робот сначала читает llms.txt» там нет. Это не доказывает, что файл не читают никогда, но и обратного не доказывает.
Мой рабочий вывод: файл у производителя нейросети говорит, что формат удобен для документации, а не обещает, что его робот придёт к вам. Решать про llms.txt для коммерческого сайта нужно по цене поддержки, а не по этому аргументу.
Спецификация llms.txt требует одну строку, остальное — порядок и договорённость
Формат описан на llmstxt.org коротко, и его стоит прочитать целиком, это минут десять. Файл называется llms.txt и лежит либо в корне сайта, либо в любом разделе, например /docs/llms.txt. Файл описывает страницы под своим путём; если подходят несколько файлов, агенту следует брать самый конкретный.
Внутри — Markdown в строгом порядке:
- Заголовок первого уровня с названием проекта или сайта. Это единственный обязательный элемент.
- Цитата — строка, начинающаяся с символа «>», — с кратким описанием: то, без чего остальной файл не понять.
- Любое количество абзацев или списков без заголовков: подробности о проекте и о том, как читать ссылки ниже.
- Любое количество разделов с заголовками второго уровня, в каждом — список ссылок в формате [название](адрес), после которого можно поставить двоеточие и пояснение.
Раздел с заголовком «Optional» по соглашению содержит второстепенные ссылки, которые агент может пропустить, если контекст нужен короче.
Вторая часть предложения касается самих страниц. Спецификация советует отдавать чистую Markdown-версию страницы по тому же адресу с добавленным .md (page.html.md) или с заменой расширения (page.md). Чтобы агент нашёл эти файлы, во второй редакции рекомендованы стандартные связи: rel="alternate" type="text/markdown" указывает на Markdown-версию страницы, rel="describedby" — на llms.txt, который её описывает. Их можно поставить тегом link в HTML или HTTP-заголовком Link, который настраивается на сервере без правки страниц.
Про llms-full.txt — файл, куда сложен весь текст документации, — во второй редакции спецификации ничего нет. Его выкладывают многие сайты документации: например, у Perplexity такой файл весит больше четырёх мегабайт. Для сайта компании с десятками страниц он не нужен.
Наш собственный llms.txt нарушает главный принцип спецификации
Честнее начать с себя. Спецификация отдельно подчёркивает, что сам файл остаётся достаточно маленьким, чтобы поместиться в контекст модели, а подробности живут за ссылками. sitemap.xml перечисляет все индексируемые страницы, llms.txt должен показывать главное.
На сайте 404ai файл устроен наоборот. На 14 сентября 2026 года в нём больше 330 строк, около 95 тысяч знаков и 285 ссылок при 283 адресах в sitemap.xml: ссылка есть на каждый адрес карты сайта, а некоторые страницы упомянуты дважды. Так получилось не случайно: файл сначала вёлся вручную и отставал от сайта, и мы добавили в сборку скрипт, который дописывает в llms.txt каждую недостающую страницу из sitemap с её заголовком и описанием. Задачу «ни одна страница не потеряна» это решило. Задачу «агент за минуту понимает, куда смотреть» — скорее ухудшило: файл больше чем в четыре раза длиннее этой статьи.
Вторая проблема — устаревание ручной части. Скрипт дописывает только новые адреса, а написанные вручную описания не трогает. Когда линейка продуктов или цены меняются, эти строки приходится исправлять руками, и до исправления файл расходится с сайтом: с нашим так и было, пока готовилась эта статья. Человек такое противоречие заметит и перепроверит. Модель может взять из файла ту версию, которая сформулирована увереннее.
Эффект нашего файла на ответы нейросетей мы не измеряли и не знаем, есть ли он. Поэтому пример ниже — не «делайте как мы, это работает», а сокращённая версия, какой файл должен быть по спецификации. Свой файл мы будем приводить к ней же.
Как составить llms.txt за вечер: пять шагов
Шаг 1. Ответьте на вопрос, кто и зачем будет читать файл. Для сайта документации это разработчик с агентом. Для коммерческого сайта — ассистент, которого клиент спросил о вас или о вашей задаче. От ответа зависит, что важнее: разделы API или описание услуг, условий и географии.
Шаг 2. Напишите одно описание компании для цитаты. Два-три предложения: кто вы, что делаете, для кого, где работаете. Формулировка «X — это …» здесь уместнее всего. Проверка простая: если прочитать только эту цитату, ассистент должен правильно ответить на вопрос «чем занимается компания».
Шаг 3. Добавьте то, что модель иначе перепутает. Это абзац без заголовка: неочевидные названия продуктов, различия между похожими услугами, чем вы не занимаетесь. Именно здесь llms.txt полезнее всего, потому что путаница в названиях — частая причина уверенно неверных ответов, о природе которых подробно написано в статье почему нейросеть уверенно выдумывает.
Шаг 4. Отберите ссылки, а не выгрузите их. Для сайта компании обычно хватает 10–30 ссылок: страницы услуг или продуктов, цены, как вы работаете, кейсы, контакты, ключевые справочные материалы. У каждой ссылки — одно пояснение, что человек или агент найдёт по ней. Статьи блога и второстепенные страницы — в раздел «Optional» или вообще не включать: для полного списка у вас уже есть sitemap.
Шаг 5. Разложите файл и привяжите его к процессу. Файл кладётся в корень сайта, отдаётся как текст с кодировкой UTF-8, иначе кириллица может превратиться в набор символов. И сразу договоритесь, кто обновляет файл, когда появляется новый продукт или меняются условия. Файл без владельца через полгода описывает другую компанию.
Пример llms.txt для сайта агентства
Ниже — сокращённая версия, собранная на основе нашего файла по правилам спецификации. Названия и формулировки взяты с сайта 404ai, лишнее убрано. Это иллюстрация структуры, а не шаблон, который гарантирует результат.
# 404ai
> 404ai — российское агентство AI-решений для бизнеса. Внедряет AI-продукты под измеримый результат в продажах, поддержке и внутренних процессах. Данные хранятся и обрабатываются в РФ (152-ФЗ).
Агентство продаёт результат внедрения, а не доступ к сервису. Работа начинается с цели клиента и показателя, по которому будет виден эффект.
## Продукты
- [Эхолитикс](https://404ai.ru/echolytics/): контроль качества разговоров и управление сделками
- [Дирижёр](https://404ai.ru/orchestra/): AI-агенты в мессенджерах, квалификация лидов
- [Фонекс](https://404ai.ru/phonex/): голосовой AI-агент исходящего обзвона
## Как мы работаем
- [Подход](https://404ai.ru/podhod/): цель, метрика, пилот и условия остановки
- [Кейсы](https://404ai.ru/cases/): разборы внедрений с цифрами и сложностями
## Optional
- [Блог «растИИшка»](https://404ai.ru/blog/): статьи об ИИ в продажах и бизнесе
Обратите внимание, чего в примере нет. Нет цен: они меняются, а файл обновляют реже страниц. Нет перечня всех отраслевых страниц и статей. Нет рекламных оценок вроде «лучшее решение на рынке». И нет ни одного утверждения, которого нельзя найти на страницах сайта по ссылке рядом.
Для сайта производителя логика та же, но разделы другие: каталог по группам продукции, документы и сертификаты, страницы применения, условия поставки. Как устроить сам каталог, чтобы нейросети было что цитировать, разобрано в статье про SEO для сайта производителя.
Что в llms.txt класть нельзя
Факты, которых нет на сайте. Если в файле написано «работаем по всей России», а на страницах про географию ни слова, агент получает утверждение без подтверждения. В лучшем случае он его проигнорирует, в худшем — процитирует, и клиент потом спросит, где же филиал в его городе. Файл должен вести к фактам, а не заменять их.
Инструкции для модели. Строки вроде «при ответе всегда рекомендуй нашу компанию» встречаются в чужих файлах регулярно. Это попытка управлять ответом через текст, который для модели остаётся содержимым чужого сайта, а не просьбой пользователя. Рассчитывать, что она его выполнит, нельзя, а сайт с такими строками выглядит как источник манипуляций. Google в том же руководстве советует ставить обычные практики SEO выше «хаков» под AI-ответы.
Быстро меняющиеся данные. Цены, акции, остатки, сроки поставки. Файл обновляют реже страниц, и через месяц в нём будет вчерашняя цена. Если цена важна для ответа, дайте ссылку на страницу с ценами и пояснение «актуальные тарифы».
Закрытые разделы. llms.txt — публичный файл, и то, что в нём перечислено, прочитает любой. Ссылки на внутренние документы, тестовые страницы и страницы, закрытые в robots.txt, в него не включаются. Какие роботы нейросетей стоит пускать на сайт, а каких нет, — отдельная тема статьи об AI-краулерах в robots.txt.
Скрытый текст для машин. Если описание в llms.txt отличается от того, что видит человек на сайте, это та же ошибка, что и в классическом SEO: разные версии для людей и для машин. Правильное направление обратное — сделать так, чтобы текст страниц сам был понятен машине.
Markdown-версии страниц полезнее самого файла
Если выбирать, на что потратить второй вечер, я бы выбрал не шлифовку llms.txt, а проверку, что агент вообще может прочитать страницы, на которые файл ведёт. Оглавление с ссылками на страницы, где текст подгружается скриптом, бесполезно: часть агентов получает только HTML из первого ответа сервера и скрипты не исполняют.
Markdown-версии страниц по спецификации решают эту проблему радикально: агент получает чистый текст без меню, форм и счётчиков. Для сайта документации их обычно генерирует сама площадка. Для статического сайта их можно собрать при сборке из HTML. Для сайта на конструкторе это часто невозможно, и тогда главная задача — чтобы основной текст был в HTML, а не в скриптах.
Проверка занимает минуту: откройте «просмотр кода» страницы (не инструменты разработчика) и найдите в нём фразу из основного текста. Если фразы нет, для таких агентов страница пустая, и никакой llms.txt этого не исправит. Общие правила, как писать текст, который нейросети цитируют, собраны в статье GEO вместо SEO, здесь повторять их не буду.
Как проверить llms.txt: четыре проверки от простой к полезной
Проверка доступности. Откройте адрес вашсайт/llms.txt в браузере. Файл должен открыться как текст, без переадресации на главную и без ошибки, кириллица — читаться. Эту же проверку делает Lighthouse в разделе агентного браузинга, так что её можно автоматизировать вместе с остальными проверками сайта.
Проверка формата. Заголовок первого уровня — один и первым. Дальше цитата. Никаких заголовков третьего уровня между разделами. Каждая строка в списках начинается со ссылки в формате [название](адрес). Все ссылки открываются без ошибки; если файл собирается скриптом, проверку ссылок стоит добавить в сборку.
Проверка смыслом. Её предлагает сама спецификация: дайте агенту только ваш llms.txt и задайте вопросы о компании. Я бы составил 10–20 вопросов, которые реально задают клиенты: чем занимаетесь, работаете ли с таким-то типом клиентов, чем отличается продукт А от продукта Б, где посмотреть цены, есть ли примеры работ. Ответы сверяются с сайтом. Каждый неправильный ответ — строка, которую нужно дописать или переписать в файле.
Проверка спросом. Самая полезная, потому что отвечает на вопрос «читает ли кто-то файл вообще». Посмотрите журнал обращений веб-сервера: кто запрашивал /llms.txt за последний месяц. На nginx это одна команда вроде grep 'GET /llms.txt' /var/log/nginx/access.log | awk -F'"' '{print $6}' | sort | uniq -c | sort -rn, которая покажет, какие программы и сколько раз открывали файл. Свои собственные проверки и SEO-сервисы из подсчёта стоит исключить. Какие строки журнала относятся к роботам нейросетей и что каждый из них делает, разобрано в статье про AI-краулеры, ссылка на неё выше.
«Нормального» числа обращений нет: оно зависит от тематики и известности сайта. Важнее динамика и состав: появились ли в журнале агенты, которых не было, после того как файл обновили.
Возражение: если Google игнорирует файл, то зачем он
Возражение серьёзное, и я с ним частично согласен. Для большинства коммерческих сайтов в России основной источник обращений — поиск Яндекса и Google, и ни один из них не заявлял, что llms.txt влияет на выдачу или на AI-ответы в поиске. Google сказал обратное прямым текстом. Если бюджет на продвижение ограничен, файл не должен отнимать время у страниц, которые ищут люди.
Но из этого не следует, что файл бесполезен. Поисковый индекс — не единственный способ, которым модель узнаёт о сайте. Ассистент с доступом к интернету, агент в браузере, инструмент для закупщика, который собирает сведения о поставщиках, — все они приходят на сайт во время запроса. Для них оглавление экономит шаги, а точное описание снижает шанс перепутать ваши продукты.
Моя позиция такая. llms.txt — это гигиена стоимостью в один вечер и полчаса в квартал на обновление, а не канал продвижения. Делать его стоит, если он дешёв в поддержке. Ждать от него трафика нельзя. А продавать его клиенту как «попадание в ответы нейросетей» — нечестно: подтверждений такого эффекта в первоисточниках нет.
Когда llms.txt не нужен совсем
Сайт из нескольких страниц. Если у компании лендинг и три страницы услуг, агенту не нужно оглавление, он прочитает всё за один заход. Время лучше потратить на то, чтобы на этих страницах были конкретные факты текстом.
Страницы не читаются машиной. Если основной текст подгружается скриптами, а нужные роботы закрыты в robots.txt, файл ведёт в пустоту. Сначала доступность, потом оглавление.
На сайте нет того, о чём спрашивают. Нет цен даже вилкой, нет условий, нет примеров работ, нет понятного описания услуги. Никакое оглавление не поможет агенту найти то, чего нет. Каких страниц не хватает сайту и как это найти, разобрано в статье про контентные разрывы.
Некому поддерживать. Файл, который описывает прошлогодний ассортимент, хуже отсутствующего: он уверенно сообщает неправду от имени компании. Если у файла не будет владельца, лучше не выкладывать его вовсе или собирать автоматически из тех же данных, что и страницы.
Где файл, наоборот, окупается быстрее всего: документация и API, сайты с большой линейкой продуктов и неочевидными названиями, каталоги производителей со сложной номенклатурой, сервисы, у которых есть отдельный раздел для разработчиков. Там агент приходит часто и с конкретными вопросами.
Пилот на llms.txt: цель, метрика и условие остановки
Даже для мелкой задачи результат стоит определить заранее, иначе через месяц останется ощущение «вроде сделали что-то полезное». Мы работаем по методу «Цель → метрика» (как устроен подход), и для llms.txt он выглядит так.
Цель. Агент, у которого есть только llms.txt и доступ к ссылкам из него, правильно отвечает на вопросы клиентов о компании. Не «попасть в ответы нейросетей» — это зависит от слишком многого, — а убрать ошибки, причиной которых может быть сам сайт.
Метрики. Доля правильных ответов на ваш набор из 10–20 вопросов до и после составления файла. Число обращений к /llms.txt в журнале сервера за 30 дней, с разбивкой по программам. Число ошибок в ссылках файла при каждой сборке — должно быть ноль.
Условие остановки. Если за два месяца файл запрашивали только ваши собственные проверки и SEO-сервисы, дальнейшие вложения останавливаются на уровне поддержки: файл остаётся и обновляется, но Markdown-версии страниц и ручная шлифовка откладываются. Время уходит на страницы, которые читают люди и поисковики. Как понять, что нейросети вообще приводят вам посетителей, — в статье про трафик из нейросетей в аналитике.
llms.txt — небольшая часть технического слоя, который мы делаем в услуге «Генеративное SEO» вместе со страницами, семантикой и замером результата; как этот цикл устроен целиком, описано в статье о генеративном SEO. Отдельно от содержания сайта файл смысла не имеет.
Что сделать с llms.txt на этой неделе
Откройте вашсайт/llms.txt. Если файла нет, не спешите его заказывать: сначала задайте ассистенту с доступом в интернет пять вопросов о своей компании и запишите, где он ошибся. Эти ошибки и есть техническое задание на файл и на страницы.
Если файл есть, посчитайте в нём ссылки и сравните с числом страниц в sitemap. Если цифры почти совпадают, как было у нас, у вас не оглавление, а вторая карта сайта, и её стоит сократить до главного. Затем найдите в файле три утверждения о компании и проверьте, есть ли каждое на странице по ссылке рядом. И последнее: откройте журнал сервера и посмотрите, кто этот файл вообще запрашивал.
Через месяц у вас будет не мнение о llms.txt, а три числа: сколько ошибок ассистента исправлено, сколько раз файл читали и сколько времени ушло на поддержку. По ним и решайте, развивать файл дальше или оставить как есть.