AI-агент, который пообещал клиенту несуществующую скидку или срок доставки, ставит компанию перед выбором: выполнить обещание за свой счёт или потерять клиента. Такая выдумка — её ещё называют галлюцинацией — это уверенный ответ нейросети, не подтверждённый ни одним источником, и она не сбой, а свойство того, как устроена языковая модель. Разберу, почему нейросеть выдумывает так уверенно, почему выдумку не видно при чтении и какие ограничения снижают риск до уровня, с которым агента можно выпускать к клиентам.
Нейросеть выдумывает, потому что продолжает текст, а не проверяет истину
Языковая модель устроена как механизм продолжения текста: она выдаёт наиболее вероятное следующее слово с учётом всего, что было до него. У неё нет отдельного хранилища фактов и нет шага проверки истинности. Когда данных не хватает, она не останавливается — она достраивает правдоподобное продолжение.
Мне помогает сравнение с опытным продавцом на выставке, которого спросили о модели, которой он не знает. Молчать неловко, и он отвечает «по аналогии» — уверенно и почти правильно. Модель делает то же самое, только без неловкости и без паузы, по которой можно было бы догадаться.
Поэтому выдумывание — не поломка, которую починит следующее обновление. Это следствие принципа работы, и относиться к нему нужно как к свойству инструмента: не устранять, а ограничивать.
У модели по умолчанию нет состояния «я не знаю». Промолчать для неё не вариант ответа — она всегда что-то напишет. Право на незнание задаётся отдельно.
Выдуманный ответ звучит так же уверенно, как верный
Верный и выдуманный ответ формируются одним и тем же механизмом, поэтому звучат одинаково: та же уверенность, та же структура, та же вежливость. Признаков сомнения в тексте нет, потому что сомнения нет и внутри.
Отсюда следствие, которое стоит проговорить команде до запуска: выборочное чтение диалогов не защищает. Руководитель, просматривающий десяток разговоров, не отличит выдуманное условие от настоящего — для этого нужно сверять с документом, а не читать. Если в плане внедрения контроль качества агента описан как «будем посматривать переписки», контроля в нём нет.
Пять ситуаций, где выдумка стоит денег
| Ситуация | Что выдумывает | Цена |
|---|---|---|
| Вопрос не покрыт документами | Условие, которого нет | Обещание, которое придётся выполнять |
| Документ есть, но неполный | Достраивает недостающую часть | Полуправда, которую труднее заметить |
| Числа рядом в тексте | Смешивает цифры из разных строк | Неверная цена или срок |
| Клиент настойчиво переспрашивает | Уступает и меняет ответ | Противоречие в одном диалоге |
| Вопрос о будущем | Прогноз как факт | Ожидание, за которое никто не отвечал |
Четвёртую строку недооценивают чаще остальных. Если клиент трижды спрашивает «а точно нельзя дешевле», модель может «пойти навстречу» — не из вредности, а потому что уступка выглядит вероятным продолжением диалога. На тестовых вопросах, которые задаются по одному разу, этого не видно.
Третья строка — вторая по коварству. Прайс, где в соседних строках стоят цены за разные объёмы, для модели выглядит как набор похожих чисел, и перепутать строку ей легче, чем человеку. Выдумка тут даже не выдумка в чистом виде: все цифры настоящие, неверна только связь.
Четыре ограничения вместо просьбы «не выдумывай»
- Отвечать только по найденному. Агент получает фрагменты документов и инструкцию не выходить за них. Это снимает большую часть выдумок разом — как устроен такой поиск, разобрано в статье как AI находит ответ в документах.
- Явное право на незнание. Формулировка «если ответа в материалах нет — скажи, что уточнишь у коллеги» должна быть задана прямо, иначе модель достроит.
- Запретные темы списком. Скидки, сроки, гарантии, юридические вопросы — то, где ответ даёт только человек, независимо от того, есть ли что-то в документах.
- Сверка чисел с системой. Цены, остатки и статусы берутся живым запросом в учётную систему, а не из текста — тогда смешивать нечего.
Ни одно ограничение по отдельности не даёт нуля. Вместе они снижают частоту до уровня, при котором оставшиеся случаи ловятся сплошным чтением первых недель. Если бы мне пришлось выбрать одно, я бы выбрал первое: ограничение источника работает, даже когда остальные забыли настроить.
Три надежды, которые не защищают от выдумки
Полагаться на просьбу «не выдумывай». Инструкция в свободной форме помогает слабо: модель не различает «не знаю» и «маловероятно». Нужна не просьба, а ограничение источника.
Ждать, что новая модель решит проблему. Более сильные модели выдумывают реже, но принцип работы не меняется. Архитектура ответа важнее выбора модели — и переживает смену модели, а надежда на модель не переживает.
Считать проблему решённой после теста. Тест на подготовленных вопросах показывает лучший случай. Настоящая картина видна на живом потоке, где формулировки непредсказуемы, а клиенты задают вопросы, которых никто не ждал.
Выдумка или устаревший документ: проверка цитатой
Неверный ответ имеет две разные причины, и лечатся они противоположным образом. Модель могла достроить то, чего нет нигде, — это выдумка. Или она аккуратно повторила то, что написано в ваших материалах, а материалы устарели.
Различить просто: попросите цитату. Если фрагмент, на который ссылается ответ, действительно существует в документах, модель отработала верно, и чинить надо документ. Если цитаты нет или она не соответствует тексту — это выдумка, и чинить надо ограничения.
Практическая ценность различения в том, что часть претензий к системе снимается сразу: жалоба «система врёт» нередко оказывается точным пересказом инструкции, которую отменили полгода назад и забыли удалить. Прежде чем менять настройки, я бы прогнал через цитату последние жалобы и посмотрел, какая доля из них на самом деле про документы. Как держать материалы агента в актуальном состоянии, разобрано в статье о базе знаний для AI-агента.
Самый трудный случай: ответ верный наполовину
Полностью выдуманный ответ обнаружить легко. Опаснее ответ, где три факта верны, а четвёртый достроен: его пропускают при проверке, потому что первые три создают доверие ко всему остальному.
Возникает это чаще всего там, где документ отвечает на вопрос частично. Модель находит фрагмент про условия возврата, честно его пересказывает и добавляет срок, которого в тексте не было, — потому что вопрос про срок был задан, а без ответа фраза выглядит незаконченной.
Защита — требование помечать неполноту явно. Инструкция «если в найденном фрагменте нет части ответа, скажи об этом прямо и не достраивай» работает заметно лучше общего «не выдумывай». И проверять при чтении нужно каждый факт отдельно, а не ответ целиком: это дольше, но иначе половинчатые ответы не ловятся.
Как настроить отказ, чтобы им не злоупотребляли
Ужесточение правил даёт предсказуемый побочный эффект: система начинает отказываться отвечать там, где ответ был. Клиент получает «уточните у менеджера» на простой вопрос, и польза от автоматизации исчезает — агент становится дорогим автоответчиком.
Баланс проверяется двумя числами, которые нужно смотреть вместе: доля выдуманных ответов на контрольной выборке и доля отказов там, где ответ в документах есть. Оптимизация одного числа без второго всегда ухудшает второе.
Настройку я бы вёл от отказов. Соберите случаи, где система отказалась зря, и посмотрите, чего не хватило: обычно ответ в документах есть, но сформулирован так, что поиск его не находит. Тогда чинится документ, а не порог осторожности.
Кто ловит выдумки в рабочем режиме
После запуска проверка не может быть разовой, но и сплошной она быть не может. Работающая схема состоит из трёх слоёв, и каждый ловит свою часть.
Первый — автоматический: ответы без цитаты или с цитатой, которой нет в источниках, помечаются сразу. Это ловит грубые случаи и не требует человека. Второй — регулярная выборка: несколько десятков ответов в неделю читает владелец процесса, проверяя каждый факт отдельно.
Третий и самый ценный — обратная связь от тех, кто работает с клиентами. Менеджер, которому клиент сослался на несуществующее условие, обнаруживает выдумку раньше любой проверки. Для этого нужен простой способ сообщить о таком случае — одна кнопка или один адрес, а не процедура. Кто отвечает, если выдумка всё-таки дошла до клиента, — в разборе ответственности за ошибку AI.
Когда бороться с выдумкой дороже, чем её допустить
Честно о границах. Не каждая задача требует трёх слоёв проверки. Если нейросеть пишет черновик письма, который человек всё равно перечитает, накидывает идеи для рекламы или пересказывает внутреннее совещание для себя, выдумка стоит минуту на исправление. Строить под это ограничение источника и контрольные выборки не нужно — достаточно правила «человек читает перед отправкой».
Обратный случай тоже бывает: задача, где ошибка стоит дорого, а ответы нельзя привязать к документам. Например, агент должен консультировать по сложным индивидуальным условиям, которые нигде не записаны и живут в головах менеджеров. Такому агенту не на что опираться, и никакая настройка не сделает его ответы надёжными. Здесь честный вывод — сначала записать условия, а до этого не запускать агента к клиентам вовсе. В 404ai это одна из причин, по которым мы отказываемся от проекта на этапе разбора: без материалов, по которым можно проверить ответ, эффекта не будет.
Двадцать вопросов, на которые ответа нет
Соберите два десятка вопросов, ответа на которые в ваших материалах заведомо нет, и задайте их агенту. Правильное поведение — признание незнания и передача человеку. Каждый ответ по существу в этой группе означает, что ограничение источника не работает.
Отдельно проверьте настойчивость: задайте один и тот же вопрос про скидку трижды подряд, повышая давление. Ответ не должен меняться. Полную программу проверки перед запуском — с группами вопросов, критериями и порогами — мы разбирали в статье о тестировании AI-агента перед запуском.
Ноль выдуманных ответов в группе «нет в материалах» и ноль изменений ответа под давлением. Не проценты — ноль: одна выдумка означает, что ограничение не задано, и она повторится на любой незнакомой теме.
Что спросить у подрядчика до запуска агента
Главное, что меняет понимание природы выдумки: вопрос к любому AI-агенту звучит не «насколько умная у вас модель», а «откуда агент берёт ответ и что он делает, когда ответа нет». Попросите подрядчика показать три вещи на ваших материалах: цитату-источник к ответу, отказ на вопрос вне документов и неизменный ответ после трёх настойчивых переспрашиваний. Если хотя бы одно из трёх не получается показать до договора, выдумки дойдут до клиентов после запуска — и платить за обещания агента будете вы.