После разговора с вашим сотрудником языковая модель остаётся ровно той же, что была до него: учится не модель, а записи вокруг неё. Обучение ИИ-агента на диалогах — это накопление проверяемых записей о компании (фактов в памяти, постоянных правил и навыков, то есть записанных порядков работы), которые агент получает в следующих разговорах без изменения весов модели. От того, кто и как эти записи утверждает, зависит, станет агент через полгода точнее или начнёт уверенно повторять чужую ошибку. Я отвечаю в 404ai за инфраструктуру, и ниже разберу эту механику так, как её стоит устроить: что происходит по команде «запомни», почему правило и навык не должны вступать в силу без человека, как агента разучить и откатить, где обучение закрепляет ошибку и как проверить, что агент выучил именно то, что нужно.
Выученное должно лежать строкой, которую можно прочитать и стереть
Фраза подрядчика «агент обучается на ваших диалогах» может означать две разные вещи. Первая — дообучение: модель прогоняют на переписках, и меняются её веса. Вторая — внешняя память: из диалогов извлекаются записи, они хранятся в базе, и при каждом новом вопросе нужные из них подставляются в контекст модели.
Для бизнеса разница практическая. Выученное дообучением нельзя открыть и прочитать: нельзя найти, где записано, что постоянным клиентам положена скидка десять процентов, и нельзя удалить одну эту фразу, не переобучив модель заново. Запись во внешней памяти — это строка с текстом, автором и датой. Её видно, её правят, её удаляют за секунду.
Моё мнение: для знаний о компании, которые меняются каждый квартал, дообучение — неподходящий инструмент, и дело не только в цене. Когда меняется прайс или уходит подрядчик, исправление должно занимать минуту, а не цикл обучения и повторной проверки. Когда дообучение всё-таки оправдано, разобрано в статье «Дообучить модель или собрать базу знаний». Здесь достаточно вывода: агент, который «учится с каждым диалогом», в здоровой конструкции учится записями, а не весами.
Такое обучение не требует выгружать переписки кому-то для тренировки модели. Записи хранятся у компании, а в Везории, например, персональные данные и реквизиты заменяются метками до отправки в языковую модель.
Рядом с памятью существует база знаний компании: регламенты, прайсы, описания продуктов, утверждённые ответы. У них разный жизненный цикл. Память растёт из разговоров и живёт сотнями коротких записей, база знаний приходит из документов и требует версий и дат действия. Как собрать и поддерживать базу знаний, разобрано в статье о базе знаний компании для ИИ, а как агент находит в ней ответ — в материале «База знаний для AI-агента». Эта статья — про то, что агент добирает поверх базы в живых разговорах.
Память, правила и навыки отвечают на три разных вопроса
Память отвечает на вопрос «что известно»: «бухгалтерия закрывает месяц до пятого числа», «клиент просит счета только на почту финансового директора». Правило отвечает на вопрос «как обязательно и как нельзя»: «договоры отправляем только после юриста». Навык отвечает на вопрос «как делать такую работу»: порядок подготовки коммерческого предложения из пяти шагов с проверками.
Главное, что стоит понять до настройки: три слоя по-разному попадают в ответ. Память подбирается по смыслу вопроса — на вопрос про рекламу факт про бухгалтерию не придёт, и это правильно, иначе контекст забьётся лишним. Правило действует в каждом ответе независимо от темы: запрет «договоры только через юриста» не может срабатывать через раз. Навык агент видит в каталоге по названию и описанию «когда применять», а полный текст открывает, когда берётся за подходящую задачу.
Отсюда самая частая ошибка настройки: записать постоянное указание в память. Факт «мы не даём скидку больше 15%» всплывёт из памяти, только если вопрос окажется достаточно похож по смыслу, а в разговоре о сроках оплаты его может не оказаться. Если это ограничение, его место среди правил.
На практике это значит: прежде чем сказать агенту «запомни», стоит решить, что перед вами — факт, запрет или порядок работы. От ответа зависит, будет ли запись работать там, где вы на неё рассчитываете.
«Запомни» от человека весит больше, чем догадка агента из разговора
В память запись попадает двумя путями. Прямой: человек говорит «запомни, что…». Косвенный: агент сам замечает в разговоре то, что стоит сохранить, — упомянутого подрядчика, срок, договорённость. Первое — утверждение человека, который за него отвечает. Второе — наблюдение модели, которая могла понять неверно.
В правильно устроенной памяти эти пути не смешиваются. В Везории у каждой записи есть уверенность: предположение — 0,3, сказанное однажды — 0,5, подтверждённое повтором или источником — 0,7, подтверждённое человеком явно — 0,9. Записи с уверенностью ниже 0,4 в ответы не попадают. Факты, которые агент извлёк из разговора сам, получают статус кандидата и ждут одобрения, а до одобрения агент ими не пользуется.
Вторая важная деталь — кто сказал. У общей записи о компании хранится, с чьих слов и когда она появилась. Без этого слова рядового сотрудника в чате подаются агентом наравне со словами владельца, а на вопрос «откуда ты это взял» ответить нечем. С этим полем агент показывает происхождение: разговор, дату, человека.
Третья деталь — личное и общее. «Запомни, что я не читаю почту по выходным» касается одного человека, «запомни, что склад переехал» — всей компании. Если общее по ошибке ляжет в личное, его не увидят, например, SMM-специалист или маркетолог, которые исполняют указания руководителя. Поэтому разумное умолчание — писать в общую память компании, а сужать до личной только по явной просьбе: сужение круга читателей должно быть названо, а не случиться само.
Где хайп: «агент сам всё запоминает» звучит как преимущество, но на практике это очередь на проверку. Если её никто не разбирает, память наполняется кандидатами, которые не работают, а руководитель уверен, что агент уже в курсе.
«Забудь» удаляет запись только при однозначном совпадении
Обратная команда устроена сложнее, чем кажется. Человек говорит «забудь про того подрядчика», а не цитирует заголовок записи. Агент ищет запись по смыслу, и возможны два исхода. Совпадение одно — запись удаляется, и агент называет, что именно забыл. Похожих записей несколько — агент ничего не удаляет и показывает список, чтобы человек выбрал.
Почему не удалить самую похожую: удаление по расплывчатой фразе однажды сотрёт нужное. Ответ «забыл вот это» с названием записи — единственный способ для человека убедиться, что исчезло именно то, что он имел в виду.
Второй рубеж — права. Сотрудник может попросить забыть своё личное, но не запись уровня компании: иначе одна фраза в чате стирает то, что внёс руководитель. Принадлежность записи стоит проверять дважды — и при поиске, и в самом удалении, потому что удаление необратимо, а защита на одном пути держится до первой правки этого пути.
Практичный приём, если «забудь» уходит в переспрашивание: назвать запись отличительной частью — номером договора, фамилией, названием объекта. Совпадение по уникальной части однозначно, и агент удаляет сразу.
Честное ограничение: «забудь» убирает запись из памяти, но не отменяет того, что агент уже сделал на её основе. Подготовленные документы и черновики, собранные с неверным фактом, придётся проверить отдельно.
Правило, которое агент предложил сам, не действует до подтверждения
Правила — самый сильный рычаг обучения, потому что они попадают в каждый ответ. Поэтому самый опасный сценарий — агент, который выписывает правила сам себе. Предложил «не упоминать конкурентов в постах» — и сразу стал так работать, а спросить, кто это решил, некого.
Порядок, при котором этого не происходит: агент может предложить правило, но оно ложится со статусом «предложено» и на ответы не влияет, пока человек его не подтвердит. Так устроено в Везории: правила, навыки и память у ролей общие, а новое правило или навык начинают действовать только после подтверждения человеком. Одинаковые предложения не должны плодиться: агент, дважды пришедший к одному выводу, не добавляет в очередь второй экземпляр, иначе очередь превращается в мусор и её перестают читать.
У правила есть область: вся компания, одна роль или один сайт. «Не обещать сроки доставки» — для всех. «В постах VK без восклицательных знаков» — для SMM-специалиста. «На лендинге не менять блок тарифов» — для одного сайта, с которым работает ИИ-разработчик. Чем уже область, тем меньше риск, что правило помешает там, где не должно. Как роли делят работу и где граница каждой, разобрано в статье о ролях ИИ-команды компании.
Второй практический момент — объём. Правила уходят в каждый запрос, поэтому их число ограничено: в Везории в один запрос попадает до 40 правил. Хуже потолка только молчаливая обрезка. Если правил больше, агент должен знать, что часть не дошла, и сказать об этом, когда человек сошлётся на недошедшее. Иначе правило выглядит заданным, а не работает, и оба — человек и агент — уверены, что всё в порядке.
Третий — просьба против правила. Сотрудник просит «ответь одним словом», а правило требует объяснять вывод. Правильное поведение: выполнить просьбу настолько, насколько позволяет правило, и одной строкой сказать, какое правило помешало. Молча нарушить правило плохо — руководитель считает, что оно работает. Молча отказать тоже плохо — человек остаётся без результата.
Навык закрепляется после подтверждения и дописывает себя ограниченно
Навык — это записанный порядок работы: название, описание «когда применять» и сама процедура — шаги, требования, чего не делать, примеры формулировок. В отличие от правила, навык не висит в каждом ответе: агент открывает его, когда берётся за подходящую задачу. Как устроена библиотека навыков у агента в мессенджерах, подробно описано в статье «Библиотека навыков».
Обучение здесь идёт в двух местах. Первое — появление навыка. Агент, который несколько раз собирал коммерческое предложение по одной схеме, может предложить записать схему навыком. Как и правило, такой навык ждёт подтверждения. Так же должен приходить навык, загруженный из файла: чужой текст не должен распоряжаться работой компании без человека.
Второе — уточнение. После неудачного хода навык может дописать уточнение: забытое условие, редкий случай. Граница важная — дописать, а не переписать. Если попросить модель «улучшить навык», она выдаст пересказ. Каждый пересказ глаже и короче предыдущего, и через несколько кругов вместо порядка работы остаётся общее рассуждение — верное и бесполезное. Поэтому текст, написанный человеком, остаётся нетронутым, а уточнения идут отдельным разделом, который человек видит и может удалить.
У самоуточнения должен быть предел. В Везории навык дописывает себя не больше трёх раз: первое уточнение закрывает забытое условие, второе — редкий случай, третье уже подозрительно, а потребность в четвёртом означает, что порядок работы описан неверно. Навык, который при пяти и более применениях подводил чаще, чем помогал, уходит на разбор человеку, и самоуточнение останавливается.
Вывод для руководителя: счётчик применений и исходов у навыка говорит больше его текста. Навык, которым не пользуются, мёртв и засоряет каталог. Навык, который чаще мешает, чем помогает, не недописан, а неверен — и лечится человеком, а не ещё одним абзацем.
Правка человека в готовой работе — самый честный сигнал
Сотрудники редко объясняют словами, как им удобнее. Они просто правят: сокращают заголовок задачи, убирают вежливое вступление из письма, сдвигают срок, понижают важность. Эта правка — самый богатый сигнал предпочтений, и чаще всего она пропадает: запись в системе поменялась, а агент ничего не узнал.
Приём описан в исследованиях: по разнице между черновиком агента и правкой человека языковая модель выводит предпочтение обычными словами и кладёт его в память, откуда оно достаётся при следующей похожей работе. Так устроен подход из работы Gao и соавторов «Aligning LLM Agents by Learning Latent Preference from User Edits» (2024). Модель при этом не дообучают, а выведенное предпочтение видно человеку и правится им же.
Без фильтров такая память быстро превращается в свалку. Учиться стоит только на правках текста, который написал агент: правка чужого текста ничего не говорит о том, как работать агенту. Не учиться на косметике — опечатке, запятой, регистре. Не учиться, если правил не человек. И формулировать вывод как привычку, а не пересказ случая: не «заголовок стал короче», а «предпочитает короткие заголовки задач без вводных слов».
Главное ограничение: предпочтение, выведенное из одной правки, — наблюдение, а не утверждение. Оно должно работать с низкой уверенностью и само ослабевать, если не подтверждается. В Везории вывод из правки ложится в личную память как догадка агента, а не как слова человека: иначе модель вернула бы руководителю собственное предположение с пометкой «подтверждено вами».
Разучить агента можно тремя способами, и откат должен оставлять след
Первый способ — удалить: «забудь» для памяти, удаление правила, выключение навыка. Для навыка выключение лучше удаления: выключенный навык не попадает ни в каталог, ни в работу, но текст и счётчики сохраняются, и вернуть его можно одним действием.
Второй — дать записи ослабнуть. В Везории факт, который 90 дней никто не подтверждал и которым агент не пользовался, при еженедельной ревизии памяти теряет уверенность, а опустившись ниже порога, перестаёт попадать в ответы. Раз в квартал ослабевшие записи уходят в архив: не удаляются, а убираются из выдачи, и их можно вернуть. Закреплённые человеком записи не стареют и не вытесняются — закрепил, значит решил сам. Закрепление при этом отдельный явный жест, а не побочный эффект любого «запомни»: иначе вечной становится вся память и чистки не работают ни на одной записи.
Третий — пересмотреть живое. Самое опасное в памяти — не слабые записи, а сильные и устаревшие. «Договор с поставщиком действует до конца года» агент повторяет часто, поэтому такой факт не стареет, хотя давно может быть неправдой. Для таких записей нужен вопрос человеку: часто используемые факты, которые полгода никто не подтверждал, попадают в список «подтвердите или поправьте».
Откат без следа хуже отсутствия отката. Чаще всего спрашивают «почему агент перестал так делать», а правило к этому моменту уже удалено. Поэтому история правил должна храниться отдельно и переживать удаление: кто, когда и какое правило добавил, изменил, подтвердил или удалил. При исправлении факта в памяти прежняя формулировка тоже должна остаться — в Везории она сохраняется в истории происхождения записи.
Сравните с дообучением: чтобы модель разучила неверный факт, её переобучают на исправленных данных и заново проверяют всё остальное. Во внешней памяти откат — одна операция и одна строка в журнале.
Отдельно — действия. Выученное влияет на то, что агент готовит наружу: посты, письма, записи в CRM, правки сайта. В Везории всё, что уходит наружу, выполняется только после одобрения человеком, а там, где действие обратимо, его можно отменить в течение 3 часов. Разучивание не отменяет уже сделанного, поэтому контроль стоит и на выходе, а не только на входе.
Поправка может закрепить ошибку сильнее, чем исходная запись
Самый коварный риск обучения на диалогах — не новая ошибка, а укрепление старой. Механика простая. В памяти лежит «Клиент платит по предоплате». Руководитель уточняет: «клиент платит по предоплате 50%». Система решает, что это та же запись, поднимает ей уверенность и дату подтверждения, но текст не заменяет. «50%» исчезает, а неточная запись выглядит свежее и надёжнее, чем до поправки. Агент при этом отвечает «запомнил».
Защита складывается из трёх условий. Поправка человека заменяет текст записи, а не только подтверждает её. Прежняя формулировка сохраняется в истории. Догадка агента не затирает текст, который записал человек. И проверять после поправки нужно содержимое записи, а не ответ агента «запомнил» — ответ говорит о намерении, а не о том, что лежит в базе.
Второй риск — агент учится на собственных выдумках. Если агент ошибся, а потом сам же исправил свой текст и вывел из этого закономерность, в памяти окажется привычка, которой нет у компании. Отсюда правило из предыдущего раздела: учиться только на правках, которые внёс человек.
Третий — слова одного становятся знанием всех. Менеджер в сердцах пишет «этот клиент всегда тянет с оплатой», агент сохраняет это как факт о компании, и через месяц характеристика попадает в контекст роли, которая готовит клиенту письмо. Защищают три вещи: указание, кто сказал; статус кандидата вместо автоматического одобрения; права — общую память утверждают не все.
Четвёртый — неправильное слияние дублей. Уборка памяти склеивает одинаковые записи, и это полезно. Но похожие по словам записи с противоположным смыслом — «бюджет на выставку согласован» и «бюджет на выставку не согласован» — склеивать нельзя. Слияние должно быть осторожным, а о каждом слиянии нужно сообщать человеку поимённо: что во что слито.
Моё мнение: обучение на диалогах стоит оценивать не по тому, как быстро агент запоминает, а по тому, как трудно ему запомнить неправду.
Два несовместимых правила агент молча разрешит в пользу одного
Противоречие правил появляется незаметно. Весной записали «обращаться к клиентам только на „вы“», летом для SMM-специалиста добавили «в комментариях VK общаемся на „ты“». Каждое правило разумно, вместе в одной области они несовместимы.
Языковая модель, получив два таких правила, склонна не сообщать о конфликте, а молча выбирать одно — и не обязательно одно и то же от ответа к ответу. Инструкция «сообщай о противоречиях» в запросе помогает плохо. Надёжнее ловить противоречие там, где оно рождается, — в момент добавления правила. В Везории новое правило сверяется с каждым действующим в той же области, и человек получает предупреждение с цитатой правила, с которым новое конфликтует.
Это предупреждение, а не запрет: заменить старое правило новым — законное намерение. Решение остаётся за человеком: удалить старое, сузить область нового (например, только роль SMM) или переформулировать оба. Сама проверка должна быть строгой к ложным тревогам. Частный, более строгий случай — это уточнение, а не противоречие, и если предупреждение звучит на каждое новое правило, его перестают читать быстрее, чем пропускают настоящий конфликт.
Если противоречие всё-таки дошло до работы, агент должен сказать о нём вслух и спросить, какое правило главнее, а не выбирать наугад.
Практический совет, который ничего не стоит: раз в месяц читать правила одной роли подряд, как читают должностную инструкцию. Противоречия, невидимые по одному, обычно заметны в списке.
Проверка выученного: что спросить у агента после каждой поправки
Проверять, чему научился агент, по ощущению «вроде стал лучше» бесполезно: ощущение складывается из последних трёх разговоров. Нужен контрольный набор, и собрать его можно за неделю своими силами.
- Соберите 20–30 вопросов, на которые агент должен отвечать с учётом выученного: факты из памяти, ситуации, где срабатывает правило, задачи, для которых есть навык. К каждому запишите правильный ответ и источник.
- Добавьте вопросы-ловушки: где правило должно запретить действие, где факт устарел и агент должен сказать «не знаю» или уточнить, где просьба сотрудника противоречит правилу.
- Прогоните набор до изменения и после каждого нового правила, навыка или крупной правки памяти. Сравнивайте ответы по одному, а не общее впечатление.
- На каждый ответ спросите «откуда ты это взял». Хороший агент называет происхождение: запись памяти с датой и автором, правило, документ. Ответ без источника — повод проверить запись.
- Раз в неделю разбирайте очередь: кандидаты в память, предложенные правила и навыки, список «подтвердите или поправьте», навыки на разборе.
Отдельная проверка — выгрузка памяти целиком. При ответе агент видит только подобранные под вопрос записи, а не всё записанное, поэтому раз в месяц полезно прочитать память как документ: что записано, кем, что ушло в архив и что слито.
Как тестировать агента до запуска, подробно разобрано в статье о тестировании AI-агента перед запуском, а что смотреть в работе — в материале о мониторинге после запуска. Для обучающегося агента к ним добавляется одно условие: контрольный набор прогоняется не один раз, а после каждого изменения того, что агент выучил.
У того, чему учится агент, должен быть ответственный в компании
Обучение на диалогах перекладывает работу, а не убирает её. Кто-то разбирает кандидатов, подтверждает правила и навыки, читает отчёт ревизии памяти. Если ответственного нет, исходов два, и оба плохие: очередь не разбирается и агент не учится, либо всё одобряется не глядя и агент учится всему подряд.
Роли удобно разделить заранее. Администратор решает судьбу общей памяти компании и получает отчёт ревизии: что ослаблено, что слито, что ждёт одобрения. Владельцы направлений — руководители продаж и маркетинга, юрист, редактор контента — подтверждают правила и навыки своих ролей. Например, правила тона для контент-фабрики утверждает тот, кто отвечает за бренд, а не тот, кто первым сказал агенту «пиши короче». Сотрудники говорят «запомни» и правят черновики, но их утверждения о компании проходят через кандидатов.
Сколько времени это займёт, заранее честно не скажет никто: зависит от числа диалогов и темпа изменений в компании. Вместо обещаний на пилоте стоит записывать, сколько минут в неделю уходит на разбор очереди, и сравнивать с тем, сколько повторных поправок агенту перестало требоваться.
Одобрение, которое дают не глядя, перестаёт быть проверкой. Признаки такого формального одобрения и способы с ним жить разобраны в статье о подходе human-in-the-loop; для очереди обучения они те же.
Когда агенту не нужно учиться на диалогах
Если агент решает узкую задачу по стабильному регламенту — отвечает на одни и те же вопросы о доставке или записывает на услугу, — постоянное обучение из разговоров добавит риска больше, чем пользы. Хватит базы знаний и нескольких правил, которые меняются вручную раз в квартал.
Не нужно оно и там, где некому разбирать очередь. Агент, который учится без проверки, хуже агента, который не учится вовсе: второй стабильно ошибается в известных местах, первый — в новых и незаметных.
Не стоит начинать с обучения, если у компании нет основы: регламентов, прайсов, утверждённых ответов. Память из диалогов достраивает знания, но не заменяет их, и собранная из обрывков разговоров картина компании будет противоречивой. Сначала база знаний, потом обучение поверх неё.
И в небольшой команде, где все договорённости помещаются в голове руководителя, проще короткий документ с правилами, который сотрудники вставляют в запрос к любому ИИ-помощнику. Механика памяти, правил и навыков окупается, когда людей и договорённостей становится больше, чем способен удержать один человек.
Моё мнение: обучение на диалогах окупается там, где знание о компании меняется быстрее, чем кто-то успевает переписывать регламенты, и где есть кому это знание утверждать.
Метрика обучения — сколько поправок агенту больше не нужно
Цель обучения на диалогах в деньгах — меньше времени сотрудников на исправление работы агента и меньше ошибок, дошедших до клиента. Метрик, которые можно посчитать, две: доля результатов агента, принятых без правки, и число повторных поправок — одинаковых замечаний, которые сотрудники делают агенту второй и третий раз.
Проверка на пилоте по методу «Цель → метрика» выглядит так. Берутся две-три роли и первые две недели записывается базовая линия: сколько черновиков правят и какие замечания повторяются. Затем включаются память, правила и навыки с еженедельным разбором очереди, и результат сравнивается на тех же типах задач. Условие остановки записывается до старта: если повторные поправки не снижаются, а время на разбор очереди растёт, обучение настроено неверно, и расширять его на другие роли нельзя.
Везория — агент компании, который управляет командой ИИ-специалистов и учится на знаниях компании с подтверждением человеком; во внедрениях мы используем её как инструмент, а начинаем с разбора задачи и метрики. Как устроены наши пилоты и когда мы отказываемся от проекта, описано на странице подхода 404ai, а обсудить вашу ситуацию можно через заявку на разбор.
Что это меняет для вас: вместо вопроса подрядчику «учится ли агент» задайте три других — как агента разучить, где видно, кто что ему сказал, и что происходит с правилом, которое агент предложил сам. Ответы скажут о системе больше любой демонстрации.