Российская компания выбирает языковую модель не по тому, какая умнее, а по тому, какую не отключат, где лежат данные и чем за неё платить. Ошибка здесь стоит не процентов качества, а переделки всего процесса, когда доступ пропадёт или служба безопасности запретит передачу данных. Российские LLM — это языковые модели российских разработчиков, прежде всего GigaChat от Сбера и YandexGPT от Яндекса, которые работают по договору с российским юрлицом. Ниже — три реальных варианта, GigaChat, YandexGPT и открытая модель на своём железе, по критериям, которые действительно влияют на решение, и честный ответ, когда выбирать модель вам вообще не нужно.
Российские LLM выбирают по четырём осям, а не по рейтингу
Сводный рейтинг отвечает на вопрос «кто умнее в среднем». Российской компании важнее другое: справится ли модель с её текстами, во что обойдётся на её объёме и что будет, если доступ пропадёт. Почему таблицы из пресс-релизов вводят в заблуждение, разобрано в статье о бенчмарках нейросетей.
Поэтому выбор здесь идёт по четырём практическим осям: где физически лежат данные, насколько стабилен доступ, сколько стоит на вашем объёме и сколько нужно обслуживать самим.
Вердикт: модель, которая на две позиции выше в рейтинге, но может быть недоступна завтра, для процесса, от которого зависят продажи, хуже, а не лучше.
GigaChat берут за юридическую понятность, но у YandexGPT она та же
Главный аргумент за GigaChat — юридическая понятность. Договор с российской компанией, оплата в рублях, данные обрабатываются в России, и вопрос «где обрабатываются персональные данные» закрывается без длинных объяснений службе безопасности. Для компаний с госзаказом или в регулируемых отраслях это часто решает всё остальное. Честная оговорка: у YandexGPT в облаке Яндекса эти условия такие же, поэтому юридический аргумент отделяет российские модели от зарубежных, а не GigaChat от YandexGPT.
Что это значит для проверки: качество на длинных документах и на узкой терминологии нужно смотреть самим, на своих текстах. Общее правило такое: чем ближе задача к обычному деловому русскому, тем меньше разница между любыми сильными моделями; чем специфичнее лексика — медицинская, юридическая, отраслевой жаргон менеджеров, — тем важнее собственный тест.
Вердикт: GigaChat часто выбирают не за ответы, а за то, что его не придётся объяснять юристу, — причина рациональная, только в споре с YandexGPT она ничего не решает.
YandexGPT удобен, когда вокруг модели нужна готовая инфраструктура
YandexGPT доступен через облако Яндекса, где рядом уже есть распознавание и синтез речи, хранилища и вычислительные сервисы. Поэтому он выигрывает, когда вокруг модели строится остальное. Собрать конвейер «звонок → расшифровка → анализ → задача в CRM» внутри одной экосистемы обычно быстрее, чем сшивать сервисы разных поставщиков, и поддерживать его проще.
Оборотная сторона понятна, и её стоит осознать заранее: чем плотнее вы вросли в экосистему, тем дороже переезд. Если смена поставщика хотя бы теоретически возможна, закладывайте прослойку над вызовами модели с первого дня — небольшой объём работы, который окупается при первой же замене.
Вердикт: экосистема экономит время на старте и берёт его обратно при переезде.
Открытая модель на своём сервере — для данных, которые нельзя отдавать никому
Открытая модель, развёрнутая на собственном сервере, — единственный вариант, при котором данные физически не покидают вашу инфраструктуру и не попадают ни к какому поставщику, даже российскому. Для части медицинских, финансовых и юридических данных это не предпочтение, а требование службы безопасности.
Цена вопроса — не лицензия, а эксплуатация: серверы с видеокартами, человек, который умеет их обслуживать, и готовность самим обновлять модель и проверять её после обновления. Качество открытых моделей на русском различается заметно, поэтому тест на своих текстах здесь обязателен вдвойне.
Экономика этого выбора подробно разобрана в статье открытая модель или облачный API. Коротко: до определённого объёма запросов облако дешевле почти всегда, а точка перелома считается по вашим цифрам, а не по общим советам.
Сотня своих примеров скажет больше любого обзора
Единственный честный способ выбрать — тест на реальных примерах. Не на десяти, а на сотне: на десяти вы увидите случайность. Общая методика собственной проверки описана в статье о бенчмарках, а для выбора между российскими и открытыми моделями важны пять шагов.
- Возьмите 100 реальных случаев из своего процесса — обращения, документы, разговоры.
- Составьте эталонные ответы руками. Это скучный день работы, без которого сравнение бессмысленно.
- Прогоните всех кандидатов на одном промпте и сравните долю совпадений с эталоном.
- Отдельно посчитайте стоимость прогона на вашем месячном объёме, а не на тестовой сотне.
- Проверьте поведение на краю: очень длинный документ, опечатки, смешанный русско-английский текст, пустой ввод.
Вердикт: день на эталонные ответы — самая дешёвая часть выбора и единственная, которую нельзя делегировать поставщику.
Промпты не переезжают вместе с моделью
Переход с зарубежной модели на российскую редко сводится к замене адреса сервиса. Промпты, настроенные под поведение одной модели, на другой работают иначе, и это выясняется на первых же ответах.
Основных различий три. Формат вывода: модель, стабильно возвращавшая строгую структуру, заменяется на ту, что иногда добавляет пояснение вокруг неё, и разбор ответа ломается. Длина и подробность: одна отвечает кратко, другая развёрнуто, и то, что помещалось в интерфейс, перестаёт помещаться. Реакция на инструкции: формулировки, которые одна модель понимает буквально, другая трактует свободнее.
Отсюда порядок перехода: сначала прогон эталонного набора на новой модели, потом правка промптов под её поведение, потом перевод потока — частями. Одномоментное переключение всего потока даёт неделю разбирательств, которой можно было избежать.
Вердикт: миграция модели — это небольшой проект с приёмкой, а не строчка в настройках.
Рубли и закрывающие документы иногда весят больше качества ответа
Способ оплаты выглядит бухгалтерской деталью и регулярно оказывается решающим фактором. У российских поставщиков это обычный договор, оплата в рублях и закрывающие документы: бухгалтерия принимает такие расходы без вопросов, и они предсказуемо ложатся в бюджет. У зарубежных сервисов добавляются валютные платежи, привязка к карте, пересчёт по курсу и сложности с документами для учёта.
Второй аспект — предсказуемость счёта. Оплата по объёму обработанного текста означает, что расход зависит от того, насколько подробно отвечает модель и насколько длинные документы вы передаёте. К тому же разные модели по-разному делят русский текст на токены, и при одинаковой цене за единицу один и тот же документ может стоить по-разному.
Что это значит для сравнения: считать нужно месячную стоимость на своём реальном потоке, а не цену за единицу. Разница между поставщиками по этой цифре обычно больше, чем по прайсу.
Поддержку поставщика проверяют техническим вопросом до договора
Модель — не библиотека, которую подключили и забыли: у неё меняется поведение, бывают перебои, возникают вопросы, на которые нет ответа в документации. Поэтому поддержка определяет, сколько нервов будет стоить эксплуатация.
Проверяется это просто: задайте поставщику технический вопрос по существу через тот канал, которым будете пользоваться потом. Скорость и содержательность ответа скажут больше, чем описание уровней поддержки в договоре.
Второй показатель — публичность информации о сбоях. Есть ли страница со статусом сервиса, сообщают ли об инцидентах и об изменениях в моделях заранее. Поставщик, который меняет поведение модели молча, будет источником регулярных неожиданностей независимо от качества самой модели.
Вердикт: ответ поддержки на пробный вопрос — это бесплатное демо того, как будет выглядеть ваш первый инцидент.
Два поставщика оправданы при заметном счёте, а не на старте
Один поставщик на всё проще в управлении, но не всегда дешевле в эксплуатации. Оснований для разделения два. Первое — экономика: массовые простые задачи вроде классификации обращений дешевле отдавать более дешёвой модели, а сложные — той, что справляется лучше. Второе — устойчивость: если один поставщик недоступен, останавливается не всё, а часть.
Цена такой схемы — усложнение: два договора, два набора настроек, две точки отказа и человек, который это ведёт. Небольшой компании честнее начать с одного поставщика и вернуться к вопросу, когда счёт станет заметным. Как в Везории задача руководителя проходит путь от агента до ИИ-специалистов, — в статье про агента-координатора.
Три решения, которые потом дорого переделывать
Одна модель на весь контур по итогам теста одной задачи. Классификация обращений и составление коммерческого предложения — разные задачи, и оптимальные модели для них могут отличаться. Тест на одной задаче не переносится на остальные.
Жёсткая привязка к поставщику в коде. Вызовы модели должны быть спрятаны за собственным интерфейсом. Иначе смена поставщика превращается из настройки в переписывание.
Отсутствие плана Б. Доступ может пропасть по причинам, которые от вас не зависят. Нормальная страховка — вторая модель, на которую переключается система, и заранее известное понимание, насколько просядет качество на это время. О рисках зарубежных поставщиков — в статье о зависимости от зарубежных моделей.
Когда выбирать LLM компании вообще не нужно
Весь этот выбор имеет смысл, если компания сама встраивает модель в свой процесс. Если задача закрывается готовым продуктом — контроль качества звонков, AI-агент в мессенджере, расшифровка встреч, — модель выбирает поставщик продукта, а проверять нужно его: где хранятся данные, что будет при расставании и как он подтверждает качество на ваших примерах.
Не нужна своя открытая модель при небольшом объёме запросов: сервер и человек при нём не окупятся, и облачный российский сервис будет дешевле и спокойнее. А часть задач не требует языковой модели вовсе. Проверить заполненность полей в CRM или разложить заявки по ключевым словам можно правилами — быстрее, дешевле и предсказуемее. Шире о таких случаях — в статье когда AI не нужен.
Для большинства компаний, которые только начинают, я бы ставил на такую схему: российская облачная модель по договору, собственная прослойка над вызовами и эталонный набор примеров с первого дня. Свой сервер — когда этого прямо требует служба безопасности или когда объём сделал облако заметно дороже.
Что меняет выбор: сначала требования к данным, потом тест на сотне примеров
Главное следствие для руководителя: вопрос «GigaChat или YandexGPT» не решается чтением обзоров. Он решается в таком порядке: юрист и служба безопасности определяют, куда данным можно; из оставшихся вариантов отбираются два-три кандидата; тест на ваших примерах показывает качество, а расчёт на месячном потоке — реальную цену.
Проверить можно за неделю без договора: соберите сотню обезличенных примеров из своего процесса, напишите эталонные ответы, прогоните через кандидатов на одном промпте и посчитайте три числа — долю верных ответов, долю опасных ошибок и стоимость месяца. Если разница в качестве мала, выбор определят данные, оплата и поддержка, а не модель.