Главная
Тарифы О нас Подход Кейсы Контакты растИИшкаблог 404ai Интеграции Глоссарий Запросить демо +7 (993) 729-59-59
Технологии · выбор · 404ai

Российские LLM: GigaChat, YandexGPT или своя

Российская компания выбирает языковую модель не по тому, какая умнее, а по тому, какую не отключат, где лежат данные и чем за неё платить. Ошибка здесь стоит не процентов качества, а переделки всего процесса, когда доступ пропадёт или служба безопасности запретит передачу данных. Российские LLM — это языковые модели российских разработчиков, прежде всего GigaChat от Сбера и YandexGPT от Яндекса, которые работают по договору с российским юрлицом. Ниже — три реальных варианта, GigaChat, YandexGPT и открытая модель на своём железе, по критериям, которые действительно влияют на решение, и честный ответ, когда выбирать модель вам вообще не нужно.

Российские LLM выбирают по четырём осям, а не по рейтингу

Сводный рейтинг отвечает на вопрос «кто умнее в среднем». Российской компании важнее другое: справится ли модель с её текстами, во что обойдётся на её объёме и что будет, если доступ пропадёт. Почему таблицы из пресс-релизов вводят в заблуждение, разобрано в статье о бенчмарках нейросетей.

Поэтому выбор здесь идёт по четырём практическим осям: где физически лежат данные, насколько стабилен доступ, сколько стоит на вашем объёме и сколько нужно обслуживать самим.

Вердикт: модель, которая на две позиции выше в рейтинге, но может быть недоступна завтра, для процесса, от которого зависят продажи, хуже, а не лучше.

GigaChat берут за юридическую понятность, но у YandexGPT она та же

Главный аргумент за GigaChat — юридическая понятность. Договор с российской компанией, оплата в рублях, данные обрабатываются в России, и вопрос «где обрабатываются персональные данные» закрывается без длинных объяснений службе безопасности. Для компаний с госзаказом или в регулируемых отраслях это часто решает всё остальное. Честная оговорка: у YandexGPT в облаке Яндекса эти условия такие же, поэтому юридический аргумент отделяет российские модели от зарубежных, а не GigaChat от YandexGPT.

Что это значит для проверки: качество на длинных документах и на узкой терминологии нужно смотреть самим, на своих текстах. Общее правило такое: чем ближе задача к обычному деловому русскому, тем меньше разница между любыми сильными моделями; чем специфичнее лексика — медицинская, юридическая, отраслевой жаргон менеджеров, — тем важнее собственный тест.

Вердикт: GigaChat часто выбирают не за ответы, а за то, что его не придётся объяснять юристу, — причина рациональная, только в споре с YandexGPT она ничего не решает.

YandexGPT удобен, когда вокруг модели нужна готовая инфраструктура

YandexGPT доступен через облако Яндекса, где рядом уже есть распознавание и синтез речи, хранилища и вычислительные сервисы. Поэтому он выигрывает, когда вокруг модели строится остальное. Собрать конвейер «звонок → расшифровка → анализ → задача в CRM» внутри одной экосистемы обычно быстрее, чем сшивать сервисы разных поставщиков, и поддерживать его проще.

Оборотная сторона понятна, и её стоит осознать заранее: чем плотнее вы вросли в экосистему, тем дороже переезд. Если смена поставщика хотя бы теоретически возможна, закладывайте прослойку над вызовами модели с первого дня — небольшой объём работы, который окупается при первой же замене.

Вердикт: экосистема экономит время на старте и берёт его обратно при переезде.

Открытая модель на своём сервере — для данных, которые нельзя отдавать никому

Открытая модель, развёрнутая на собственном сервере, — единственный вариант, при котором данные физически не покидают вашу инфраструктуру и не попадают ни к какому поставщику, даже российскому. Для части медицинских, финансовых и юридических данных это не предпочтение, а требование службы безопасности.

Цена вопроса — не лицензия, а эксплуатация: серверы с видеокартами, человек, который умеет их обслуживать, и готовность самим обновлять модель и проверять её после обновления. Качество открытых моделей на русском различается заметно, поэтому тест на своих текстах здесь обязателен вдвойне.

Экономика этого выбора подробно разобрана в статье открытая модель или облачный API. Коротко: до определённого объёма запросов облако дешевле почти всегда, а точка перелома считается по вашим цифрам, а не по общим советам.

Сотня своих примеров скажет больше любого обзора

Единственный честный способ выбрать — тест на реальных примерах. Не на десяти, а на сотне: на десяти вы увидите случайность. Общая методика собственной проверки описана в статье о бенчмарках, а для выбора между российскими и открытыми моделями важны пять шагов.

  1. Возьмите 100 реальных случаев из своего процесса — обращения, документы, разговоры.
  2. Составьте эталонные ответы руками. Это скучный день работы, без которого сравнение бессмысленно.
  3. Прогоните всех кандидатов на одном промпте и сравните долю совпадений с эталоном.
  4. Отдельно посчитайте стоимость прогона на вашем месячном объёме, а не на тестовой сотне.
  5. Проверьте поведение на краю: очень длинный документ, опечатки, смешанный русско-английский текст, пустой ввод.

Вердикт: день на эталонные ответы — самая дешёвая часть выбора и единственная, которую нельзя делегировать поставщику.

Промпты не переезжают вместе с моделью

Переход с зарубежной модели на российскую редко сводится к замене адреса сервиса. Промпты, настроенные под поведение одной модели, на другой работают иначе, и это выясняется на первых же ответах.

Основных различий три. Формат вывода: модель, стабильно возвращавшая строгую структуру, заменяется на ту, что иногда добавляет пояснение вокруг неё, и разбор ответа ломается. Длина и подробность: одна отвечает кратко, другая развёрнуто, и то, что помещалось в интерфейс, перестаёт помещаться. Реакция на инструкции: формулировки, которые одна модель понимает буквально, другая трактует свободнее.

Отсюда порядок перехода: сначала прогон эталонного набора на новой модели, потом правка промптов под её поведение, потом перевод потока — частями. Одномоментное переключение всего потока даёт неделю разбирательств, которой можно было избежать.

Вердикт: миграция модели — это небольшой проект с приёмкой, а не строчка в настройках.

Рубли и закрывающие документы иногда весят больше качества ответа

Способ оплаты выглядит бухгалтерской деталью и регулярно оказывается решающим фактором. У российских поставщиков это обычный договор, оплата в рублях и закрывающие документы: бухгалтерия принимает такие расходы без вопросов, и они предсказуемо ложатся в бюджет. У зарубежных сервисов добавляются валютные платежи, привязка к карте, пересчёт по курсу и сложности с документами для учёта.

Второй аспект — предсказуемость счёта. Оплата по объёму обработанного текста означает, что расход зависит от того, насколько подробно отвечает модель и насколько длинные документы вы передаёте. К тому же разные модели по-разному делят русский текст на токены, и при одинаковой цене за единицу один и тот же документ может стоить по-разному.

Что это значит для сравнения: считать нужно месячную стоимость на своём реальном потоке, а не цену за единицу. Разница между поставщиками по этой цифре обычно больше, чем по прайсу.

Поддержку поставщика проверяют техническим вопросом до договора

Модель — не библиотека, которую подключили и забыли: у неё меняется поведение, бывают перебои, возникают вопросы, на которые нет ответа в документации. Поэтому поддержка определяет, сколько нервов будет стоить эксплуатация.

Проверяется это просто: задайте поставщику технический вопрос по существу через тот канал, которым будете пользоваться потом. Скорость и содержательность ответа скажут больше, чем описание уровней поддержки в договоре.

Второй показатель — публичность информации о сбоях. Есть ли страница со статусом сервиса, сообщают ли об инцидентах и об изменениях в моделях заранее. Поставщик, который меняет поведение модели молча, будет источником регулярных неожиданностей независимо от качества самой модели.

Вердикт: ответ поддержки на пробный вопрос — это бесплатное демо того, как будет выглядеть ваш первый инцидент.

Два поставщика оправданы при заметном счёте, а не на старте

Один поставщик на всё проще в управлении, но не всегда дешевле в эксплуатации. Оснований для разделения два. Первое — экономика: массовые простые задачи вроде классификации обращений дешевле отдавать более дешёвой модели, а сложные — той, что справляется лучше. Второе — устойчивость: если один поставщик недоступен, останавливается не всё, а часть.

Цена такой схемы — усложнение: два договора, два набора настроек, две точки отказа и человек, который это ведёт. Небольшой компании честнее начать с одного поставщика и вернуться к вопросу, когда счёт станет заметным. Как в Везории задача руководителя проходит путь от агента до ИИ-специалистов, — в статье про агента-координатора.

Три решения, которые потом дорого переделывать

Одна модель на весь контур по итогам теста одной задачи. Классификация обращений и составление коммерческого предложения — разные задачи, и оптимальные модели для них могут отличаться. Тест на одной задаче не переносится на остальные.

Жёсткая привязка к поставщику в коде. Вызовы модели должны быть спрятаны за собственным интерфейсом. Иначе смена поставщика превращается из настройки в переписывание.

Отсутствие плана Б. Доступ может пропасть по причинам, которые от вас не зависят. Нормальная страховка — вторая модель, на которую переключается система, и заранее известное понимание, насколько просядет качество на это время. О рисках зарубежных поставщиков — в статье о зависимости от зарубежных моделей.

Когда выбирать LLM компании вообще не нужно

Весь этот выбор имеет смысл, если компания сама встраивает модель в свой процесс. Если задача закрывается готовым продуктом — контроль качества звонков, AI-агент в мессенджере, расшифровка встреч, — модель выбирает поставщик продукта, а проверять нужно его: где хранятся данные, что будет при расставании и как он подтверждает качество на ваших примерах.

Не нужна своя открытая модель при небольшом объёме запросов: сервер и человек при нём не окупятся, и облачный российский сервис будет дешевле и спокойнее. А часть задач не требует языковой модели вовсе. Проверить заполненность полей в CRM или разложить заявки по ключевым словам можно правилами — быстрее, дешевле и предсказуемее. Шире о таких случаях — в статье когда AI не нужен.

Для большинства компаний, которые только начинают, я бы ставил на такую схему: российская облачная модель по договору, собственная прослойка над вызовами и эталонный набор примеров с первого дня. Свой сервер — когда этого прямо требует служба безопасности или когда объём сделал облако заметно дороже.

Что меняет выбор: сначала требования к данным, потом тест на сотне примеров

Главное следствие для руководителя: вопрос «GigaChat или YandexGPT» не решается чтением обзоров. Он решается в таком порядке: юрист и служба безопасности определяют, куда данным можно; из оставшихся вариантов отбираются два-три кандидата; тест на ваших примерах показывает качество, а расчёт на месячном потоке — реальную цену.

Проверить можно за неделю без договора: соберите сотню обезличенных примеров из своего процесса, напишите эталонные ответы, прогоните через кандидатов на одном промпте и посчитайте три числа — долю верных ответов, долю опасных ошибок и стоимость месяца. Если разница в качестве мала, выбор определят данные, оплата и поддержка, а не модель.

Частые вопросы

Если не нашли ответа — напишите нам в Telegram, ответим за 15 минут.

Единственного ответа нет. GigaChat и YandexGPT одинаково дают договор с российским юрлицом, оплату в рублях и обработку данных в РФ; YandexGPT удобнее, когда вокруг модели строится инфраструктура в облаке Яндекса (распознавание речи, хранилища), открытая модель на своём сервере — когда данные нельзя передавать вообще никому. Выбор делается тестом на сотне ваших реальных случаев с эталонными ответами, а не по сводным рейтингам.
Технически да, но добавляются три риска: обработка данных за пределами РФ (что закрывает часть отраслей сразу), нестабильность доступа и валютные платежи. Если зарубежная модель используется, разумно с первого дня прятать вызовы за собственным интерфейсом и держать вторую модель как запасную.
На типичных бизнес-задачах с обычным деловым русским разрыв обычно небольшой и на практике перекрывается качеством промпта и подготовкой данных. Разрыв растёт на узкой терминологии и сложных рассуждениях — поэтому проверять надо на своих текстах, а не по чужим сравнениям.
До определённого объёма запросов облако дешевле почти всегда: вы не платите за простой железа и за человека, который его обслуживает. Точка, после которой выгоднее своё, считается по вашему месячному объёму и стоимости видеокарт с эксплуатацией.

Подберём модель под вашу задачу и контур

Прогоним ваши реальные примеры через несколько моделей и покажем сравнение по качеству и стоимости — до того, как вы во что-то вложитесь.

Разберём ваши звонкиПилот бесплатно
Обсудить задачу