Каждый выход новой нейросети сопровождается таблицей, в которой она обходит всех конкурентов на несколько пунктов. Руководитель, выбирающий модель для задачи компании, смотрит на эти таблицы и делает вывод, что самая дорогая модель — самая лучшая. Иногда это правда. Но чаще разница в два пункта на экзамене, который модели сдают почти идеально, не говорит ничего о том, как модель будет отвечать вашим клиентам на русском языке. Разберём, что на самом деле измеряют популярные бенчмарки, где их показатели обманывают и как за неделю собрать проверку, которая скажет больше любой таблицы.
Бенчмарк — это экзамен, а не отзыв клиента
Бенчмарк нейросети — это стандартный набор заданий с известными правильными ответами, на котором разные модели сравнивают по доле верных решений. Задания могут быть тестом с вариантами ответа, задачами по программированию, математическими олимпиадами или сравнением ответов людьми вслепую.
Смысл бенчмарка в сопоставимости: все модели решают одно и то же, и результат можно поставить в одну таблицу. Отсюда и его главное ограничение. Бенчмарк отвечает на вопрос «какая модель лучше сдаёт этот экзамен», а покупателя интересует другое — «какая модель лучше справится с моей задачей». Эти вопросы совпадают реже, чем кажется.
Вердикт: бенчмарк полезен, чтобы отсеять явно слабые модели, и почти бесполезен, чтобы выбрать между сильными.
Популярные тесты уже решены почти полностью
Самый цитируемый бенчмарк знаний — MMLU: тест с вариантами ответа по 57 предметам, от истории до медицины и права. Когда он появился в 2020 году, большинство моделей показывали на нём результат на уровне случайного угадывания, а крупнейшая из проверенных отвечала верно меньше чем на половину вопросов. Сегодня ведущие модели решают его почти полностью, и разница между ними составляет единицы процентов.
Что это значит на практике: когда два результата на насыщенном тесте отличаются на один-два пункта, это различие в пределах случайных колебаний, особенностей формулировки вопросов и настроек проверки. Модель с чуть меньшим баллом не хуже — просто экзамен перестал различать отличников.
Индустрия на это реагирует созданием всё более сложных тестов. GPQA Diamond — 198 вопросов по биологии, физике и химии, составленных экспертами так, чтобы на них не мог ответить неспециалист даже с доступом к поиску. Humanity's Last Exam — несколько тысяч вопросов на пределе человеческой экспертизы. Но и сложные тесты насыщаются, просто медленнее.
Вердикт: если в таблице новой модели главный аргумент — плюс два пункта на MMLU, аргумента нет.
Высокий балл может означать, что модель видела ответы
Языковые модели обучаются на огромных массивах текстов из интернета. Задания популярных бенчмарков опубликованы, обсуждаются на форумах и разбираются в статьях — а значит, могут попасть в обучающие данные. Это называется загрязнением данных, или контаминацией: модель показывает высокий результат не потому, что умеет решать задачи, а потому, что встречала эти задачи с ответами.
Разработчики моделей стараются исключать тестовые задания из обучения, но гарантировать это полностью невозможно: одна и та же задача может встречаться в интернете в пересказах и переводах. Косвенный признак контаминации — резкий разрыв между результатом на старом известном тесте и на новом, похожем по сложности, но опубликованном после обучения модели.
Что это значит для покупателя: чем старше и популярнее бенчмарк, тем меньше доверия к высокому баллу на нём. Результаты на свежих тестах и на закрытых наборах, задания которых не публикуются, говорят больше.
Вердикт: экзамен, вопросы которого лежат в открытом доступе несколько лет, проверяет в том числе память.
На экзамене модель работает в лучших условиях, чем будет у вас
Результат в таблице получен при определённых настройках, и они часто указаны мелким шрифтом в сноске или в техническом отчёте. Модели могут давать несколько попыток и засчитывать лучшую. Им могут разрешать долго рассуждать перед ответом, тратя на одну задачу в разы больше вычислений, чем в обычном использовании. Им могут давать доступ к инструментам — поиску, выполнению кода — которых у вас в продукте не будет.
Каждая такая настройка честно описана и законна для сравнения возможностей. Но она означает, что таблица показывает потолок модели, а не то, что вы получите при стандартном вызове через API с ограничением по стоимости и времени ответа.
Отдельный случай — задачи для агентов, например SWE-bench Verified: 500 проверенных людьми задач из реальных репозиториев с открытым кодом, где модель должна исправить ошибку в коде. Результат здесь сильно зависит не только от модели, но и от обвязки: как организован доступ к файлам, сколько шагов разрешено, как проверяется решение. Одна и та же модель в разных обвязках показывает заметно разные числа.
Вердикт: прежде чем сравнивать два числа, проверьте, что они получены в одинаковых условиях. Часто — нет.
Что проверяют популярные бенчмарки
Чтобы читать таблицы осмысленно, полезно понимать, что стоит за основными названиями и насколько каждый тест близок к задачам бизнеса.
| Бенчмарк | Что проверяет | Насколько близко к задачам бизнеса |
|---|---|---|
| MMLU | Знания по 57 предметам, тест с вариантами ответа | Слабо: почти насыщен, проверяет эрудицию, а не работу с вашими данными |
| GPQA Diamond | 198 экспертных вопросов по естественным наукам | Слабо для большинства задач: показывает глубину рассуждений |
| HumanEval | Написание небольших функций на Python | Средне для разработки, насыщен |
| SWE-bench Verified | Исправление ошибок в реальных репозиториях | Высоко для программирования, но зависит от обвязки |
| Рейтинги по голосам | Какой ответ люди предпочли в слепом сравнении | Средне: отражает удобство ответов, но и их стиль |
| MERA | Набор тестов на русском языке | Высоко для русскоязычных задач как первичный фильтр |
Ни один бенчмарк из таблицы не проверяет то, что обычно нужно компании: как модель отвечает клиенту по базе знаний, извлекает поля из документов, оценивает разговор по чек-листу или ведёт диалог по сценарию. Для этих задач публичных тестов почти нет, и это не упущение индустрии: они слишком зависят от конкретных данных.
Рейтинг по голосам измеряет, какой ответ нравится
Отдельный класс сравнений — рейтинги, где пользователи задают модели вопрос, получают два ответа от анонимных моделей и выбирают лучший. Самый известный — LMArena, ранее Chatbot Arena. Из миллионов таких голосов строится рейтинг, похожий на шахматный.
Преимущество очевидно: вопросы задают живые люди, их невозможно заранее выучить, и оценивается то, что важно пользователю. Недостаток менее очевиден: люди выбирают ответ, который им больше нравится, а не тот, который точнее. Более длинные, лучше отформатированные и увереннее звучащие ответы получают преимущество, даже если содержат ошибку, которую голосующий не заметил.
Что это значит: высокое место в таком рейтинге хорошо предсказывает, что пользователям будет приятно общаться с моделью. Хуже — что модель будет права в задаче, где ошибку трудно заметить без проверки: в цифрах, юридических формулировках, фактах о продукте.
Вердикт: для чат-бота поддержки такой рейтинг полезен, для извлечения данных из договоров — почти нет.
Для русского языка нужны свои тесты
Подавляющее большинство известных бенчмарков — на английском. Модель, которая отлично решает англоязычный экзамен, может заметно хуже работать на русском: путать падежи в сложных конструкциях, неестественно строить фразы, хуже понимать разговорную речь, профессиональный жаргон и сокращения.
Для русскоязычных моделей существует бенчмарк MERA, созданный на площадке Альянса в сфере искусственного интеллекта при участии команд Сбера, MTS AI, Сколтеха и Высшей школы экономики. Он включает набор тестов на русском языке и открытый рейтинг моделей. Для первичного отбора под русскоязычную задачу это более релевантный ориентир, чем англоязычные таблицы. Как соотносятся российские модели и открытые альтернативы по другим критериям — доступности, хранению данных, стоимости, — разобрано в статье о российских LLM.
Есть и практический нюанс, который не отражает ни один бенчмарк: стоимость работы с русским текстом. Модели считают объём текста в токенах, и у разных моделей один и тот же русский текст разбивается на разное число токенов. При одинаковой цене за токен обработка русского текста у одной модели может обходиться заметно дороже, чем у другой.
Вердикт: англоязычный рейтинг для русскоязычной задачи — ориентир, а не аргумент.
Таблицу из пресс-релиза можно прочитать за две минуты
Когда выходит новая модель, вместе с ней выходит таблица сравнения. Пяти вопросов достаточно, чтобы понять, сколько в ней информации, а сколько маркетинга.
С какими версиями конкурентов сравнивают? Частый приём — сравнить свою новую модель с прошлой версией модели конкурента, вышедшей несколько месяцев назад. Формально всё верно, но вывод «мы лучше» относится к позавчерашнему дню.
Какие тесты выбраны, а каких нет? Разработчик сам решает, что показать. Если в таблице нет теста, который был в прошлом отчёте той же компании, стоит спросить почему. Иногда ответ скучный, иногда — модель на нём просела.
В каких условиях получены числа? Режим рассуждений, число попыток, доступ к инструментам. Сравнение модели в режиме долгих рассуждений с конкурентом в обычном режиме говорит о режиме, а не о модели.
Насколько велика разница? Разница в один-два пункта на насыщенном тесте не значит ничего. Разница в десять пунктов на свежем сложном тесте — повод присмотреться.
Есть ли независимые замеры? Результаты, воспроизведённые сторонними исследователями или открытыми рейтингами через несколько недель после релиза, весят больше, чем таблица в день выхода.
Вердикт: если на три вопроса из пяти ответа нет, таблица — это рекламный материал, а не измерение.
Ни один бенчмарк не измеряет вашу задачу
Главный вывод из всего сказанного: для выбора модели под задачу компании нужен собственный набор проверки. Не потому, что публичные тесты плохие, а потому, что они проверяют другое.
Свой набор проверки — это несколько десятков реальных примеров из работы компании с правильными ответами, на которых сравниваются модели-кандидаты. Для чат-бота поддержки — настоящие вопросы клиентов и ответы, которые считаются правильными. Для оценки звонков — расшифровки с оценкой, которую поставил опытный руководитель. Для извлечения данных — документы с заполненными вручную полями.
Такой набор решает сразу все проблемы публичных бенчмарков. Он не насыщен — модели его не видели. Он не загрязнён — его нет в интернете. Он проверяет русский язык с вашими терминами и сокращениями. И он запускается в тех условиях, в которых модель будет работать: с вашим запросом, вашими настройками и вашими ограничениями по времени и стоимости.
Вердикт: пятьдесят примеров из своей работы скажут о модели больше, чем таблица из технического отчёта на двадцати страницах.
Свой экзамен: пятьдесят примеров из вашей работы
Собрать набор проверки проще, чем кажется, и на это не нужны инженеры по машинному обучению. Нужен человек, который хорошо знает задачу, и неделя.
Отобрать примеры. От пятидесяти до ста реальных случаев, включая трудные: неоднозначные вопросы, редкие ситуации, некачественные данные. Набор только из простых примеров покажет, что все модели одинаково хороши, — и это будет неправдой.
Записать эталонные ответы. Для каждого примера — что считается правильным результатом. Если правильных ответов может быть несколько, записать критерии: что обязательно должно быть в ответе и чего быть не должно.
Прогнать модели-кандидаты в одинаковых условиях. Один и тот же запрос, одни и те же настройки, те же ограничения, что будут в продукте.
Оценить вслепую. Проверяющий не должен знать, какая модель дала какой ответ. Иначе ожидание от «самой сильной модели» влияет на оценку сильнее, чем кажется.
Посчитать не только точность. Долю правильных ответов, долю опасных ошибок — тех, что могут навредить клиенту или компании, — время ответа и стоимость одного вызова.
Как организовать проверку готового агента перед выпуском к клиентам, с наборами сценариев и критериями выпуска, — отдельная тема, она разобрана в статье о тестировании AI-агента. Набор проверки модели — её первая часть: он отвечает на вопрос, на какой модели вообще стоит строить.
Цена и скорость — тоже результат экзамена
В таблицах бенчмарков почти никогда нет двух чисел, которые в реальном продукте важны не меньше качества: стоимости одного ответа и времени, за которое он приходит.
Разница в стоимости между флагманской моделью и моделью попроще может составлять десятки раз. Если на вашем наборе проверки обе модели дают сопоставимое качество, выбор флагмана — это переплата без результата. А если флагман лучше на трудных примерах, но не отличается на простых, разумно разделить поток: простые запросы — дешёвой модели, сложные — дорогой. Почему руководителю важнее путь поручения, чем имя модели, разобрано в статье про агента-координатора.
Время ответа критично для задач в реальном времени. Голосовой агент, который думает четыре секунды перед каждой репликой, проигрывает агенту попроще, отвечающему за полсекунды, — даже если ответы первого умнее. Модели, которые долго рассуждают перед ответом, особенно сильны на бенчмарках и особенно неудобны там, где собеседник ждёт.
Вердикт: лучшая модель — не та, что выше в таблице, а самая дешёвая и быстрая из тех, что проходят ваш экзамен.
Что спросить подрядчика, который выбрал модель по таблице
Если выбор модели делает подрядчик, его аргументацию стоит проверить несколькими вопросами. Они быстро показывают, была ли проверка на задаче или только чтение таблиц.
- На каких примерах из нашей работы сравнивались модели и сколько их было?
- Какие модели сравнивались, кроме выбранной, и какие получились результаты?
- Какая доля ошибок оказалась опасной, а не просто неточной?
- Сколько будет стоить один ответ и сколько он будет занимать времени при нашем объёме?
- Что будет, если через полгода выйдет модель лучше или дешевле: сколько стоит переход?
Подрядчик, который отвечает на первый вопрос ссылкой на публичный рейтинг, скорее всего, выбирал модель по популярности. Остальные критерии выбора исполнителя — в статье о том, как выбрать подрядчика по внедрению AI.
Последний вопрос особенно важен. Модели обновляются каждые несколько месяцев, и лидер таблицы меняется так же часто. Решение, жёстко привязанное к одной модели, стареет вместе с ней. Решение, в котором есть собственный набор проверки, позволяет за день проверить новую модель и перейти на неё, если она лучше.
Итоговое правило
Публичные бенчмарки — хороший инструмент для одной задачи: понять, какие модели в принципе находятся на переднем крае и какие безнадёжно отстали. Для выбора модели под работу компании у них три системных недостатка: они насыщены, могут быть загрязнены и проверяют не вашу задачу в не ваших условиях.
Правило выбора укладывается в одну фразу: таблица сужает список до трёх-четырёх кандидатов, решение принимается на пятидесяти примерах из вашей работы с учётом стоимости и скорости. Всё остальное — маркетинг, иногда очень убедительный.
И последнее, о чём полезно помнить, читая очередную таблицу к очередному релизу: её составил разработчик модели, который выбирал, какие тесты в неё включить. Независимые замеры обычно появляются через несколько недель — и нередко показывают картину поскромнее.