Главная
Тарифы О нас Подход Кейсы Контакты растИИшкаблог 404ai Интеграции Глоссарий Запросить демо +7 (993) 729-59-59
Технологии · выбор модели · 404ai

Бенчмарки нейросетей: как читать их руководителю

Каждый выход новой нейросети сопровождается таблицей, в которой она обходит всех конкурентов на несколько пунктов. Руководитель, выбирающий модель для задачи компании, смотрит на эти таблицы и делает вывод, что самая дорогая модель — самая лучшая. Иногда это правда. Но чаще разница в два пункта на экзамене, который модели сдают почти идеально, не говорит ничего о том, как модель будет отвечать вашим клиентам на русском языке. Разберём, что на самом деле измеряют популярные бенчмарки, где их показатели обманывают и как за неделю собрать проверку, которая скажет больше любой таблицы.

Публичный бенчмарк и собственная проверка Сравнение по четырём признакам. Вопросы: у бенчмарка общие экзаменационные, у своей проверки — примеры из работы компании. Язык: чаще английский против русского с терминами компании. Условия: лучшие настройки против ваших реальных. Результат: балл в таблице против ответа на вопрос, подходит ли модель под задачу. Что сравнивает таблица и что нужно вам публичный бенчмарк своя проверка вопросы экзаменационные из вашей работы язык чаще английский русский, ваши термины условия лучшие настройки как будет у вас итог балл в таблице подходит или нет
Публичный бенчмарк и собственная проверка отвечают на разные вопросы. Бенчмарк сравнивает модели на общих экзаменационных задачах, чаще на английском и в лучших для модели условиях. Своя проверка на примерах из работы компании отвечает на единственный важный для покупателя вопрос: справится ли модель с этой задачей.

Бенчмарк — это экзамен, а не отзыв клиента

Бенчмарк нейросети — это стандартный набор заданий с известными правильными ответами, на котором разные модели сравнивают по доле верных решений. Задания могут быть тестом с вариантами ответа, задачами по программированию, математическими олимпиадами или сравнением ответов людьми вслепую.

Смысл бенчмарка в сопоставимости: все модели решают одно и то же, и результат можно поставить в одну таблицу. Отсюда и его главное ограничение. Бенчмарк отвечает на вопрос «какая модель лучше сдаёт этот экзамен», а покупателя интересует другое — «какая модель лучше справится с моей задачей». Эти вопросы совпадают реже, чем кажется.

Вердикт: бенчмарк полезен, чтобы отсеять явно слабые модели, и почти бесполезен, чтобы выбрать между сильными.

Популярные тесты уже решены почти полностью

Самый цитируемый бенчмарк знаний — MMLU: тест с вариантами ответа по 57 предметам, от истории до медицины и права. Когда он появился в 2020 году, большинство моделей показывали на нём результат на уровне случайного угадывания, а крупнейшая из проверенных отвечала верно меньше чем на половину вопросов. Сегодня ведущие модели решают его почти полностью, и разница между ними составляет единицы процентов.

Что это значит на практике: когда два результата на насыщенном тесте отличаются на один-два пункта, это различие в пределах случайных колебаний, особенностей формулировки вопросов и настроек проверки. Модель с чуть меньшим баллом не хуже — просто экзамен перестал различать отличников.

Индустрия на это реагирует созданием всё более сложных тестов. GPQA Diamond — 198 вопросов по биологии, физике и химии, составленных экспертами так, чтобы на них не мог ответить неспециалист даже с доступом к поиску. Humanity's Last Exam — несколько тысяч вопросов на пределе человеческой экспертизы. Но и сложные тесты насыщаются, просто медленнее.

Вердикт: если в таблице новой модели главный аргумент — плюс два пункта на MMLU, аргумента нет.

Высокий балл может означать, что модель видела ответы

Языковые модели обучаются на огромных массивах текстов из интернета. Задания популярных бенчмарков опубликованы, обсуждаются на форумах и разбираются в статьях — а значит, могут попасть в обучающие данные. Это называется загрязнением данных, или контаминацией: модель показывает высокий результат не потому, что умеет решать задачи, а потому, что встречала эти задачи с ответами.

Разработчики моделей стараются исключать тестовые задания из обучения, но гарантировать это полностью невозможно: одна и та же задача может встречаться в интернете в пересказах и переводах. Косвенный признак контаминации — резкий разрыв между результатом на старом известном тесте и на новом, похожем по сложности, но опубликованном после обучения модели.

Что это значит для покупателя: чем старше и популярнее бенчмарк, тем меньше доверия к высокому баллу на нём. Результаты на свежих тестах и на закрытых наборах, задания которых не публикуются, говорят больше.

Вердикт: экзамен, вопросы которого лежат в открытом доступе несколько лет, проверяет в том числе память.

На экзамене модель работает в лучших условиях, чем будет у вас

Результат в таблице получен при определённых настройках, и они часто указаны мелким шрифтом в сноске или в техническом отчёте. Модели могут давать несколько попыток и засчитывать лучшую. Им могут разрешать долго рассуждать перед ответом, тратя на одну задачу в разы больше вычислений, чем в обычном использовании. Им могут давать доступ к инструментам — поиску, выполнению кода — которых у вас в продукте не будет.

Каждая такая настройка честно описана и законна для сравнения возможностей. Но она означает, что таблица показывает потолок модели, а не то, что вы получите при стандартном вызове через API с ограничением по стоимости и времени ответа.

Отдельный случай — задачи для агентов, например SWE-bench Verified: 500 проверенных людьми задач из реальных репозиториев с открытым кодом, где модель должна исправить ошибку в коде. Результат здесь сильно зависит не только от модели, но и от обвязки: как организован доступ к файлам, сколько шагов разрешено, как проверяется решение. Одна и та же модель в разных обвязках показывает заметно разные числа.

Вердикт: прежде чем сравнивать два числа, проверьте, что они получены в одинаковых условиях. Часто — нет.

Что проверяют популярные бенчмарки

Чтобы читать таблицы осмысленно, полезно понимать, что стоит за основными названиями и насколько каждый тест близок к задачам бизнеса.

БенчмаркЧто проверяетНасколько близко к задачам бизнеса
MMLUЗнания по 57 предметам, тест с вариантами ответаСлабо: почти насыщен, проверяет эрудицию, а не работу с вашими данными
GPQA Diamond198 экспертных вопросов по естественным наукамСлабо для большинства задач: показывает глубину рассуждений
HumanEvalНаписание небольших функций на PythonСредне для разработки, насыщен
SWE-bench VerifiedИсправление ошибок в реальных репозиторияхВысоко для программирования, но зависит от обвязки
Рейтинги по голосамКакой ответ люди предпочли в слепом сравненииСредне: отражает удобство ответов, но и их стиль
MERAНабор тестов на русском языкеВысоко для русскоязычных задач как первичный фильтр

Ни один бенчмарк из таблицы не проверяет то, что обычно нужно компании: как модель отвечает клиенту по базе знаний, извлекает поля из документов, оценивает разговор по чек-листу или ведёт диалог по сценарию. Для этих задач публичных тестов почти нет, и это не упущение индустрии: они слишком зависят от конкретных данных.

Рейтинг по голосам измеряет, какой ответ нравится

Отдельный класс сравнений — рейтинги, где пользователи задают модели вопрос, получают два ответа от анонимных моделей и выбирают лучший. Самый известный — LMArena, ранее Chatbot Arena. Из миллионов таких голосов строится рейтинг, похожий на шахматный.

Преимущество очевидно: вопросы задают живые люди, их невозможно заранее выучить, и оценивается то, что важно пользователю. Недостаток менее очевиден: люди выбирают ответ, который им больше нравится, а не тот, который точнее. Более длинные, лучше отформатированные и увереннее звучащие ответы получают преимущество, даже если содержат ошибку, которую голосующий не заметил.

Что это значит: высокое место в таком рейтинге хорошо предсказывает, что пользователям будет приятно общаться с моделью. Хуже — что модель будет права в задаче, где ошибку трудно заметить без проверки: в цифрах, юридических формулировках, фактах о продукте.

Вердикт: для чат-бота поддержки такой рейтинг полезен, для извлечения данных из договоров — почти нет.

Для русского языка нужны свои тесты

Подавляющее большинство известных бенчмарков — на английском. Модель, которая отлично решает англоязычный экзамен, может заметно хуже работать на русском: путать падежи в сложных конструкциях, неестественно строить фразы, хуже понимать разговорную речь, профессиональный жаргон и сокращения.

Для русскоязычных моделей существует бенчмарк MERA, созданный на площадке Альянса в сфере искусственного интеллекта при участии команд Сбера, MTS AI, Сколтеха и Высшей школы экономики. Он включает набор тестов на русском языке и открытый рейтинг моделей. Для первичного отбора под русскоязычную задачу это более релевантный ориентир, чем англоязычные таблицы. Как соотносятся российские модели и открытые альтернативы по другим критериям — доступности, хранению данных, стоимости, — разобрано в статье о российских LLM.

Есть и практический нюанс, который не отражает ни один бенчмарк: стоимость работы с русским текстом. Модели считают объём текста в токенах, и у разных моделей один и тот же русский текст разбивается на разное число токенов. При одинаковой цене за токен обработка русского текста у одной модели может обходиться заметно дороже, чем у другой.

Вердикт: англоязычный рейтинг для русскоязычной задачи — ориентир, а не аргумент.

Таблицу из пресс-релиза можно прочитать за две минуты

Когда выходит новая модель, вместе с ней выходит таблица сравнения. Пяти вопросов достаточно, чтобы понять, сколько в ней информации, а сколько маркетинга.

С какими версиями конкурентов сравнивают? Частый приём — сравнить свою новую модель с прошлой версией модели конкурента, вышедшей несколько месяцев назад. Формально всё верно, но вывод «мы лучше» относится к позавчерашнему дню.

Какие тесты выбраны, а каких нет? Разработчик сам решает, что показать. Если в таблице нет теста, который был в прошлом отчёте той же компании, стоит спросить почему. Иногда ответ скучный, иногда — модель на нём просела.

В каких условиях получены числа? Режим рассуждений, число попыток, доступ к инструментам. Сравнение модели в режиме долгих рассуждений с конкурентом в обычном режиме говорит о режиме, а не о модели.

Насколько велика разница? Разница в один-два пункта на насыщенном тесте не значит ничего. Разница в десять пунктов на свежем сложном тесте — повод присмотреться.

Есть ли независимые замеры? Результаты, воспроизведённые сторонними исследователями или открытыми рейтингами через несколько недель после релиза, весят больше, чем таблица в день выхода.

Вердикт: если на три вопроса из пяти ответа нет, таблица — это рекламный материал, а не измерение.

Ни один бенчмарк не измеряет вашу задачу

Главный вывод из всего сказанного: для выбора модели под задачу компании нужен собственный набор проверки. Не потому, что публичные тесты плохие, а потому, что они проверяют другое.

Свой набор проверки — это несколько десятков реальных примеров из работы компании с правильными ответами, на которых сравниваются модели-кандидаты. Для чат-бота поддержки — настоящие вопросы клиентов и ответы, которые считаются правильными. Для оценки звонков — расшифровки с оценкой, которую поставил опытный руководитель. Для извлечения данных — документы с заполненными вручную полями.

Такой набор решает сразу все проблемы публичных бенчмарков. Он не насыщен — модели его не видели. Он не загрязнён — его нет в интернете. Он проверяет русский язык с вашими терминами и сокращениями. И он запускается в тех условиях, в которых модель будет работать: с вашим запросом, вашими настройками и вашими ограничениями по времени и стоимости.

Вердикт: пятьдесят примеров из своей работы скажут о модели больше, чем таблица из технического отчёта на двадцати страницах.

Свой экзамен: пятьдесят примеров из вашей работы

Собрать набор проверки проще, чем кажется, и на это не нужны инженеры по машинному обучению. Нужен человек, который хорошо знает задачу, и неделя.

Отобрать примеры. От пятидесяти до ста реальных случаев, включая трудные: неоднозначные вопросы, редкие ситуации, некачественные данные. Набор только из простых примеров покажет, что все модели одинаково хороши, — и это будет неправдой.

Записать эталонные ответы. Для каждого примера — что считается правильным результатом. Если правильных ответов может быть несколько, записать критерии: что обязательно должно быть в ответе и чего быть не должно.

Прогнать модели-кандидаты в одинаковых условиях. Один и тот же запрос, одни и те же настройки, те же ограничения, что будут в продукте.

Оценить вслепую. Проверяющий не должен знать, какая модель дала какой ответ. Иначе ожидание от «самой сильной модели» влияет на оценку сильнее, чем кажется.

Посчитать не только точность. Долю правильных ответов, долю опасных ошибок — тех, что могут навредить клиенту или компании, — время ответа и стоимость одного вызова.

Как организовать проверку готового агента перед выпуском к клиентам, с наборами сценариев и критериями выпуска, — отдельная тема, она разобрана в статье о тестировании AI-агента. Набор проверки модели — её первая часть: он отвечает на вопрос, на какой модели вообще стоит строить.

Цена и скорость — тоже результат экзамена

В таблицах бенчмарков почти никогда нет двух чисел, которые в реальном продукте важны не меньше качества: стоимости одного ответа и времени, за которое он приходит.

Разница в стоимости между флагманской моделью и моделью попроще может составлять десятки раз. Если на вашем наборе проверки обе модели дают сопоставимое качество, выбор флагмана — это переплата без результата. А если флагман лучше на трудных примерах, но не отличается на простых, разумно разделить поток: простые запросы — дешёвой модели, сложные — дорогой. Почему руководителю важнее путь поручения, чем имя модели, разобрано в статье про агента-координатора.

Время ответа критично для задач в реальном времени. Голосовой агент, который думает четыре секунды перед каждой репликой, проигрывает агенту попроще, отвечающему за полсекунды, — даже если ответы первого умнее. Модели, которые долго рассуждают перед ответом, особенно сильны на бенчмарках и особенно неудобны там, где собеседник ждёт.

Вердикт: лучшая модель — не та, что выше в таблице, а самая дешёвая и быстрая из тех, что проходят ваш экзамен.

Что спросить подрядчика, который выбрал модель по таблице

Если выбор модели делает подрядчик, его аргументацию стоит проверить несколькими вопросами. Они быстро показывают, была ли проверка на задаче или только чтение таблиц.

  • На каких примерах из нашей работы сравнивались модели и сколько их было?
  • Какие модели сравнивались, кроме выбранной, и какие получились результаты?
  • Какая доля ошибок оказалась опасной, а не просто неточной?
  • Сколько будет стоить один ответ и сколько он будет занимать времени при нашем объёме?
  • Что будет, если через полгода выйдет модель лучше или дешевле: сколько стоит переход?

Подрядчик, который отвечает на первый вопрос ссылкой на публичный рейтинг, скорее всего, выбирал модель по популярности. Остальные критерии выбора исполнителя — в статье о том, как выбрать подрядчика по внедрению AI.

Последний вопрос особенно важен. Модели обновляются каждые несколько месяцев, и лидер таблицы меняется так же часто. Решение, жёстко привязанное к одной модели, стареет вместе с ней. Решение, в котором есть собственный набор проверки, позволяет за день проверить новую модель и перейти на неё, если она лучше.

Итоговое правило

Публичные бенчмарки — хороший инструмент для одной задачи: понять, какие модели в принципе находятся на переднем крае и какие безнадёжно отстали. Для выбора модели под работу компании у них три системных недостатка: они насыщены, могут быть загрязнены и проверяют не вашу задачу в не ваших условиях.

Правило выбора укладывается в одну фразу: таблица сужает список до трёх-четырёх кандидатов, решение принимается на пятидесяти примерах из вашей работы с учётом стоимости и скорости. Всё остальное — маркетинг, иногда очень убедительный.

И последнее, о чём полезно помнить, читая очередную таблицу к очередному релизу: её составил разработчик модели, который выбирал, какие тесты в неё включить. Независимые замеры обычно появляются через несколько недель — и нередко показывают картину поскромнее.

Частые вопросы

Если не нашли ответа — напишите нам в Telegram, ответим за 15 минут.

Стандартный набор заданий с известными правильными ответами, на котором разные модели сравнивают по доле верных решений. Бенчмарк показывает, как модель сдаёт конкретный экзамен, но не как она справится с задачей конкретной компании.
Только для первичного отбора. Популярные тесты почти насыщены, их задания могли попасть в обучающие данные, а результаты получены в лучших для модели условиях. Окончательный выбор стоит делать на наборе из 50–100 примеров из работы компании.
Для первичного отбора русскоязычных моделей — MERA, созданный на площадке Альянса в сфере искусственного интеллекта. Англоязычные бенчмарки не показывают качество работы с русским языком, профессиональным жаргоном и разговорной речью.
Отобрать 50–100 реальных примеров, включая трудные, записать эталонные ответы или критерии, прогнать модели-кандидаты в одинаковых условиях, оценить ответы вслепую и посчитать долю опасных ошибок, стоимость и время ответа.

Проверим модели на ваших задачах

Соберём набор проверки из ваших разговоров и документов и покажем, какая модель справляется лучше при вашей цене и скорости.

Разберём ваши звонкиПилот бесплатно
Обсудить задачу