Nazir's website

Как читать бенчмарки LLM

17 февраля 2026

Каждую неделю кто-то выпускает новую модель, и каждая “побеждает на бенчмарках”. OpenAI публикует таблицу где они впереди планеты всей, Anthropic - свою таблицу где лидируют они, Google - третью где побеждает Gemini. Маркетинговые войны в чистом виде. Но если копнуть глубже - бенчмарки реально полезная штука, просто нужно понимать что они измеряют и чему верить.

Что вообще такое бенчмарк

Бенчмарк - это стандартизированный экзамен для AI-моделей. Набор задач с известными правильными ответами, по которым можно сравнивать разные модели между собой. Идея простая: дали 1000 вопросов, посчитали процент правильных - вот и результат.

Проблема в том, что бенчмарков развелось десятки, каждый измеряет что-то своё, и не все одинаково надёжны. Разберём что к чему.

Главные категории

Все бенчмарки можно разбить на несколько больших групп:

Бенчмарки которые стоит знать

MMLU-Pro (Massive Multitask Language Understanding)
Тест на общую эрудицию: 57 предметов от элементарной математики до права, медицины и философии. Формат - multiple choice, но в Pro-версии не 4 варианта ответа, а 10, что сильно усложняет угадывание. Топовые модели сейчас набирают около 89-90% (лидирует Gemini 3 Pro с 90.1%). Полезен как базовый фильтр качества, но уже близок к насыщению - все сильные модели показывают похожие результаты в узком диапазоне.

GPQA Diamond (Graduate-Level Google-Proof Q&A)
Вопросы уровня аспирантуры по физике, химии и биологии. Название “Google-proof” означает что ответы нельзя просто нагуглить - нужно реально понимать материал на глубоком уровне. Важный контекст: эксперты с PhD в соответствующих областях набирают около 65%, а обычные люди с хорошим образованием - всего 34%. Когда бенчмарк только вышел, GPT-4 набирал 39%. Сейчас топовые модели перевалили за 78%. Один из лучших тестов на глубину понимания, а не просто запоминание фактов.

SWE-bench Verified
Пожалуй, самый практичный бенчмарк для тех кто работает с кодом. Это реальные GitHub issues из популярных open-source проектов - модель должна прочитать описание бага, разобраться в кодовой базе и сгенерировать патч который его фиксит. Не абстрактные алгоритмические задачки, а настоящая работа программиста с контекстом, зависимостями и легаси-кодом. Лидеры сейчас - Claude Opus 4.5 с 80.9% и GPT-5.2 с 80%. Интересно что на более сложной версии SWE-bench Pro те же модели набирают только ~23% - есть куда расти.

MATH
Математические задачи от школьного уровня до олимпиадного. Важно что это не просто “посчитай 2+2”, а задачи требующие цепочки рассуждений: алгебра, геометрия, теория вероятностей, комбинаторика. Хороший индикатор reasoning-способностей модели.

Chatbot Arena (LMSYS)
Отдельная история и, возможно, самый честный бенчмарк из всех. Работает просто: реальные пользователи задают вопрос двум анонимным моделям, видят оба ответа и выбирают какой лучше. Из миллионов таких голосов строится ELO-рейтинг как в шахматах. Сейчас на вершине Gemini 3 Pro с рейтингом 1492 и Claude Opus 4.6. Главное преимущество - этот бенчмарк нельзя “заоптимизировать”, потому что это буквально предпочтения живых людей на реальных задачах.

ARC-AGI
Бенчмарк который AI до сих пор не может нормально решить. Это тесты на абстрактное мышление: показывают несколько примеров трансформации сетки (вход → выход), нужно понять паттерн и применить к новому входу. Звучит просто, но требует способности к обобщению которая у современных LLM пока слабая. Важен как индикатор фундаментальных ограничений текущих архитектур.

Humanity’s Last Exam (HLE)
Новейший frontier-бенчмарк для по-настоящему сложных задач. Вопросы собраны от экспертов мирового уровня из разных областей - от квантовой физики до лингвистики древних языков. Идея в том, что если модель не может ответить на эти вопросы, её точно нельзя доверять для серьёзной экспертной работы без человеческого контроля.

Почему нельзя просто верить цифрам

Data contamination
Главная головная боль индустрии. Если тестовые вопросы случайно попали в обучающие данные, модель их просто “помнит”, а не решает. Чем старше и популярнее бенчмарк, тем выше вероятность утечки в training data. Поэтому появляются обновлённые версии: MMLU → MMLU-Pro, LiveBench который обновляется каждый месяц свежими вопросами.

Оптимизация под метрики
Компании активно тюнят модели под конкретные бенчмарки - это факт жизни. 95% на каком-то тесте может означать что модель натаскали именно на этот формат задач, а на ваших реальных кейсах она будет работать хуже.

Разрыв между числами и практикой
Модель может блестяще решать задачки из бенчмарков, но при этом плохо следовать сложным инструкциям, генерировать странный текст или галлюцинировать факты. Стандартные бенчмарки не измеряют “вайб”, удобство работы и практическую полезность для конкретных задач.

Что с этим делать на практике

Не фиксируйтесь на одном числе. Смотрите на несколько бенчмарков в категории которая важна именно вам. Нужен код? SWE-bench важнее MMLU. Нужны общие знания? Смотрите MMLU-Pro и GPQA вместе.

Chatbot Arena - хороший ориентир для общего качества. Если модель высоко в этом рейтинге, скорее всего она будет хороша для большинства обычных задач.

Свежие бенчмарки надёжнее старых. GPQA, MMLU-Pro, LiveBench, HLE - там меньше шансов на contamination чем в классических тестах пятилетней давности.

Лучший бенчмарк - ваши собственные задачи. Возьмите 20-30 реальных примеров из вашей работы и прогоните через несколько моделей. Это покажет больше чем любые публичные таблицы, потому что измеряет именно то что вам нужно.

Полезные ресурсы

Оригинал на русском в моём телеграме.

← все посты