Главное про AI - Вадим Жартун
ТИПОЛОГИЯ БЕНЧМАРКОВ ДЛЯ БОЛЬШИХ ЯЗЫКОВЫХ МОДЕЛЕЙ
Massive Multitask Language Understanding, MMLU, появился в 2020 году как попытка измерить «широту знаний» модели. Внутри — 57 предметов: от элементарной математики и американской истории до права, медицины и компьютерных наук. Формат — multiple choice (закрытый вопрос с выбором из нескольких вариантов), четыре варианта ответа, как в американских SAT (Scholastic Assessment Test — стандартизированный тест для поступления в вуз) или GRE (Graduate Record Examinations — экзамен для поступающих в магистратуру и аспирантуру). В оригинальной версии — около 16 000 вопросов, собранных в основном из открытых экзаменационных материалов. На сайте Stanford CRFM (Stanford Center for Research on Foundation Models — Стэнфордский центр исследований фундаментальных моделей, 2020) про MMLU сказано прямо: «multiple-choice question answering test that covers 57 tasks including elementary mathematics, US history, computer science, law, and more» — в переводе: «тест с выбором ответа, охватывающий 57 задач, от элементарной математики и истории США до компьютерных наук, права и других».
MMLU не творческий тест. Это распознавание правильного варианта из четырёх. Чтобы получить высокий балл, модель должна в среднем хорошо угадывать правильный ответ. Ближе к тесту на эрудицию, чем к проверке способности решать рабочую задачу. MMLU стал де-факто стандартом «общего интеллекта» — и одновременно самым обманчивым тестом для не-исследователя. Высокий балл ещё не говорит, что модель справится с вашей задачей.
HumanEval, выпущенный OpenAI в 2021 году, — это 164 коротких задачи на Python. Каждая задача даёт сигнатуру функции, docstring с описанием поведения и набор скрытых юнит-тестов, а метрика pass@k означает, что модель генерирует k решений, и задача засчитывается, если хотя бы одно прошло все тесты. На странице IBM Think по HumanEval сказано, что HumanEval измеряет функциональную корректность через метрику pass@k — это проверка «код запускается и даёт правильный вывод», а не «код красиво написан» или «код поддерживается в долгую». У HumanEval есть структурная проблема, важная для офисного работника: задачи короткие, каждая умещается в одну функцию, контекст минимальный, и это тест на «синтаксическую и логическую мелочь», а не на способность модели разобраться в вашей кодовой базе из 200 000 строк.
В 2024–2025 годах отрасль сместилась к SWE-bench Verified — там задача уже настоящая: реальный GitHub-баг в реальном репозитории. Princeton выпустил SWE-bench в 2023-м: 2 294 задачи из реальных GitHub-issues в популярных Python-репозиториях (Django, Flask, pytest, scikit-learn и др.). Модель получает кодовую базу и issue, должна сгенерировать патч, который закроет issue и пройдёт существующие тесты. В 2024 году OpenAI и Princeton выпустили «Verified» — отфильтрованную человеком подвыборку из 500 задач. Из исходного набора убрали всё, что модель не может корректно оценить; на сайте SWE-bench: «Verified is a human-filtered subset of 500 instances» — в переводе: «проверенная человеком подвыборка из 500 задач».
SWE-bench Verified — золотой стандарт для оценки кодинга. Задача близка к реальной работе инженера: открыть issue, понять контекст, починить. И для офисного читателя здесь критическая деталь: SWE-bench Verified измеряет способность модели работать с существующим кодом в реальной кодовой базе. Это совсем другой навык, чем «написать функцию с нуля по docstring». Если ваша компания внедряет AI-ассистента для существующего кода, SWE-bench Verified предскажет результат лучше, чем HumanEval.
GSM8K — это 8 500 школьных математических задач, собранных OpenAI в 2021 году. Задачи требуют пошагового рассуждения (chain of thought): модель должна сначала расписать ход решения, а потом дать числовой ответ. На странице датасета на Hugging Face описание: GSM8K (Grade School Math 8K) — это 8,5 тысячи разнообразных по формулировкам школьных математических задач. К 2024–2025 годам лучшие модели набрали на GSM8K больше 95%.
Scale AI в 2024-м выпустила параллельный бенчмарк GSM1K — тысячу новых задач, написанных людьми без помощи LLM. Цель: исключить контаминацию, то есть попадание задач или их близких аналогов в обучающие данные модели.
На GSM1K модели стабильно просели на 8–13 процентных пунктов. Практический вывод неприятный. Если вы видите в маркетинге модели «99% на GSM8K», это скорее характеристика того, насколько хорошо модель «выучила» конкретный набор задач, чем её реальной способности решать похожие, но новые. Контаминация — системная болезнь всех публичных бенчмарков.
Stanford CRFM в 2022 году выпустил HELM (Holistic Evaluation of Language Models) — не один бенчмарк, а фреймворк, где вместо одной цифры считаются 7 метрик (точность, accuracy; калибровка, calibration; устойчивость, robustness; справедливость, fairness; предвзятость, bias; токсичность, toxicity; эффективность, efficiency) на 42 сценариях. Лидер проекта Перси Лян (Percy Liang) с командой из примерно 50 человек прогнали через HELM 30 заметных моделей. На сайте HELM этот проект назван живым бенчмарком для прозрачности языковых моделей — постоянно обновляемой публичной инфраструктурой.
HELM важен другим. Он показывает другую философию оценки. Вместо вопроса «какая модель первая по среднему баллу» — «у какой модели лучше баланс по всем важным для внедрения метрикам». Для офисного внедрения это ближе к реальности: вас волнует не только точность, но и насколько предсказуемо модель ошибается, насколько она устойчива к провокационным запросам и сколько это стоит.
Четыре бенчмарка, которые чаще всего встречаются в маркетинге моделей, сведены в таблицу ниже — с годом выпуска и слабостью каждого.

Слабость всех четырёх — узкая специализация. Каждый измеряет одну способность. Для офисной задачи нужно смотреть на свой набор, а не на топ рейтинга.
БЕНЧМАРКИ ПРОТИВ ОФИСНОЙ РЕАЛЬНОСТИ
Ниже — шесть типовых офисных задач и какой бенчмарк (если он вообще есть) ближе к каждой.
1: Суммаризировать длинный документ — человеческая оценка на своём наборе и косвенно RULER (бенчмарк для оценки работы с длинным контекстом), потому что суммаризация — это качество, а не задача с правильным ответом, и MMLU с GSM8K её не измеряют.
2: Ответить на письмо клиента в нужном тоне — Chatbot Arena Elo и свой оценочный набор, потому что тон — это человеческая оценка, не multiple choice, и HumanEval с MMLU на стиль не смотрят.
3: Сделать простой SQL-запрос по описанию — HumanEval как прокси и свой оценочный набор, потому что задача близка к «написать функцию», а GSM8K и MMLU не помогут.
4: Посчитать скидку по таблице — GSM8K как прокси и проверка на своих задачах, потому что пошаговая арифметика — это GSM8K, но без проверки на своих числах доверять нельзя.
5: Перевести документ с английского — свой оценочный набор с экспертом-переводчиком, потому что качество