Главное про AI - Вадим Жартун
6: Разобрать входящий PDF и вытащить сущности — MMLU как прокси на понимание текста и свой оценочный набор, потому что нужна комбинация OCR (распознавания текста с картинки) и рассуждения, и ни один из четырёх не покрывает это напрямую.
Эти шесть пунктов показывают суть: для большинства офисных задач ни один публичный бенчмарк не даёт прямого ответа. Свой набор закрывает разрыв. Только он.
ДОВЕРИЕ К БЕНЧМАРКУ: УСЛОВИЯ И ОГОВОРКИ
Бенчмарк предсказывает ваш результат, если одновременно выполнены четыре условия:
1: Задачи в бенчмарке похожи на ваш случай по структуре — формат, длина контекста, тип ответа — и метрика считает то, что вам важно. Не «доля правильных ответов в тестах с выбором ответа» (MCQ, multiple choice question), а «процент задач, где результат пригоден для отправки клиенту».
2: Тестовый набор чист от контаминации.
3: Бенчмарк ещё не насыщен (разница между лидерами статистически значима, а не «91% против 92%») и регулярно обновляется. Иначе модели учат его наизусть.
4: Метрика измеряет то, что связано с вашей задачей, а не постороннюю способность.
Хотя бы одно условие не выполнено — бенчмарк показывает красивую цифру без всякого отношения к вашему офису.
Четыре признака «мёртвого» бенчмарка.
1: Топ-5 моделей выдают результаты в диапазоне 1–2 процентных пункта — разница не различима за пределами шума.
2: Бенчмарк не обновлялся 2+ года — за это время его вопросы попали в обучающие данные всех крупных моделей.
3: Метрика измеряет то, что не связано с реальной задачей (например, тест с выбором ответа по праву для ассистента, который должен переписываться с клиентом).
4: Публичные результаты расходятся с числами, которые вендор заявляет сам, на 5+ пунктов в одну или другую сторону.
Если вы видите хотя бы два признака из четырёх, бенчмарку доверять нельзя. Ориентиром становится свой оценочный набор.
Что показывает Chatbot Arena, а что — нет. Chatbot Arena (от LMSYS, Lab for Machine Learning and Systems at UC Berkeley — лаборатория Беркли) — самый цитируемый лидерборд по «человеческому рейтингу», где пользователи в слепом сравнении голосуют за ответ А или Б, а рейтинг считается через систему Эло по сумме миллионов диалогов.
Показывает Arena общую «человеческую» привлекательность ответа — тон, структуру, полноту. Не показывает точность в задачах с единственным правильным ответом (арифметика, код, юридические ссылки), устойчивость к граничным случаям (edge case, нестандартным входным данным, на которых модели часто ломаются), устойчивость к попыткам взлома через запрос (jailbreak) и стабильность на длинном контексте.
В 2025 году опубликована работа, показывающая, что рейтинг можно сместить целенаправленным голосованием. Это последний аргумент в пользу собственного оценочного набора: чужие цифры можно исказить, свои — сложнее.
Классы задач, которые не покрывает ни один популярный бенчмарк.
1: Работа с таблицами и числами из вашей корпоративной базы (нужен RAG — поиск ответов модели по вашей базе документов — и свой оценочный набор).
2: Генерация длинных связных документов на 10+ страниц (бенчмарки смотрят на короткие ответы).
3: Следование вашему внутреннему тону голоса бренда и шаблонам (бенчмарки не знают ваш стиль).
4: Соблюдение ваших нормативных ограничений — юридических, отраслевых, внутренних.
5: Многошаговые agent-сценарии, где модель должна планировать, вызывать инструменты и откатываться.
Прежде чем доверять бенчмарку, проверьте семь вещей.
1: Дата сбора датасета и дата обучения модели — пересекаются ли (если да, контаминация почти гарантирована).
2: Тип оценки: multiple choice, генерация, человеческий Эло, LLM-as-a-Judge — разные шкалы нельзя сравнивать напрямую.
3: Размер выборки: 164 задачи (HumanEval) — это статистически хрупко, 8 500 (GSM8K) — плотнее.
4: Метод подсчёта: pass@1, pass@k, accuracy, F1, Brier — не путать.
5: Self-reported против независимого замера: разница в 5+ пунктов — красный флаг.
6: Способ подачи запроса: ввод без примеров, с примерами в самом запросе, с просьбой рассуждать по шагам, с системным запросом или без — меняет результат радикально.
7: Стоимость прогона: на дорогих моделях один прогон может стоить сотни долларов.
Модель, которая отлично сдала MMLU, HumanEval и GSM8K, доказала только одно: она умеет решать задачи этого типа «в вакууме» — короткие, с чётким форматом и эталонным ответом. Это ничего не говорит о том, как она поведёт себя в реальном офисе — с грязными данными, неполным контекстом, прерванным разговором, нечёткой постановкой задачи. Если нанять по результатам единого госэкзамена, можно получить отличника, который не умеет вести переговоры. Высокий балл на бенчмарке — пропуск в следующий тур отбора. Не гарантия работы.
Насыщенный бенчмарк — линейка с делением только до 90 сантиметров. Когда 99% моделей набирают больше 90% на GSM8K, разница между «отличной» и «средней» моделью становится невидимой, как рост человека выше 190 см на линейке, где последнее деление — 90. Линейка не врёт, но она больше не различает. MMLU, HumanEval и GSM8K к 2026 году превратились в инструмент «отсева слабых моделей», а не ранжирования сильных. Для сравнения топ-моделей нужны более длинные линейки — SWE-bench Verified, GPQA Diamond, Humanity’s Last Exam.
СЛЕПЫЕ ЗОНЫ БЕНЧМАРКОВ И ЦЕННОСТЬ СОБСТВЕННЫХ МЕТРИК
Бенчмарки измеряют то, что легко автоматизировать: наличие правильного ответа, скорость работы, объём памяти. Не измеряют то, что в офисной работе критично: тон, стиль, уместность, этические границы, устойчивость к необычному запросу.
Эмили Бендер (Emily M. Bender) с соавторами в работе 2021 года «On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?» поставила вопрос жёстко: риски LLM смягчаются, если заранее заложить бюджет на курирование и документацию и не создавать датасеты больше, чем можно качественно поддерживать. Бенчмарки измеряют, насколько хорошо модель имитирует «правильные ответы» в выборке, на которой она обучалась. Это не то же самое, что понимание. Stochastic parrots — термин из этой работы, ставший символом критического взгляда на метрики LLM.
Четыре области, которые остаются за пределами стандартных метрик.
1: Креативность. Способность сгенерировать неожиданный, но релевантный ответ не измеряется ни одним публичным бенчмарком. Модель может набрать 95% на MMLU и выдавать пресные тексты — при обучении её оптимизировали на правдоподобие, а не на оригинальность.
2: Этика. Стремление отказаться от этически сомнительного (по мнению создателей модели) запроса — неизмеримая метрика. Универсального теста на «хорошее поведение» нет. Есть только наборы сценариев, которые вендор сам выбирает.
3: Актуальность знаний. Бенчмарк фиксирует знания на момент сбора датасета. Если модель обучена на данных до 2023 года, она не ответит на вопрос