Knigi-for.me

Главное про AI - Вадим Жартун

Тут можно читать бесплатно Главное про AI - Вадим Жартун. Жанр: Прочее издательство , год . Так же Вы можете читать полную версию (весь текст) онлайн без регистрации и SMS на сайте knigi-for.me (knigi for me) или прочесть краткое содержание, предисловие (аннотацию), описание и ознакомиться с отзывами (комментариями) о произведении.
перевода — отдельный навык, и все перечисленные бенчмарки англоцентричны и text-only.

6: Разобрать входящий PDF и вытащить сущности — MMLU как прокси на понимание текста и свой оценочный набор, потому что нужна комбинация OCR (распознавания текста с картинки) и рассуждения, и ни один из четырёх не покрывает это напрямую.

Эти шесть пунктов показывают суть: для большинства офисных задач ни один публичный бенчмарк не даёт прямого ответа. Свой набор закрывает разрыв. Только он.

ДОВЕРИЕ К БЕНЧМАРКУ: УСЛОВИЯ И ОГОВОРКИ

Бенчмарк предсказывает ваш результат, если одновременно выполнены четыре условия:

1: Задачи в бенчмарке похожи на ваш случай по структуре — формат, длина контекста, тип ответа — и метрика считает то, что вам важно. Не «доля правильных ответов в тестах с выбором ответа» (MCQ, multiple choice question), а «процент задач, где результат пригоден для отправки клиенту».

2: Тестовый набор чист от контаминации.

3: Бенчмарк ещё не насыщен (разница между лидерами статистически значима, а не «91% против 92%») и регулярно обновляется. Иначе модели учат его наизусть.

4: Метрика измеряет то, что связано с вашей задачей, а не постороннюю способность.

Хотя бы одно условие не выполнено — бенчмарк показывает красивую цифру без всякого отношения к вашему офису.

Четыре признака «мёртвого» бенчмарка.

1: Топ-5 моделей выдают результаты в диапазоне 1–2 процентных пункта — разница не различима за пределами шума.

2: Бенчмарк не обновлялся 2+ года — за это время его вопросы попали в обучающие данные всех крупных моделей.

3: Метрика измеряет то, что не связано с реальной задачей (например, тест с выбором ответа по праву для ассистента, который должен переписываться с клиентом).

4: Публичные результаты расходятся с числами, которые вендор заявляет сам, на 5+ пунктов в одну или другую сторону.

Если вы видите хотя бы два признака из четырёх, бенчмарку доверять нельзя. Ориентиром становится свой оценочный набор.

Что показывает Chatbot Arena, а что — нет. Chatbot Arena (от LMSYS, Lab for Machine Learning and Systems at UC Berkeley — лаборатория Беркли) — самый цитируемый лидерборд по «человеческому рейтингу», где пользователи в слепом сравнении голосуют за ответ А или Б, а рейтинг считается через систему Эло по сумме миллионов диалогов.

Показывает Arena общую «человеческую» привлекательность ответа — тон, структуру, полноту. Не показывает точность в задачах с единственным правильным ответом (арифметика, код, юридические ссылки), устойчивость к граничным случаям (edge case, нестандартным входным данным, на которых модели часто ломаются), устойчивость к попыткам взлома через запрос (jailbreak) и стабильность на длинном контексте.

В 2025 году опубликована работа, показывающая, что рейтинг можно сместить целенаправленным голосованием. Это последний аргумент в пользу собственного оценочного набора: чужие цифры можно исказить, свои — сложнее.

Классы задач, которые не покрывает ни один популярный бенчмарк.

1: Работа с таблицами и числами из вашей корпоративной базы (нужен RAG — поиск ответов модели по вашей базе документов — и свой оценочный набор).

2: Генерация длинных связных документов на 10+ страниц (бенчмарки смотрят на короткие ответы).

3: Следование вашему внутреннему тону голоса бренда и шаблонам (бенчмарки не знают ваш стиль).

4: Соблюдение ваших нормативных ограничений — юридических, отраслевых, внутренних.

5: Многошаговые agent-сценарии, где модель должна планировать, вызывать инструменты и откатываться.

Прежде чем доверять бенчмарку, проверьте семь вещей.

1: Дата сбора датасета и дата обучения модели — пересекаются ли (если да, контаминация почти гарантирована).

2: Тип оценки: multiple choice, генерация, человеческий Эло, LLM-as-a-Judge — разные шкалы нельзя сравнивать напрямую.

3: Размер выборки: 164 задачи (HumanEval) — это статистически хрупко, 8 500 (GSM8K) — плотнее.

4: Метод подсчёта: pass@1, pass@k, accuracy, F1, Brier — не путать.

5: Self-reported против независимого замера: разница в 5+ пунктов — красный флаг.

6: Способ подачи запроса: ввод без примеров, с примерами в самом запросе, с просьбой рассуждать по шагам, с системным запросом или без — меняет результат радикально.

7: Стоимость прогона: на дорогих моделях один прогон может стоить сотни долларов.

Модель, которая отлично сдала MMLU, HumanEval и GSM8K, доказала только одно: она умеет решать задачи этого типа «в вакууме» — короткие, с чётким форматом и эталонным ответом. Это ничего не говорит о том, как она поведёт себя в реальном офисе — с грязными данными, неполным контекстом, прерванным разговором, нечёткой постановкой задачи. Если нанять по результатам единого госэкзамена, можно получить отличника, который не умеет вести переговоры. Высокий балл на бенчмарке — пропуск в следующий тур отбора. Не гарантия работы.

Насыщенный бенчмарк — линейка с делением только до 90 сантиметров. Когда 99% моделей набирают больше 90% на GSM8K, разница между «отличной» и «средней» моделью становится невидимой, как рост человека выше 190 см на линейке, где последнее деление — 90. Линейка не врёт, но она больше не различает. MMLU, HumanEval и GSM8K к 2026 году превратились в инструмент «отсева слабых моделей», а не ранжирования сильных. Для сравнения топ-моделей нужны более длинные линейки — SWE-bench Verified, GPQA Diamond, Humanity’s Last Exam.

СЛЕПЫЕ ЗОНЫ БЕНЧМАРКОВ И ЦЕННОСТЬ СОБСТВЕННЫХ МЕТРИК

Бенчмарки измеряют то, что легко автоматизировать: наличие правильного ответа, скорость работы, объём памяти. Не измеряют то, что в офисной работе критично: тон, стиль, уместность, этические границы, устойчивость к необычному запросу.

Эмили Бендер (Emily M. Bender) с соавторами в работе 2021 года «On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?» поставила вопрос жёстко: риски LLM смягчаются, если заранее заложить бюджет на курирование и документацию и не создавать датасеты больше, чем можно качественно поддерживать. Бенчмарки измеряют, насколько хорошо модель имитирует «правильные ответы» в выборке, на которой она обучалась. Это не то же самое, что понимание. Stochastic parrots — термин из этой работы, ставший символом критического взгляда на метрики LLM.

Четыре области, которые остаются за пределами стандартных метрик.

1: Креативность. Способность сгенерировать неожиданный, но релевантный ответ не измеряется ни одним публичным бенчмарком. Модель может набрать 95% на MMLU и выдавать пресные тексты — при обучении её оптимизировали на правдоподобие, а не на оригинальность.

2: Этика. Стремление отказаться от этически сомнительного (по мнению создателей модели) запроса — неизмеримая метрика. Универсального теста на «хорошее поведение» нет. Есть только наборы сценариев, которые вендор сам выбирает.

3: Актуальность знаний. Бенчмарк фиксирует знания на момент сбора датасета. Если модель обучена на данных до 2023 года, она не ответит на вопрос


Вадим Жартун читать все книги автора по порядку

Вадим Жартун - все книги автора в одном месте читать по порядку полные версии на сайте онлайн библиотеки kniga-for.me.