Knigi-for.me

Главное про AI - Вадим Жартун

Тут можно читать бесплатно Главное про AI - Вадим Жартун. Жанр: Прочее издательство , год . Так же Вы можете читать полную версию (весь текст) онлайн без регистрации и SMS на сайте knigi-for.me (knigi for me) или прочесть краткое содержание, предисловие (аннотацию), описание и ознакомиться с отзывами (комментариями) о произведении.
на инструкции по запросу (JIT-инструкции, just-in-time — подгружаются в момент запроса, а не хранятся в системном промпте постоянно), потому что иначе системный промпт превращался в нечитаемую свалку частных случаев. McKinsey с Lilli пошли по похожему пути: внутри компании Lilli — это навык, который грузится по триггеру «помоги с клиентским исследованием», и она умеет обращаться к 100 тысячам внутренних документов, накопленных фирмой за 60 лет. Это не «написали большой системный промпт с перечислением всех документов». Это skill + RAG (Retrieval-Augmented Generation — модель сначала ищет релевантные фрагменты во внешней базе знаний, потом формирует ответ) + рабочий процесс.

Правило для офисного работника: промпт стабильно работает на 8+ примерах из 10 — задача не переросла промпт. Запускаете вручную больше 5 раз в неделю — пора оформлять навык. Навык используют 3+ человека или 30+ раз в неделю — пора думать о воркфлоу. Каждый переход — отдельное решение, не «давайте сразу воркфлоу, потому что так солиднее».

Каждый уровень оправдан, когда переход к нему отражает реальную частоту задачи, а не амбиции. Ручной шуруповёрт нужен, чтобы закрутить один шуруп. Станок — чтобы закручивать один и тот же шуруп в одном и том же месте каждый день. Конвейер — когда станок не успевает за спросом и шурупы надо закручивать тысячами в час. Проблема в том, что новички часто покупают конвейер, чтобы закрутить один шуруп. Обслуживать конвейер, чинить, перенастраивать, оплачивать электричество обходится дороже, чем сто раз взять шуруповёрт в руки.

FEW-SHOT: ОБУЧЕНИЕ МОДЕЛИ НА НЕСКОЛЬКИХ ПРИМЕРАХ

Few-shot — это приём, при котором в системный промпт добавляются несколько пар «вход — выход», чтобы модель увидела желаемый формат, метки и стиль. Модель не учится на этих примерах в привычном смысле. Она подстраивает своё поведение под форму, которую видит прямо сейчас в диалоге. Это как если бы новый сотрудник в первый день посмотрел три ваших письма клиенту и на четвёртом написал в той же интонации, с теми же формулами, с тем же уровнем формальности. Никакого переобучения, никакой магии — просто очень сильная имитация паттерна.

Anthropic прямо пишет: для LLM примеры — это «картинки, стоящие тысячи слов». Одно изображение объясняет больше, чем абзац определений.

ПРОИСХОЖДЕНИЕ ТЕРМИНА: GPT-3 КАК ТОЧКА ОТСЧЁТА

Термин few-shot в том смысле, в котором мы его сейчас используем, ввели Brown и соавторы в июле 2020 года в статье «Language Models are Few-Shot Learners» (arXiv:2005.14165) про GPT-3. До этого инженеры использовали словосочетание «in-context learning» — обучение в контексте, без обновления весов модели. Brown формализовали разницу между zero-shot (модель видит только инструкцию), one-shot (один пример) и few-shot (несколько примеров в контексте).

В их собственных экспериментах few-shot стабильно бил zero-shot на десятках бенчмарков: перевод, ответы на вопросы, заполнение пропусков, рассуждения. Парадокс, который они же подсветили: чем больше модель, тем сильнее эффект от few-shot, но и тем меньше нужно примеров. GPT-3 на 175 миллиардов параметров с десятью примерами обходил fine-tuned (дообученные на узкой задаче) модели меньшего размера, обученные на тысячах.

С тех пор каждый серьёзный гайд по промпт-инжинирингу начинается с few-shot как базовой техники.

КОНТРИНТУИТИВНЫЙ ВЫВОД 2022 ГОДА О НАЗНАЧЕНИИ ПРИМЕРОВ

Севон Мин (Sewon Min) и команда из Вашингтонского университета в EMNLP 2022 выпустили работу «Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?», которая перевернула интуицию. Как мы уже обсуждали в разделе про блок «Примеры», в задачах классификации с ограниченным набором классов главное в примере не «правильный ответ», а карта пространства «вход → метка».

Когда метки в примерах заменяли на случайные, точность падала, но не катастрофически. А вот когда перемешивали метки между классами или убирали входной текст и оставляли только метки, точность падала заметно. Из этого простой вывод: в ваших few-shot примерах разнообразие входов важнее, чем вылизанность выходов. Лучше пять разных кейсов из реальной почты, чем пять идеально отредактированных образцов из методички.

ОПТИМАЛЬНОЕ ЧИСЛО ПРИМЕРОВ: ЭМПИРИКА ПО СЕМИ МОДЕЛЯМ

По данным работы «The Few-shot Dilemma: Over-prompting Large Language Models» команды из Siemens AG и Мюнхенского технического университета (сентябрь 2025), для каждой модели существует свой оптимум, и превышение его деградирует точность. GPT-4o даёт максимум на 5–10 примерах, а на 20 уже проседает. LLaMA-3.1-8B-instruct — оптимум 10–20 примеров, потом спад.

Самое практичное: TF-IDF-отбор примеров (по текстовому сходству с целевой задачей — это простой статистический метод, который оценивает важность слова в документе через частоту в нём и редкость во всей коллекции) бьёт случайную выборку и эмбеддинг-отбор (выбор примеров по близости векторных представлений текстов) в большинстве сценариев. Их итоговая модель с 10–20 примерами, отобранными через TF-IDF, превзошла state-of-the-art fine-tuned BERT на 1% по F1 (гармоническому среднему точности и полноты — метрике, которая штрафит модели, если они хороши только в чём-то одном). Цифра скромная, но вывод жёсткий: «больше примеров» — это не то же самое, что «лучший результат». Миф «чем длиннее промпт, тем лучше» получил формальное опровержение на семи моделях.

СОРТИРОВКА ВХОДЯЩИХ ПИСЕМ: PREFILL ЗАДАЁТ ФОРМАТ JSON

Задача из реальной практики: модель должна была классифицировать входящие письма по 11 категориям — претензия, запрос акта, запрос справки, оферта и так далее. Без few-shot лучший результат был 76% точности. С тремя примерами на категорию (33 примера) стало 89%. С пятнадцатью примерами на категорию (165 примеров) стало 84% — хуже, чем с тремя. Результат перепроверяли трижды, ошибки в подсчёте не было.

Модель начала «переобучаться на примерах»: ловила не категорию, а конкретные слова-маркеры из примеров и пропускала синонимы. После отсева лишних примеров и оставления 3–5 разнообразных на категорию точность зафиксировалась на 91%.

Этот кейс — маленькая иллюстрация того, что Min и команда показали теоретически, а Tang с коллегами доказали на семи моделях: примеров должно быть столько, чтобы покрыть пространство входов, а не столько, чтобы влезло в токен-бюджет (количество токенов, которое клиент готов потратить на один запрос, у каждого провайдера и тарифа он свой).

РЕКОМЕНДАЦИИ ANTHROPIC ИЗ ОФИЦИАЛЬНОГО ГАЙДА ПО FEW-SHOT

Anthropic в Effective Context Engineering для AI-агентов и в Claude Prompting Best Practices формулирует четыре практических правила.

Количество: 1–5 примеров могут резко улучшить результат, больше пяти — только по необходимости, не по привычке. Разнообразие: разнообразные, канонические примеры, эффективно отражающие ожидаемое поведение. Качество против количества: «не набивайте список граничных случаев» — угловые случаи не пихать в промпт пачкой. Формат: XML-теги или markdown-заголовки, чтобы отделить примеры от основной инструкции визуально.


Вадим Жартун читать все книги автора по порядку

Вадим Жартун - все книги автора в одном месте читать по порядку полные версии на сайте онлайн библиотеки kniga-for.me.