Knigi-for.me

Главное про AI - Вадим Жартун

Тут можно читать бесплатно Главное про AI - Вадим Жартун. Жанр: Прочее издательство , год . Так же Вы можете читать полную версию (весь текст) онлайн без регистрации и SMS на сайте knigi-for.me (knigi for me) или прочесть краткое содержание, предисловие (аннотацию), описание и ознакомиться с отзывами (комментариями) о произведении.
TTFT и TPS — типичная ошибка. Модель с TTFT 0,5 с и TPS 30 t/s — «отвечает быстро, но медленно пишет». Она подходит для коротких ответов в чате. Модель с TTFT 2 с и TPS 200 t/s — «долго думает, зато строчит». Она подходит для генерации больших документов. Выбор между ними — выбор сценария, и здесь встроена ловушка: «быстрая модель = лучшая модель». Скорость и качество — два разных измерения. Для бизнеса критично понимать, когда важно первое, когда второе, и как они упираются в цену.

Что реально тормозит. Скорость ответа складывается из трёх фаз. Prefill — модель «читает» промпт и строит KV-cache (кэш ключ-значение, структура в памяти GPU — графического процессора, на котором считаются нейросети), и это параллелизуемая фаза: на GPU она занимает десятки-сотни миллисекунд для коротких промптов и секунды для длинных (100K+ токенов). Decode — модель генерирует ответ по одному токену, последовательно, и это узкое место: каждый токен зависит от предыдущего, параллелизация ограничена. Post-processing — сериализация, передача по сети, рендеринг.

Длина промпта решает всё. По данным NVIDIA, TTFT растёт почти линейно с длиной префилла. Для промпта в 100 000 токенов даже быстрые модели показывают 1,5–3 секунды TTFT против 0,3 с для промпта в 1 000 токенов. Для длинного контекста (анализ длинного договора, разбор большого отчёта) это становится узким местом. Пользователь ждёт не ответа, а «загрузки».

Пакетная обработка и интерактив — разные модели поведения.

Пакетная обработка — это когда компания вечером ставит 100 000 договоров в очередь и к утру получает саммари. Здесь TPS и цена решают всё, а TTFT неважна (пользователь не ждёт у экрана). Лучший выбор — дешёвая модель с высоким TPS: Gemini 2.0 Flash, Nova Micro, Gemma 3 27B. Рассуждающие модели (Claude Opus 4.x, GPT-5.5) сюда не подходят: они и медленнее, и дороже, и часто «передумывают» то, что в простой задаче не требует рассуждений.

Интерактив — это когда оператор в банке общается с клиентом и AI помогает подсказывать ответы. Здесь TTFT решает всё, а TPS и цена второстепенны (запросов немного, платит компания, а не клиент). Лучший выбор — модель с TTFT ниже 0,5 с: Nova Micro, Gemini 2.0 Flash, маленькие локальные модели на своём железе. Рассуждающие модели снова мимо: 1,5 секунды тишины в живом диалоге — провал.

Гибрид — это когда есть и пакетная, и интерактивная нагрузка. Типовое решение — бытовая интерактивная модель на каждый день, тяжёлая рассуждающая модель для «ночных» задач. YandexGPT 5.1 Pro закрывает оба сценария (быстрый для интерактива через Lite, мощный для пакетной аналитики через Pro с chain-of-reasoning), и GigaChat — аналогично (Lite для чат-ботов, Max для больших документов, Ultra Thinking для задач со множеством факторов).

Как токенизация русского удлиняет и удорожает каждый сценарий. Русский текст режется на больше токенов, чем английский. Для одной и той же задачи «саммари 50-страничного договора» русский запрос содержит 60 000–80 000 токенов вместо 30 000–40 000 для английского. Время обработки и цена растут пропорционально объёму. Если TTFT на 100K-промптах и так 2–3 секунды, то для русского она становится 3–5 секунд. На конкретных цифрах: GigaChat 2 Max — 0,65 токенов на слово, контекст 128 000; для русского договора в 200 страниц (около 80 000 слов) — 52 000 токенов, умещается в окно с запасом, TTFT умеренный. T-pro 2.0 — 0,45 токенов на слово, тот же договор уходит в 36 000 токенов, окно почти не напрягается. GPT-4o — 2,0–2,5 токенов на русское слово, тот же договор занимает 160 000–200 000 токенов, не влезает в 128K, нужно либо резать, либо брать модель с большим контекстом (400K у GPT-5.5 или 1M у Gemini 3.1 Pro). Для пакетной обработки разница в токенизации 0,45 против 2,5 — это разница в 5,5 раза по стоимости инференса. На 100 000 договоров в месяц это миллионы рублей.

Цена — скрытая ось выбора. Цена API у LLM устроена сложнее, чем кажется по заголовку «$5 / $25».

1: Вход и выход: по тарифам Anthropic, OpenAI и Google выход обычно в 3–6 раз дороже входа, потому что генерация токенов нагружает GPU сильнее, чем чтение контекста.

2: Кэшированный вход (со скидкой 10% от цены входа) и продление кэша (в 1,25× или 2× от цены входа, в зависимости от TTL — времени жизни кэша в часах): если в проекте идёт многократная переработка одного и того же системного запроса, кэш окупается за 1–2 чтения.

3: Пакетное и отложенное API со скидкой 50%: ответ приходит в течение 24 часов, не годится для работы в реальном времени.

4: Доплата за длинный контекст: OpenAI ввёл двойную цену для запросов больше 200K токенов, Google применяет 2× на вход и 1,5× на выход.

Называть просто «Claude Opus 4.7 стоит $5/$25» — это как говорить «бензин стоит 65 рублей», не уточняя, что на заправке премиум-95 плюс 12 рублей за литр. Конкретная цифра здесь — для примера, она устаревает каждый квартал. Важно в ней только то, что она иллюстрирует разрыв между «заголовком» и «реальностью». Для расчёта реальной стоимости используйте средневзвешенную цену = (входные токены × цена входа + выходные токены × цена выхода) / общее число токенов. Скрытая статья расхода, которую не видно в рекламной цене (так называемая headline-цена — цена «с витрины», без учёта реального потребления), — стоимость перепроверки человеком: обычно 30–60% от времени оператора (по отраслевым наблюдениям). Без её замера экономика проекта не сходится.

Семь способов уменьшить счёт за счёт правильной работы с API.

1: Кэширование запросов (prompt caching, по тарифу Anthropic — попадание в кэш даёт скидку 10% от базовой цены входа; стандартный сценарий с системным запросом на 4 тысячи токенов и перепиской на 50 тысяч токенов (K = тысяча, англ. thousand) даёт 80% попаданий и экономию в 4× на входе).

2: Пакетное API (batch API, по условиям OpenAI, Anthropic, xAI и Google — 50% скидка при готовности ждать до 24 часов; подходит для ETL (пакетной загрузки и преобразования данных) и RAG-индексации).

3: Маршрутизация (routing, OpenRouter и Martian автоматически направляют запросы на самую дешёвую модель, способную решить задачу, экономия до 80% в смешанных нагрузках).

4: Квантизация (сжатие модели за счёт снижения точности весов) и дистилляция (обучение компактной модели на ответах большой) — DeepSeek-R1-distill-Qwen-32B стоит в 4–5 раз дешевле полного R1 на управляемом инференсе (запуск модели на арендованном железе) при приемлемом качестве.

5: Маршрутизация по


Вадим Жартун читать все книги автора по порядку

Вадим Жартун - все книги автора в одном месте читать по порядку полные версии на сайте онлайн библиотеки kniga-for.me.