Knigi-for.me

Главное про AI - Вадим Жартун

Тут можно читать бесплатно Главное про AI - Вадим Жартун. Жанр: Прочее издательство , год . Так же Вы можете читать полную версию (весь текст) онлайн без регистрации и SMS на сайте knigi-for.me (knigi for me) или прочесть краткое содержание, предисловие (аннотацию), описание и ознакомиться с отзывами (комментариями) о произведении.
Причина простая: она обрабатывает запросы по одному. Это не дефект — это архитектурное решение. Один медленный запрос блокирует всю очередь. vLLM с этим справляется лучше, но Ollama проще в развёртывании.

VLLM: ИНСТРУМЕНТ ДЛЯ ПРОМЫШЛЕННОЙ НАГРУЗКИ

vLLM — это движок для запуска локальных моделей, рассчитанный на серьёзную нагрузку: десятки и сотни человек одновременно стучатся в одну и ту же модель, и каждому надо отвечать быстро. Задача vLLM — справляться с этим потоком без задержек.

Ключевая идея, которая делает vLLM быстрым, называется PagedAttention. Если не вдаваться в детали, идея такая: модель во время работы держит в памяти «промежуточные заметки» по каждому запросу (в технической терминологии — KV-кеш). Без умной организации эти заметки занимают память неэффективно. PagedAttention разбивает их на маленькие блоки, как страницы в книге, и собирает по мере надобности. За счёт этого видеокарта загружается на 85–92% вместо обычных 60–70%, и в неё влезает в 4–5 раз больше одновременных запросов.

Чтобы вы почувствовали разницу: vLLM на одной карте H100 80 ГБ держит 180+ параллельных запросов. Ollama на той же карте — 40, после чего падает. Это не «немного быстрее», это другой порядок величины.

Но за это приходится платить. vLLM требует развёртывания в Docker-контейнере (это такая стандартная «упаковка» для серверных приложений) и ручной настройки параметров видеокарты. Время от нуля до работающего сервера — от пяти минут до двух часов в зависимости от модели и опыта. Для офисной команды, в которой нет DevOps-инженера, это серьёзный барьер. Итог: vLLM — это для команд, которые понимают, что делают, и готовы вложиться в настройку один раз, чтобы потом обслуживать десятки пользователей.

LLAMA.CPP: МИНИМАЛИЗМ НА СЛУЖБЕ ЛОКАЛЬНОГО ЗАПУСКА

llama.cpp — это «движок-основа», на котором стоят Ollama и LM Studio. Он умеет запускать модели там, где Ollama и vLLM не справляются: на обычном процессоре (CPU) без видеокарты, на старых ноутбуках, на Raspberry Pi, на граничных устройствах вроде кассовых аппаратов или промышленных контроллеров. На Mac с чипами M-серии llama.cpp напрямую работает с Metal (встроенный графический API Apple) и часто обгоняет Ollama по скорости.

Сильная сторона llama.cpp — поддержка квантования в широком диапазоне, от 1.5 до 8 бит. Квантование — это способ уменьшить размер модели за счёт потери точности вычислений. Модель в 8-битном квантовании занимает вдвое меньше памяти, чем оригинал, и работает быстрее, но иногда чуть хуже отвечает. На llama.cpp есть целая линейка квантов: Q4, Q5, Q6, Q8 с разными суффиксами — для разных задач подходят разные. Подробно про квантование — в разделе «Квантование» ниже.

Слабое место llama.cpp — линейная очередь. Когда запросы идут один за другим от разных пользователей, каждый следующий ждёт, пока предыдущий не закончится. Это работает для одного человека или маленькой команды, но при многопользовательской нагрузке vLLM обгоняет в десятки раз.

Три инструмента — три разных рынка. Ollama — для офисной команды без DevOps-инженера, как норма. vLLM — для команды с DevOps, которая обслуживает десятки пользователей с SLA (соглашением об уровне сервиса, где зафиксировано максимальное время ответа). llama.cpp — для граничных устройств и Apple Silicon. У каждого своя ниша, и подменять один другим — значит тратить ресурсы не на ту задачу.

ЛОКАЛЬНЫЕ МОДЕЛИ 2026 ГОДА: ЧТО РЕАЛЬНО ЗАПУСКАЕТСЯ НА ПРАКТИКЕ

Рынок открытых моделей в 2026 году делится на пять семейств, и в апреле этого же года произошло событие, которое я бы назвал переломным: пять крупных релизов открытых весов за 21 день. 2 апреля Google DeepMind выпустил Gemma 4 под Apache 2.0, впервые без кастомной проприетарной лицензии. 7 апреля Z.ai выложил веса GLM-5.1. 11 апреля на Hugging Face появились контрольные точки MiniMax M2.7. 16 апреля Alibaba выкатила Qwen3.6-35B-A3B. 23 апреля DeepSeek выпустил V4-Pro с 1,6 триллиона параметров и V4-Flash.

По оценке обзора AI-моделей Modem Guides, это «даже по стандартам 2026 года необычно», и это мягкая формулировка: открытые модели перестали быть «отстающей альтернативой проприетарным», они стали параллельным стеком, который обновляется быстрее, чем проприетарный флагман успевает пройти ревью безопасности.

ЛИНЕЙКА СОВМЕСТИМОСТИ: ЧТО ЗАПУСТИТСЯ НА ЧЁМ

Что забираем из этого раздела — линейка «что запустится на чём». Шесть конфигураций памяти, от ноутбука до рабочей станции, и модель, которая на каждой запустится с приемлемой скоростью.

АРХИТЕКТУРНЫЙ СДВИГ 2026 ГОДА: СМЕСЬ ЭКСПЕРТОВ (MOE)

Архитектурный сдвиг 2026 года — Mixture of Experts. Это архитектура, в которой для каждого токена активна только часть параметров модели. Четыре модели с разным балансом общих и активных параметров показывают, как MoE даёт «большой мозг при маленьком аппетите»: качество 200B+ модели при скорости 20B-модели без разреженной активации (dense).

AI Magicx в обзоре 2026 года сформулировал это так: «интеллект большой модели при ресурсных требованиях маленькой». Именно MoE позволяет запускать «большие» модели на потребительском железе. Именно поэтому открытые веса впервые в истории конкурируют с проприетарными флагманами на реальных задачах, а не на синтетических бенчмарках. Саймон Уиллисон (Simon Willison) в блоге 16 апреля 2026 года показал: Qwen3.6-35B-A3B (20,9 ГБ на диске) на MacBook побил Claude Opus 4.7 на известном «пеликан-тесте» (тест на длинные ответы).

Граница «фронтира» в 2026 году проходит не между открытым и закрытым, а между тем, кто умеет запускать локально, и тем, кто платит за API. Это правда, но с оговоркой. MindStudio в обзоре мая 2026 года добавляет нюанс: открытые веса в среднем отстают от передовых проприетарных моделей на 3–6 месяцев. Этот разрыв критичен для задач со сложным многошаговым рассуждением, генерацией кода на уровне продакшна, плотным разбором юридических контрактов. Для рутинных офисных задач — резюмирование, черновики писем, извлечение данных из таблиц — разрыв практически незаметен.

И ещё один миф, который удерживает людей на облачных подписках: «если модель большая, её нельзя запустить локально». Для офисных задач 70B-модель в Q4 запускается на двух картах по 24 ГБ или на одной с 48 ГБ VRAM (например, RTX 6000 Ada или A6000), а 35B-A3B MoE умещается в 20,9 ГБ одной карты. Размер перестал быть ограничением. Вопрос теперь не «потянет ли мой ноутбук», а «какой квант и какая скорость меня устроят».

Один и тот же сотрудник в одной компании может параллельно использовать локальный Llama 4 Scout 109B для черновиков и облачный Claude Opus 4.8 для юридических заключений. Это нормальная гибридная архитектура, а не «нерешительность»: локальный запуск закрывает рутину, облако


Вадим Жартун читать все книги автора по порядку

Вадим Жартун - все книги автора в одном месте читать по порядку полные версии на сайте онлайн библиотеки kniga-for.me.