Главное про AI - Вадим Жартун
КВАНТОВАНИЕ: СЖАТИЕ МОДЕЛИ БЕЗ ПОТЕРИ КАЧЕСТВА
Представьте, что модель — это книга, в которой десятки миллиардов чисел (так называемые «веса», параметры нейросети). Каждое число занимает память. Квантование — это способ записать эти числа менее точно, но сэкономить место.
Простой пример. Число 3,14159265 можно записать как «3» (один знак), и это квантование с потерей точности. Для большинства задач «3» достаточно, а не «3,14159265». В квантовании нейросетей работает та же логика: вместо 16-битного числа (огромная точность) записываем 4-битное (16 возможных значений), и точность хранения падает, но для большинства задач это незаметно.
Вот что это даёт на практике. Модель размером 8 ГБ в 16-битном формате после 4-битного квантования превращается в 4 ГБ. На ту же видеокарту влезает модель вдвое большего размера, или та же модель работает вдвое быстрее, или обслуживает вдвое больше пользователей одновременно.
Миф, который стоит развеять сразу: «квантованная модель — это плохо». На практике 4-битное квантование для большинства офисных задач неотличимо от 16-битного оригинала. Качество страдает только в двух сценариях: сложные многошаговые рассуждения (математика, логические цепочки на пять и более шагов) и редкие узкоспециальные термины. Для первого есть метод цепочки рассуждений (когда модель сначала показывает ход мысли, а потом даёт ответ) и приём «несколько примеров» (когда в промпт добавляют 2–5 готовых образцов «вопрос-ответ», и модель продолжает по образцу). Для второго — поиск по вашей базе документов с генерацией ответа (когда модель сначала находит релевантные фрагменты, а потом отвечает по ним). Исследование «Quantization Hurts Reasoning?» (COLM 2025) даёт офисному читателю главное — таблицу дозволенного:

Это значит, что для модели с 7 миллиардами параметров 3-битный квант даёт ошибки, превышающие 10%, и качество становится неприемлемым, а 8-битный — приемлемое.
ВЫБОР КВАНТА ПОД ЗАДАЧУ
Самый популярный квант в экосистеме GGUF — Q4_K_M, и это не случайность. Обзор Kaitchup за октябрь 2025 года формулирует правило прямо: Q4_K_M — рабочая лошадка для 4-битных развёртываний, Q5_K_M — высококачественная настройка с почти незаметной деградацией для большинства задач, Q6_K — выбор, когда нужно «почти без потерь», но всё ещё сэкономить память.
Для офисного пользователя, который открывает Ollama и выбирает тег по умолчанию, Q4_K_M закрывает 90% запросов. Переходить на Q5_K_M или Q6_K имеет смысл, только если вы замерили провал на конкретной задаче. Не «на всякий случай», а по факту.
ЖЕЛЕЗО КАК ОГРАНИЧИТЕЛЬ ВЫБОРА КВАНТА
Железо определяет выбор кванта сильнее, чем выбор модели. На Apple M3 Ultra 96 ГБ разница между Q4_K_M и Q8_0 у Qwen3-14B видна невооружённым глазом: 70,33 токена в секунду против 41,51. Q8 замедляет генерацию почти вдвое. Файл вырастает с 8,32 ГБ до 15,71 ГБ. На 32B-моделях картина жёстче: Q4_K_M даёт 33,88 токена в секунду, Q8_0 — 20,11, а BF16 (16-битный формат, отличается от FP16 расширенным диапазоном) падает до 10,76.
Скорость — не второстепенный параметр. Когда бухгалтер ждёт от модели ответа на «разнеси платёжки по контрагентам», разница между 33 и 11 токенами в секунду превращается из «удобно» в «невозможно работать». Сначала определитесь с железом, потом подбирайте квант под него.
Если задача — «найти баг в распределённой системе по логам», квантование даст о себе знать. В этом случае либо переходите на Q5_K_M / Q6_K, либо возвращайтесь в облако для критичных задач. Для рутинных офисных задач — резюме, черновики, классификация, извлечение данных — локальная 70B-модель в Q4_K_M неотличима от облачной.
НАДСТРОЙКИ ПОВЕРХ ЛОКАЛЬНОЙ МОДЕЛИ
Итак, модель выбрана, квантование настроено, локальный запуск работает. Над этим стеком в 2026 году выстраиваются три слоя, и мы разберём их по очереди: промежуточный инфраструктурный вариант VPS, локальные агенты и обёртки вокруг LLM. А в конце — раздел о безопасности локальной инфраструктуры, где у команд, переехавших с облака на свои серверы, живёт слепое пятно.
VPS: КОМПРОМИССНЫЙ ПРОМЕЖУТОЧНЫЙ ВАРИАНТ
Между «облаком провайдера» и «локальным сервером в офисе» есть третий путь, и для команды 3–6 человек он часто оказывается самым практичным. Это виртуальный частный сервер (VPS, Virtual Private Server) — арендованная виртуальная машина у российского или зарубежного провайдера (Selectel, Timeweb Cloud, Hetzner, AWS Lightsail), где Ollama или vLLM разворачивается как в офисе, но без покупки собственного железа и без отправки данных в публичное облако уровня OpenAI.
По цене в 2026 году типичный VPS с одной дискретной GPU уровня RTX 4090 обходится в 18–30 тысяч рублей в месяц. Для команды с устойчивыми 100+ млн токенов в месяц это дешевле подписки на облачный API и не требует отдельного инженера в штате — провайдер берёт на себя замену дисков, резервное питание и сетевую связность.
Для команды с переменной нагрузкой или с единственным запросом в день VPS проигрывает облаку по гибкости: железо фиксировано, и если задачи встают на паузу, машина всё равно стоит денег.
Выбор между VPS, локальным сервером и облачным API — это выбор между фиксированной ежемесячной ценой (VPS), капитальной затратой с нулевой абонентской платой (локальный сервер) и поштучной оплатой по объёму (облачный API). Подробное сравнение стоимости и требований к железу для VPS раскроем в следующем разделе.
ЛОКАЛЬНЫЕ АГЕНТЫ НА СОБСТВЕННОЙ ИНФРАСТРУКТУРЕ
Над локальной моделью — агенты. Они не просто отвечают на запрос, а сами вызывают инструменты, читают файлы и принимают решения. Локальный агент в 2026 году — это комбинация из LLM (через Ollama или vLLM), фреймворка (LangGraph, CrewAI, AutoGen — библиотеки для построения многошаговых AI-агентов) и набора инструментов (поиск в файлах, доступ к API, запуск скриптов). Все три компонента работают локально, без обращения к облаку. Это полноценная альтернатива облачным агентам типа ChatGPT agent или Claude Computer Use (агент Anthropic, который управляет компьютером как человек — кликает, водит мышью), с одним принципиальным отличием: данные остаются в офисе.
Агенты 2026 года делятся на три класса, и смешение их в одну кучу — типовая ошибка выбора. Универсальные агенты (Hermes Agent, Claude Code) — ассистенты общего профиля, которые умеют читать почту, бронировать встречи, вызывать API, генерировать код. Специализированные агенты для кодинга (Cursor CLI, Aider) — узкие инструменты с глубокой интеграцией в IDE (Integrated Development Environment, интегрированная среда разработки — редактор кода типа VS Code или JetBrains), Git, файловую систему и тестовые фреймворки. Узкие агенты под конкретные вертикали: поддержка (Decagon), продажи (Clay), извлечение данных из документов (Agentic Document Extraction). Три класса — три разных рынка: цена, лицензия, модель