01 · АРГУМЕНТЫ
Три веских причины и ограничения, о которых молчат.
Локальная модель хуже топовой облачной почти в любой задаче. И это единственный вариант, когда данные не должны покидать машину — этот размен стоит понимать точно, а не эмоционально.
Что локальный запуск действительно даёт
- Данные не уходят. Никаких условий использования, политик хранения и вопросов про обучение. Для клиентских материалов, медицинских записей, юридических черновиков и всего под NDA это и есть весь аргумент.
- Работает без соединения. В самолёте, в лаборатории, на объекте без связи или во время аварии у провайдера.
- Нет платы за токены и лимитов. Массовая классификация, пакетная суммаризация и повторяющиеся эксперименты становятся бесплатными после электричества.
- Модель не устареет под вами. Сохранённая модель через два года ведёт себя так же. Облачные меняют поведение без предупреждения.
Чего он не даёт
- Топового уровня рассуждений. Модель, влезающая в потребительскую видеопамять, не конкурирует с крупнейшими облачными на сложных задачах и редких знаниях. Ждите способного помощника, а не замену.
- Скорости на длинном контексте. Обработка большого документа — как раз то, где потребительское железо ощущается медленнее всего.
- Меньше уверенных ошибок. Маленькие модели галлюцинируют больше, а не меньше. «Локально» не значит «аккуратно».
- Бесплатной памяти. Всё, что занимает модель, не достаётся остальной работе.
02 · БЮДЖЕТ ПАМЯТИ
Всё решает память. Вот арифметика.
Размер модели в миллиардах параметров, умноженный на число байт на параметр при вашем квантовании, плюс место под контекст. Это весь расчёт.
| Размер модели | 4 бита | 8 бит | Реалистично на |
|---|---|---|---|
| 3B | около 2 ГБ | около 3,5 ГБ | Любая современная видеокарта или процессор |
| 7B–8B | около 4,5 ГБ | около 8,5 ГБ | 8 ГБ видеопамяти комфортно; 16 ГБ ОЗУ на процессоре |
| 13B–14B | около 8 ГБ | около 15 ГБ | 12 ГБ видеопамяти; на процессоре медленно, но работает |
| 30B–34B | около 19 ГБ | около 36 ГБ | 24 ГБ видеопамяти или ноутбук с единой памятью |
| 70B | около 40 ГБ | около 75 ГБ | Две крупные видеокарты или 64 ГБ единой памяти, медленно |
К каждой цифре добавляйте запас. Кэш ключей и значений растёт вместе с объёмом поданного текста, и длинный контекст на большой модели съедает ещё несколько гигабайт. Модель, которая едва влезла с пустым контекстом, упадёт на середине длинного документа.
Квантование в одном абзаце
Веса хранятся с пониженной точностью, чтобы модель занимала меньше. Переход с 16 бит на 8 почти бесплатен по качеству. С 8 на 4 — та самая золотая середина: небольшая, обычно приемлемая потеря за примерно вдвое меньший объём. Ниже 4 бит деградация становится очевидной: первым страдает следование инструкциям, затем связность длинных ответов. Более крупная модель в 4 битах обычно лучше меньшей в 8 — это самое полезное правило во всей теме.
Видеокарта или процессор? Видеокарта примерно на порядок быстрее при генерации. Процессорный вывод вполне пригоден для моделей 3B–8B, если устраивает скорость чтения. Машины с единой памятью здесь необычно хороши.
03 · ИНСТРУМЕНТЫ
Четыре способа запустить одни и те же файлы модели.
| Инструмент | Формат | Кому подходит | Компромисс |
|---|---|---|---|
| Ollama | Командная строка плюс локальный HTTP API | Разработчикам. Одна команда, чтобы скачать и запустить, и API для других инструментов. | Меньше тонкого контроля, чем у llama.cpp напрямую |
| LM Studio | Настольное приложение | Тем, кто пробует и сравнивает модели, и нетехническим пользователям. | Графический процесс работы, более тяжёлая установка |
| llama.cpp | Движок под всем остальным | Максимальный контроль над квантованием, выгрузкой слоёв и сэмплированием. | Рабочий процесс собираете сами |
| Jan / GPT4All | Настольные приложения | Приватный ассистент для тех, кто не хочет терминал | Меньше настроек, новые форматы появляются позже |
Все четыре работают с одними и теми же квантованными файлами, так что выбор — про рабочий процесс, а не про возможности. Частая схема: Ollama как движок и отдельный чат-интерфейс, направленный на его API.
04 · ПОШАГОВО
От нуля до работающей модели примерно за десять минут.
# Скачать модель под ваше железо и начать диалог
ollama run llama3.1:8b
# Посмотреть, что скачано и сколько занимает
ollama list
# Удалить ненужное
ollama rm llama3.1:8b
# Поднять локальный API для других инструментов
ollama serve
API слушает localhost — именно к нему подключаются плагины редакторов, приложения для заметок и скрипты. Наружу ничего не уходит.
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1:8b",
"prompt": "Сократи до трёх пунктов: ...",
"stream": false
}'
Какую модель взять первой
- Общий помощник, 8 ГБ видеопамяти — современная инструктивная модель 7B–8B в 4 битах. Ответ по умолчанию, и он хороший.
- Код — специализированная модель того же размера. Заметно лучше в дополнении и рефакторинге, чем общая модель того же объёма.
- Маленькая и быстрая — 3B для классификации, извлечения данных и разметки, где диалог не нужен.
- Максимум качества — сначала растите число параметров, потом точность.
Проверьте лицензию, прежде чем строить на модели продукт. Открытые веса — не то же самое, что открытый исходный код: несколько популярных семейств ограничивают коммерческое использование или ставят условия на производные модели.
05 · НАСТРОЙКА
Четыре параметра, от которых зависит, будет ли это удобно.
- Выгрузка слоёв на видеокарту. Самый важный параметр, когда модель не влезает целиком. Отдавайте видеокарте столько слоёв, сколько позволяет память; остальное считает процессор. Один лишний слой — и получите ошибку нехватки памяти.
- Размер контекста. Больший контекст стоит памяти и замедляет генерацию. Ставьте столько, сколько реально нужно: 4K для диалога, больше — только когда действительно подаёте документы.
- Размер батча при обработке промпта. Влияет на скорость поглощения длинного запроса отдельно от скорости выдачи. Если вставка большого документа тормозит, а ответы идут нормально — это оно.
- Уровень квантования. Не влезает — сначала снижайте с 5 бит до 4, и только потом берите модель поменьше.
| Конфигурация | 7B–8B в 4 битах | Ощущается как |
|---|---|---|
| Современная дискретная видеокарта, все слои выгружены | Быстро, заметно выше скорости чтения | Сопоставимо с облачным чатом |
| Старая или слабая видеокарта, частичная выгрузка | Примерно скорость чтения | Годится для диалога, утомительно для длинных ответов |
| Только процессор, современный многоядерный | Ниже скорости чтения | Нормально для фоновых и пакетных задач |
| Ноутбук с единой памятью | Уверенно выше скорости чтения | Лучший опыт на ватт из доступных сегодня |
Если генерация сильно медленнее таблицы, модель почти наверняка вылезает из видеопамяти в системную. Проверьте выгрузку слоёв, прежде чем винить железо, — именно эта ошибка объясняет большинство разочарований с первого раза.
06 · ПРОВЕРКА
Докажите, что модель работает без сети.
Это шаг, который отделяет действительно локальную установку от локального интерфейса перед удалённым API. Сделайте его один раз и осознанно.
Загрузите все модели, пока есть сеть. Файлы моделей — единственное, что действительно требует соединения.
Выключите Wi-Fi и выньте кабель. Режим полёта подойдёт. Не полагайтесь на правило файрвола для самой проверки.
Не одно слово. Попросите достаточно длинный ответ, чтобы тихий переход на облако провалился заметно.
Загрузка видеокарты или процессора должна расти во время генерации. Если локально ничего не шевелится — отвечает кто-то другой.
Как удержать офлайн дальше
- Заблокируйте исходящий трафик для запускатора в брандмауэре Windows после того, как модели скачаны. Обновляйтесь осознанно.
- Отключите телеметрию и проверку обновлений в выбранном инструменте.
- Держите файлы моделей в резервной копии. Они большие, но не бесконечные, а отозванная или перелицензированная модель без копии не восстанавливается.
- Осторожнее с чат-интерфейсами. Многие настольные оболочки поддерживают и локальных, и облачных провайдеров, а переключение — один выпадающий список. Проверьте, что выбрано, прежде чем вставлять что-то чувствительное.
Заявление о приватности не крепче самого слабого звена. Локальная модель за интерфейсом, который синхронизирует историю переписки в облачный аккаунт, — это не приватная установка. Проверяйте каждый компонент отдельно.
07 · КОРОТКИЕ ОТВЕТЫ
Локальные модели — коротко.
Для модели 7B–8B в 4-битном квантовании нужно около 4,5 ГБ видеопамяти, то есть комфортно на видеокарте с 8 ГБ. Только на процессоре работает при примерно 16 ГБ оперативной памяти, но генерация будет медленнее скорости чтения. Машины с единой памятью показывают себя необычно хорошо.
Нет, не в тех размерах, которые влезают в потребительское железо. Ждите способного помощника для суммаризации, черновиков, извлечения данных и рутинной работы с кодом, и отставания на сложных рассуждениях и редких знаниях. Причина запускать локально — приватность, работа без сети и стоимость, а не сила модели.
Переход с 16 бит на 8 почти бесплатен. С 8 на 4 стоит небольшой, обычно приемлемой потери за примерно вдвое меньший объём, поэтому большинство работает в 4 битах. Ниже 4 бит деградация очевидна, начиная со следования инструкциям. Правило: более крупная модель в 4 битах лучше меньшей в 8.
Ollama, если нужна командная строка и локальный API для других инструментов. LM Studio, если нужно настольное приложение с каталогом моделей и встроенным чатом. llama.cpp напрямую, если нужен полный контроль над квантованием и выгрузкой слоёв. Все работают с одними и теми же файлами моделей.
Скачайте модели, пока есть сеть, затем полностью отключите её и задайте объёмный запрос. Смотрите, как растёт загрузка видеокарты или процессора во время генерации. После этого заблокируйте исходящий трафик запускатора в брандмауэре и проверьте, что чат-интерфейс не переключается на облачного провайдера.