У бесплатных API есть лимиты и вопросы приватности. У модели на вашем компьютере нет ни того, ни другого: никаких rate limit, промпты не покидают машину, аккаунт не нужен. В 2026 году открытые модели вроде Gemma 4, Qwen 3.x и Nemotron Nano хорошо работают на игровой видеокарте или ноутбуке на Apple Silicon. Сравниваем четыре самые популярные бесплатные программы и разбираем, что поместится на ваше железо.
Четыре программы
| Ollama | LM Studio | Jan | llama.cpp | |
|---|---|---|---|---|
| Лицензия | MIT | Бесплатно, код закрыт | Apache-2.0 | MIT |
| Интерфейс | CLI + десктоп | Десктоп | Десктоп | CLI + веб-интерфейс |
| Локальный API | localhost:11434/v1 | localhost:1234/v1 | localhost:1337/v1 | llama-server, порт на выбор |
| Для кого | Разработчики, скрипты, серверы | Новички, Mac (MLX) | Приватный чат | Максимум контроля и скорости |
Все четыре дают OpenAI-совместимый API, поэтому любой инструмент из нашего списка бесплатного софта — Cline, OpenCode, Open WebUI, Hermes Agent — работает с локальной моделью так же, как с облачной.
Ollama — стандарт для разработчиков
ollama pull llama3.1:8b
ollama run llama3.1:8b
Ollama скачивает квантованные модели из своей библиотеки, держит их в памяти, пока вы работаете, и отдаёт по адресу http://localhost:11434/v1. Локальное использование без ограничений; отдельный план Ollama Cloud добавляет облачные модели.
LM Studio — самое дружелюбное приложение
В LM Studio есть каталог моделей, который ещё до загрузки показывает, влезет ли модель в память; на Mac используется Apple MLX, а локальный сервер включается одним переключателем. Бесплатно для личного и рабочего использования.
Jan — офлайн-замена ChatGPT
Jan полностью открыт и рассчитан на работу без интернета. Запускает локальные модели, при желании подключается к облачным API по вашим ключам, поддерживает инструменты MCP и отдаёт OpenAI-совместимый API на порту 1337.
llama.cpp — движок под капотом
Многие программы построены на llama.cpp. Напрямую он даёт все настройки — выгрузку на GPU, размер контекста, спекулятивное декодирование:
llama-server -m ./model-Q4_K_M.gguf --port 8080 -c 32768
Что поместится на ваше железо
Грубое правило для 4-битных квантованных моделей: около 0,6 ГБ памяти на миллиард параметров плюс запас на контекст.
| Память (VRAM или общая) | Комфортный размер модели | Примеры |
|---|---|---|
| 8 ГБ | до ~8B | Llama 3.1 8B, Qwen 3.5 4B, Gemma 4 E4B |
| 16 ГБ | 12–14B, небольшие MoE | Gemma 4 12B, Nemotron Nano 9B |
| 24 ГБ | 27–35B | Qwen3.8 27B, Gemma 4 31B, Qwen 3.6 35B-A3B |
| 64 ГБ+ (Mac Studio, несколько GPU) | 70B и крупные MoE | Llama 3.3 70B, gpt-oss-120b |
MoE-модели особенные: модели 35B-A3B нужна память на все 35B параметров, но работает она почти со скоростью модели на 3B. Если оперативной памяти хватает, это идеальный вариант для локального запуска.
Локально или бесплатный API?
- Локально выигрывает по приватности, задержке для автодополнения и отсутствию лимитов.
- Бесплатный API выигрывает по качеству: самые сильные бесплатные модели — GLM 5.3 или Kimi K3 — слишком велики для домашнего железа.
На практике лучше совмещать: маленькая локальная модель для автодополнения и приватных данных и бесплатная API-модель из каталога для сложных задач.