Free-LLMs

Как запустить нейросеть локально: Ollama, LM Studio, Jan и llama.cpp

Что выбрать, сколько нужно видеопамяти и как получить OpenAI-совместимый сервер у себя.

Local AI
Локальные нейросети
🤖
Мониторинг бесплатных моделей в Telegram Бот @freellms_bot присылает новые бесплатные модели и AI-акции.
→

У бесплатных API есть лимиты и вопросы приватности. У модели на вашем компьютере нет ни того, ни другого: никаких rate limit, промпты не покидают машину, аккаунт не нужен. В 2026 году открытые модели вроде Gemma 4, Qwen 3.x и Nemotron Nano хорошо работают на игровой видеокарте или ноутбуке на Apple Silicon. Сравниваем четыре самые популярные бесплатные программы и разбираем, что поместится на ваше железо.

Четыре программы

OllamaLM StudioJanllama.cpp
ЛицензияMITБесплатно, код закрытApache-2.0MIT
ИнтерфейсCLI + десктопДесктопДесктопCLI + веб-интерфейс
Локальный APIlocalhost:11434/v1localhost:1234/v1localhost:1337/v1llama-server, порт на выбор
Для когоРазработчики, скрипты, серверыНовички, Mac (MLX)Приватный чатМаксимум контроля и скорости

Все четыре дают OpenAI-совместимый API, поэтому любой инструмент из нашего списка бесплатного софта — Cline, OpenCode, Open WebUI, Hermes Agent — работает с локальной моделью так же, как с облачной.

Ollama — стандарт для разработчиков

ollama pull llama3.1:8b
ollama run llama3.1:8b

Ollama скачивает квантованные модели из своей библиотеки, держит их в памяти, пока вы работаете, и отдаёт по адресу http://localhost:11434/v1. Локальное использование без ограничений; отдельный план Ollama Cloud добавляет облачные модели.

LM Studio — самое дружелюбное приложение

В LM Studio есть каталог моделей, который ещё до загрузки показывает, влезет ли модель в память; на Mac используется Apple MLX, а локальный сервер включается одним переключателем. Бесплатно для личного и рабочего использования.

Jan — офлайн-замена ChatGPT

Jan полностью открыт и рассчитан на работу без интернета. Запускает локальные модели, при желании подключается к облачным API по вашим ключам, поддерживает инструменты MCP и отдаёт OpenAI-совместимый API на порту 1337.

llama.cpp — движок под капотом

Многие программы построены на llama.cpp. Напрямую он даёт все настройки — выгрузку на GPU, размер контекста, спекулятивное декодирование:

llama-server -m ./model-Q4_K_M.gguf --port 8080 -c 32768

Что поместится на ваше железо

Грубое правило для 4-битных квантованных моделей: около 0,6 ГБ памяти на миллиард параметров плюс запас на контекст.

Память (VRAM или общая)Комфортный размер моделиПримеры
8 ГБдо ~8BLlama 3.1 8B, Qwen 3.5 4B, Gemma 4 E4B
16 ГБ12–14B, небольшие MoEGemma 4 12B, Nemotron Nano 9B
24 ГБ27–35BQwen3.8 27B, Gemma 4 31B, Qwen 3.6 35B-A3B
64 ГБ+ (Mac Studio, несколько GPU)70B и крупные MoELlama 3.3 70B, gpt-oss-120b

MoE-модели особенные: модели 35B-A3B нужна память на все 35B параметров, но работает она почти со скоростью модели на 3B. Если оперативной памяти хватает, это идеальный вариант для локального запуска.

Локально или бесплатный API?

  • Локально выигрывает по приватности, задержке для автодополнения и отсутствию лимитов.
  • Бесплатный API выигрывает по качеству: самые сильные бесплатные модели — GLM 5.3 или Kimi K3 — слишком велики для домашнего железа.

На практике лучше совмещать: маленькая локальная модель для автодополнения и приватных данных и бесплатная API-модель из каталога для сложных задач.

FL
Редакция Free-LLMsКоманда каталога бесплатных LLM API. Проверяем лимиты провайдеров и тестируем модели и инструменты руками.

Читайте также