Как найти и запустить модель
Практикум: от первой команды до продвинутых сценариев с HuggingFace.
Новичок? Разберитесь с основами в
basics/: AI-термины, железо, установка.
🇬🇧 English version: running-models.md
Способ 1: Ollama (рекомендуем для начала)
Ollama — готовые модели одной командой. Список всех моделей: ollama.com/search
# Найти модель: открыть https://ollama.com/search, найти по имени
# Запустить (автоматически скачает):
ollama run qwen3.5:4b # Qwen 3.5 4B (3.4 GB) — чат
ollama run qwen2.5-coder:7b # Qwen 2.5 Coder 7B (4.7 GB) — кодинг
# Размеры на Ollama указаны на странице модели (колонка Size)
# Все модели уже в оптимальной квантизации (Q4_K_M)
Важно: разные версии Qwen — разные библиотеки на Ollama:
ollama run qwen3:4b— Qwen 3 (Март 2025)ollama run qwen3.5:4b— Qwen 3.5 (Февраль 2026)ollama run qwen3.6:27b— Qwen 3.6 (Апрель 2026)
Не путайте! Каждая точка-релиз — отдельная страница на Ollama.
Настройка Ollama (для Mac)
Ключевые переменные окружения для тюнинга производительности:
| Переменная | По умолчанию | Что даёт |
|---|---|---|
OLLAMA_KV_CACHE_TYPE=q4_0 |
f16 |
4× меньше памяти на KV cache (контекст влезает лучше) |
OLLAMA_FLASH_ATTENTION=1 |
выкл | Экономия памяти + ускорение (experimental) |
OLLAMA_NUM_PARALLEL=2 |
1 |
Два параллельных запроса к одной модели |
OLLAMA_KEEP_ALIVE=10m |
5m |
Держать модель в памяти 10 минут после последнего запроса |
OLLAMA_GPU_OVERHEAD=536870912 |
0 |
Резерв 512 MB для других приложений |
OLLAMA_LOAD_TIMEOUT=10m |
5m |
Таймаут загрузки модели |
OLLAMA_HOST=0.0.0.0:11434 |
127.0.0.1:11434 |
Доступ по сети (с осторожностью!) |
OLLAMA_MAX_QUEUE=512 |
512 |
Макс. очередь запросов |
Рекомендуемый конфиг для M1 16 GB — добавьте в ~/.zshrc:
# Ollama — оптимизация для M1 16GB
export OLLAMA_KV_CACHE_TYPE=q4_0 # 4x экономия KV cache
export OLLAMA_FLASH_ATTENTION=1 # экспериментально, но помогает
export OLLAMA_NUM_PARALLEL=2 # 2 параллельных запроса
export OLLAMA_KEEP_ALIVE=10m # модель живёт 10 минут
export OLLAMA_GPU_OVERHEAD=536870912 # 512 MB — запас для системы
После добавления — перезапустите оболочку (source ~/.zshrc или новое окно терминала) и затем ollama serve.
MLX-модели: важное отличие
Модели, которые Ollama запускает через MLX (safetensors), не поддерживают truncation. Если контекст превышает лимит — ошибка, а не обрезание, как у GGUF/llama.cpp. Если видите ошибки при длинных диалогах — переключитесь на GGUF-версию модели.
Способ 2: LM Studio (для новичков)
- Скачайте LM Studio
- В поиске найдите модель (например «Qwen 3.5 4B»)
- Нажмите Download → Load → Chat
LM Studio сам покажет размер модели, предложит лучшую квантизацию и настроит бэкенд.
Способ 3: HuggingFace → Ollama (продвинутый)
Модели на HuggingFace в формате transformers — их нельзя запустить напрямую. Нужно:
Модель на HuggingFace → Ollama (есть в библиотеке) → ollama run
→ GGUF (конвертирована) → скачать .gguf → LM Studio / llama.cpp
→ MLX (конвертирована) → mlx-lm
Что проще всего: если модель есть на ollama.com/search — просто ollama run <имя>.
Если модели нет на Ollama — ищите GGUF-версию на HuggingFace (в поиске добавьте «GGUF»).
Связки для разработчика
Редактор кода → Continue.dev → Ollama → Qwen 2.5 Coder 7B
(VS Code / (локально,
JetBrains) бесплатно,
приватно)
CLI → Aider → Ollama → Qwen 2.5 Coder 7B
(автономный (локально,
coding агент) приватно)
Почему не хватает просто Ollama: Ollama — это сервер моделей (как локальный OpenAI API). Чтобы реально кодить файлы, нужен «клиент»: Continue.dev (IDE-плагин), Aider (CLI), или OpenHands (автономный агент). Ollama сам по себе только отвечает на промпты.
Полное сравнение инструментов — в tools.md.
Что дальше
| Если хотите | Переходите |
|---|---|
| Понять, какую модель выбрать для своих задач | models.md |
| Настроить производительность под своё железо | memory-and-context.md |
| Кастомизировать модель (Modelfile, API) | advanced-setup.md |
| Сравнить все инструменты (MLX, LM Studio, llama.cpp) | tools.md |
| Вернуться к выбору сценария | README.md |
В разделе: getting-started · running-models · models · catalog · quantization · memory-and-context · tools · advanced-setup · troubleshooting · apple-silicon
Связанные разделы: Нулевой уровень · AI-агенты · Use Cases
Навигация: ← Локальные модели · ↑ На главную · 🇬🇧 English