Как найти и запустить модель

Практикум: от первой команды до продвинутых сценариев с HuggingFace.

Новичок? Разберитесь с основами в basics/: AI-термины, железо, установка.

← Локальные модели

🇬🇧 English version: running-models.md


Способ 1: Ollama (рекомендуем для начала)

Ollama — готовые модели одной командой. Список всех моделей: ollama.com/search

# Найти модель: открыть https://ollama.com/search, найти по имени

# Запустить (автоматически скачает):
ollama run qwen3.5:4b        # Qwen 3.5 4B (3.4 GB) — чат
ollama run qwen2.5-coder:7b  # Qwen 2.5 Coder 7B (4.7 GB) — кодинг

# Размеры на Ollama указаны на странице модели (колонка Size)
# Все модели уже в оптимальной квантизации (Q4_K_M)

Важно: разные версии Qwen — разные библиотеки на Ollama:

Не путайте! Каждая точка-релиз — отдельная страница на Ollama.

Настройка Ollama (для Mac)

Ключевые переменные окружения для тюнинга производительности:

Переменная По умолчанию Что даёт
OLLAMA_KV_CACHE_TYPE=q4_0 f16 4× меньше памяти на KV cache (контекст влезает лучше)
OLLAMA_FLASH_ATTENTION=1 выкл Экономия памяти + ускорение (experimental)
OLLAMA_NUM_PARALLEL=2 1 Два параллельных запроса к одной модели
OLLAMA_KEEP_ALIVE=10m 5m Держать модель в памяти 10 минут после последнего запроса
OLLAMA_GPU_OVERHEAD=536870912 0 Резерв 512 MB для других приложений
OLLAMA_LOAD_TIMEOUT=10m 5m Таймаут загрузки модели
OLLAMA_HOST=0.0.0.0:11434 127.0.0.1:11434 Доступ по сети (с осторожностью!)
OLLAMA_MAX_QUEUE=512 512 Макс. очередь запросов

Рекомендуемый конфиг для M1 16 GB — добавьте в ~/.zshrc:

# Ollama — оптимизация для M1 16GB
export OLLAMA_KV_CACHE_TYPE=q4_0    # 4x экономия KV cache
export OLLAMA_FLASH_ATTENTION=1      # экспериментально, но помогает
export OLLAMA_NUM_PARALLEL=2         # 2 параллельных запроса
export OLLAMA_KEEP_ALIVE=10m         # модель живёт 10 минут
export OLLAMA_GPU_OVERHEAD=536870912 # 512 MB — запас для системы

После добавления — перезапустите оболочку (source ~/.zshrc или новое окно терминала) и затем ollama serve.

MLX-модели: важное отличие

Модели, которые Ollama запускает через MLX (safetensors), не поддерживают truncation. Если контекст превышает лимит — ошибка, а не обрезание, как у GGUF/llama.cpp. Если видите ошибки при длинных диалогах — переключитесь на GGUF-версию модели.


Способ 2: LM Studio (для новичков)

  1. Скачайте LM Studio
  2. В поиске найдите модель (например «Qwen 3.5 4B»)
  3. Нажмите Download → Load → Chat

LM Studio сам покажет размер модели, предложит лучшую квантизацию и настроит бэкенд.


Способ 3: HuggingFace → Ollama (продвинутый)

Модели на HuggingFace в формате transformers — их нельзя запустить напрямую. Нужно:

Модель на HuggingFace → Ollama (есть в библиотеке)    → ollama run
                      → GGUF (конвертирована)         → скачать .gguf → LM Studio / llama.cpp
                      → MLX (конвертирована)           → mlx-lm

Что проще всего: если модель есть на ollama.com/search — просто ollama run <имя>.
Если модели нет на Ollama — ищите GGUF-версию на HuggingFace (в поиске добавьте «GGUF»).


Связки для разработчика

Редактор кода → Continue.dev → Ollama → Qwen 2.5 Coder 7B
    (VS Code /                              (локально,
     JetBrains)                              бесплатно,
                                             приватно)
CLI → Aider → Ollama → Qwen 2.5 Coder 7B
           (автономный      (локально,
            coding агент)    приватно)

Почему не хватает просто Ollama: Ollama — это сервер моделей (как локальный OpenAI API). Чтобы реально кодить файлы, нужен «клиент»: Continue.dev (IDE-плагин), Aider (CLI), или OpenHands (автономный агент). Ollama сам по себе только отвечает на промпты.

Полное сравнение инструментов — в tools.md.


Что дальше

Если хотите Переходите
Понять, какую модель выбрать для своих задач models.md
Настроить производительность под своё железо memory-and-context.md
Кастомизировать модель (Modelfile, API) advanced-setup.md
Сравнить все инструменты (MLX, LM Studio, llama.cpp) tools.md
Вернуться к выбору сценария README.md

В разделе: getting-started · running-models · models · catalog · quantization · memory-and-context · tools · advanced-setup · troubleshooting · apple-silicon
Связанные разделы: Нулевой уровень · AI-агенты · Use Cases
Навигация: ← Локальные модели · ↑ На главную · 🇬🇧 English